← 최신 논문
💻 computer science

AdaState: Self-Evolving Anchors for Streaming Video Generation

AdaState는 자기 진화형 적응형 잠재 앵커를 도입하여 자기회귀 비디오 확산 모델의 정적 첫 프레임 참조를 대체함으로써, 시간을 상대적으로 처리하고 생성 과정에 재귀를 통합하여 자연스러운 장면 진행과 풍부한 움직임을 가능하게 합니다.

원저자: Yusuf Dalva, Pinar Yanardag

게시일 2026-05-29
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yusuf Dalva, Pinar Yanardag

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

친구에게 길고 연속적인 이야기를 들려주려는데, 한 번에 세 문장씩만 짧게 말할 수 있다고 상상해 보세요. 매번 새로운 말뭉치를 시작할 때마다 친구가 혼란스러워하지 않도록 이야기의 아주 처음에 무슨 일이 있었는지 상기시켜 주어야 합니다.

AI 비디오 생성 세계에서는 정확히 이런 일이 발생합니다. AI 는 프레임 단위 (또는 작은 덩어리 단위) 로 비디오를 구축하며, 이야기의 일관성을 유지하기 위해 자신이 만든 첫 번째 프레임에 크게 의존합니다.

문제: "얼어붙은 닻"

이 논문은 첫 번째 프레임에 대한 이러한 의존성을 "정적 닻 (static anchor)"이라고 부릅니다. 움직이지 않는 등대라고 생각하면 됩니다.

  • 현재 작동 방식: AI 는 첫 번째 프레임을 궁극적인 진실로 취급합니다. 나중에 이야기가 얼마나 변하든, AI 는 다음 행동을 결정하기 위해 그 첫 번째 프레임을 계속 돌아봅니다.
  • 결함: AI 가 그 첫 번째 프레임에 너무 집착하기 때문에 갇히게 됩니다. 만약 AI 에게 도시를 날아다니는 카메라의 비디오를 만들어 달라고 요청하면, AI 는 도시가 첫 초와 정확히 동일하게 유지되도록 너무 걱정하여 카메라가 움직이거나 건물이 변하는 것을 허용하지 않습니다.
  • 결과: 비디오는 카메라가 한곳에 고정된 슬라이드쇼처럼 보이거나, 더 나쁘게는 AI 가 새로운 장면을 오래되고 얼어붙은 레이아웃에 맞추려고 애쓰면서 사물의 기이한 복제본을 환각처럼 만들어냅니다. 이는 뒷유리만 바라보며 운전하는 것과 같습니다. 어디로 가고 있는지 볼 수 없습니다.

해결책: AdaState ("자기 진화하는 닻")

저자 유수프 달바 (Yusuf Dalva) 와 피나르 야나르다그 (Pinar Yanardag) 는 AdaState라는 새로운 방법을 제안합니다. 얼어붙은 등대 대신 AI 에게 살아 숨 쉬는 기억을 부여하는 것입니다.

다음은 간단한 비유를 사용한 AdaState 의 작동 방식입니다:

1. "유령" 캐릭터
AI 가 이야기를 쓴다고 상상해 보세요. 보통 AI 는 책상에 주인공의 사진을 두고 그것을 절대 바꾸지 않습니다. AdaState 를 사용하면 AI 는 "유령 캐릭터 (적응 상태)"를 생성합니다.

  • 이 유령은 관객에게 결코 보이지 않습니다 (최종 비디오에는 렌더링되지 않습니다).
  • 그러나 이야기의 모든 단계에서 AI 는 방금 일어난 일에 따라 이 유령을 업데이트합니다.
  • 유령은 장면의 "본질"을 앞으로 운반합니다. 이야기에서 해가 지면, 유령 자체가 보이는 캐릭터는 아니지만 유령은 일몰을 반영하도록 업데이트됩니다.

2. 재귀 (루프)
일반적인 비디오 AI 에서 "기억"은 과거 프레임의 목록일 뿐입니다. AdaState 에서는 기억이 과정이 됩니다.

  • 릴레이 경주를 생각해 보세요. 첫 번째 주자 (첫 번째 프레임) 가 두 번째 주자에게 배턴을 넘깁니다. 하지만 AdaState 에서는 배턴이 달리는 동안 모양이 변합니다.
  • AI 는 단순히 과거를 복사하지 않고, 매 단계마다 닻을 재창조합니다. "지금 우리가 어디에 있는지를 고려할 때, 이야기가 자연스럽게 진행되도록 '닻'이 어떻게 보여야 할까?"라고 묻는 것입니다.
  • 이를 통해 카메라는 미끄러지듯 움직이고, 조명은 변하며, 장면은 진화할 수 있지만 여전히 하나의 연속된 이야기처럼 느껴집니다.

3. 장기 훈련
논문은 또한 이러한 모델을 훈련할 때 AI 가 비디오의 시작 부분 (이 부분이 쉽고 깔끔하기 때문) 에 너무 집중하고, 실수가 쌓이는 끝부분은 무시하는 경향이 있음을 발견했습니다.

  • 해결책: 그들은 "Horizon-Weighted DMD"라는 특수 훈련 기법을 사용했습니다. 시험의 마지막 부분의 답안에 더 많은 점수를 주기로 결정한 교사를 상상해 보세요. 이는 AI 가 시작뿐만 아니라 장기적인 일관성에도 주의를 기울이도록 강제합니다.

결과

이 새로운 방법을 테스트했을 때:

  • 기존 AI: 매우 안정적이지만 지루한 (움직임이 없는) 비디오를 만들거나, 매우 역동적이지만 몇 초 후 무의미한 것으로 무너져 내리는 비디오를 만들었습니다.
  • AdaState: 안정적이면서도 역동적인 비디오를 만들었습니다. 카메라는 30 초 동안 해안선을 날아다니며 새로운 지형과 변하는 조명을 드러냈지만, 비디오가 얼어붙거나 결함투성이의 소란으로 변하지 않았습니다.

요약

이 논문은 길고 흐름이 있는 비디오를 만들기 위해서는 첫 번째 프레임을 영구적인 규칙집으로 취급하는 것을 멈춰야 한다고 주장합니다. 대신 이야기가 진행됨에 따라 스스로 업데이트하는 "자기 진화하는 닻"이 필요합니다. AdaState 는 AI 가 지속적으로 갱신하는 숨겨진 특수한 보이지 않는 기억 슬롯을 통해 이를 수행하여, 비디오가 정체성을 잃지 않으면서 자연스럽게 앞으로 나아갈 수 있게 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →