← 최신 논문
💻 computer science

Context Forcing: Consistent Autoregressive Video Generation with Long Context

이 논문은 긴 문맥을 가진 교사 모델과 Slow-Fast Memory 구조를 채택하여 20초를 초과하는 문맥 길이에 대해 일관되고 실시간적인 비디오 생성을 가능하게 함으로써, 긴 비디오 생성 시 발생하는 학생-교사 간의 불일치 문제를 해결하는 새로운 프레임워크인 "Context Forcing"을 제안한다.

원저자: Shuo Chen, Cong Wei, Sun Sun, Ping Nie, Kai Zhou, Ge Zhang, Ming-Hsuan Yang, Wenhu Chen

게시일 2026-02-06
📖 3 분 읽기☕ 가벼운 읽기

원저자: Shuo Chen, Cong Wei, Sun Sun, Ping Nie, Kai Zhou, Ge Zhang, Ming-Hsuan Yang, Wenhu Chen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 친구와 차례를 주고받으며 길고 연속적인 이야기를 쓰려고 한다고 상상해 보세요. 당신이 한 단락을 쓰면, 친구는 방금 당신이 쓴 내용을 바탕으로 다음 단락을 쓰는 방식입니다.

현재 AI 비디오 생성기들의 문제는 단기 기억력이 매우 짧은 친구와 같다는 점입니다. 이들은 방금 쓴 몇 문장(또는 몇 초의 영상)만을 기억할 수 있습니다. 이야기가 길어질수록, 그들은 주인공이 누구였는지, 배경이 어떻게 생겼는지, 혹은 처음에 시작했던 줄거리가 무엇이었는지 잊어버립니다. 이야기는 점차 흐릿해지며, 캐릭터의 얼굴이 갑자기 변하거나 배경이 다른 무언가로 변형되기도 합니다.

**"컨텍스트 포싱(Context Forcing)"**이라는 이 논문은 AI에게 장기 기억력똑똑한 선생님을 부여함으로써 이 문제를 해결합니다.

작동 원리는 다음과 같습니다.

1. 문제점: "건망증 걸린 선생님"

현재 대부분의 AI 비디오 모델은 "학생-교사(Student-Teacher)" 설정으로 학습됩니다.

  • 학생: 긴 영상을 만드는 법을 배우려는 AI입니다.
  • 선생님: 학생을 지도하는 모델입니다.

문제는 선생님이 5초의 기억력만 가지고 있다는 점입니다. 선생님은 다음 동작을 가르쳐주기 위해 오직 마지막 5초의 영상만을 볼 수 있습니다.

  • 결과: 학생은 과거를 잊는 법을 배웁니다. 만약 영상이 30초 동안 지속된다면, 학생은 25초 전에 무슨 일이 있었는지 전혀 알지 못합니다. 왜냐하면 선생님이 그것을 보지 못했기 때문입니다. 이로 인해 영상이 "표류(drift)"하거나 일관성을 잃게 됩니다.

2. 해결책: "모든 것을 아는 선생님"

저자들은 **컨텍스트 포싱(Context Forcing)**이라는 새로운 방법을 만들었습니다.

  • 새로운 선생님: 저자들은 영상의 전체 이력(20초 이상)을 볼 수 있는 선생님을 훈련시켰습니다.
  • 수업 내용: 이제 학생이 다음 프레임을 생성하려고 할 때, 선생님은 이렇게 말합니다. "기억해, 20초 전에 캐릭터는 빨간 모자를 쓰고 왼쪽으로 걷고 있었어. 그 점을 명심해."
  • 해결: 선생님이 전체 이야기를 알고 있기 때문에, 학생이 훨씬 더 오랫동안 캐릭터와 배경을 일관되게 유지하도록 유도할 수 있습니다.

3. 도전 과제: "과부하 걸린 배낭"

만약 20초짜리 영상의 모든 세부 사항(모든 픽셀, 모든 움직임)을 기억하려고 한다면, 당신의 뇌(또는 컴퓨터)는 압도되어 멈춰버릴 것입니다. 이는 마치 지나온 건물에서 나온 모든 벽돌을 배낭에 담으려고 하는 것과 같습니다. 너무 무겁기 때문입니다.

이를 해결하기 위해 저자들은 스마트 메모리 시스템("Slow-Fast Memory" 구조)을 구축했습니다.

  • 빠른 메모리 (Fast Memory): 직전의 과거(마지막 몇 초)를 보유합니다. 이는 현재 일어나고 있는 일을 붙잡고 있는 당신의 작업 기억과 같습니다.
  • 느린 메모리 (Slow Memory): 이것은 "하이라이트 영상"입니다. AI는 끊임없이 영상을 확인하며 스스로에게 묻습니다: "이 새로운 프레임이 이전 프레임과 충분히 달라 중요한 내용인가?"
    • 장면이 정적이라면(사람이 가만히 서 있는 경우), 불필요한 프레임을 무시하여 공간을 절약합니다.
    • 중요한 일이 발생하면(차가 코너를 돌거나, 얼굴이 돌아가는 등), 그 "키프레임(keyframe)"을 느린 메모리에 저장합니다.
  • 싱크 (The Sink): 이야기의 중심을 잡아주기 위해 영상의 맨 처음 부분을 항상 기억하는 작은 고정 영역입니다.

이 시스템을 통해 AI는 실행하기에 충분히 가벼우면서도, 20초 이상의 영상에서 중요한 줄거리 지점들을 기억할 수 있을 만큼 충분히 묵직한 "배낭"을 짊어질 수 있게 됩니다.

4. 결과: 일관된 영화

이 설정을 통해 AI는 이제 이전의 최첨단 모델들보다 2배에서 10배 더 긴 영상을 일관성을 유지하며 생성할 수 있습니다.

  • 이전에는: 영상이 5초 동안은 훌륭해 보일 수 있지만, 10초가 되면 캐릭터의 얼굴이 변하거나 배경의 색상이 바뀌곤 했습니다.
  • 이제는: 영상이 일관성을 유지합니다. 캐릭터의 얼굴이 그대로 유지되고, 옷도 변하지 않으며, 배경 또한 20초 이상(잠재적으로는 1분까지) 안정적으로 유지됩니다.

요약 비유

긴 영상을 만드는 것을 연극을 연출하는 것에 비유해 보겠습니다.

  • 기존 방식: 감독(선생님)은 무대 위의 마지막 5초만을 봅니다. 연극이 30분쯤 진행되었을 때, 감독은 오프닝 장면을 잊어버렸고, 결국 배우들은 제멋대로 연기를 하기 시작합니다.
  • 컨텍스트 포싱: 감독은 대본과 연극 전체에 대한 기억을 가지고 있습니다. 감독은 배우들에게 이렇게 말할 수 있습니다. "1막에서 파란 컵을 들고 있었던 것을 기억해, 그러니 3막에서도 계속 컵을 들고 있어야 해."
  • 메모리 시스템: 감독은 배우들의 모든 숨소리 하나하나를 다 외우지는 않습니다(그것은 너무 많은 데이터입니다). 대신, 중요한 행동과 변화만을 기억하고 나머지는 즉각적인 참조를 위한 "빠른 버퍼"에 담아둡니다.

이 논문은 이 방법이 긴 AI 영상을 망치는 고질적인 문제인 "망각"과 "표류"를 성공적으로 막아내어, 원래의 프롬프트에 충실하면서도 일관성 있는 1분 길이의 영상을 생성할 수 있게 해준다고 주장합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →