← 최신 논문
💻 computer science

In-Context Forcing: Uncovering Context Effects in Autoregressive Video Diffusion

이 논문은 시간적 일관성과 프레임 간 역동성 사이의 균형을 맞추는 동시에 상당한 추론 가속화를 위한 교차 프레임 병렬 디노이징을 가능하게 하기 위해 노이즈 수준이 감소하는 컨텍스트를 활용하는 비디오 확산을 위한 점진적 자기회귀 패러다임인 인-컨텍스트 포싱(In-Context Forcing)을 소개한다.

원저자: Lingxiao Yang, Liu Liu, Moran Li, Han Feng, Wenjian Cao, Jiangning Zhang, Ye Shi

게시일 2026-08-07
📖 5 분 읽기🧠 심층 분석

원저자: Lingxiao Yang, Liu Liu, Moran Li, Han Feng, Wenjian Cao, Jiangning Zhang, Ye Shi

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

컴퓨터가 텍스트 프롬프트만 읽고도 프레임 단위로 영화를 꿈꿀 수 있는 세상을 상상해 보십시오. 이것은 인공지능이 움직이는 그림을 그리는 법을 배우는 분야인 **비디오 생성(video generation)**의 마법입니다. 이를 위해 많은 현대적 AI 모델은 **디퓨전(diffusion)**이라 불리는 기술을 사용합니다. 디퓨전을 노이즈와 정전기 가득한 진흙 덩어리에서 시작하여 노이즈를 조금씩 깎아내어 선명하고 매끄러운 조각상을 드러내는 조각가의 작업에 비유해 보십시오. 비디오에서는 이것이 프레임 단위로 일어납니다. 하지만 영화 전체를 한꺼번에 만드는 것은 느리고 계산량이 많이 듭니다. 그래서 과학자들은 종-종 **자기회귀(autoregression)**라는 "스트리밍" 방식을 사용하는데, 이는 AI가 한 프레임을 생성하고 그것을 가이드로 삼아 다음 프레임을 만드는 방식으로, 마치 각 주자가 다음 주자에게 바통을 전달하는 릴레이 경주와 같습니다. 큰 과제는 항상 속도와 품질 사이의 균형을 맞추는 것이었습니다. 만약 AI가 이전 프레임을 너무 자세히 본다면 이전 프레임에 너무 의존하게 되어(영상이 멈춘 것처럼 보임), 반대로 너무 멀리 본다면 캐릭터가 글리치(오류)를 일으키거나 사라질 수 있습니다.

이 논문은 이 릴레이 경주에서의 특정 문제, 즉 AI가 쥐고 있는 "바통"이 너무 깨끗하다는 문제를 다룹니다. 현재의 방식들은 노이즈가 없는 완벽하게 깨끗한 프레임을 다음 단계로 전달하는데, 이는 의도치 않게 너무 많은 미세한 디테일을 유출합니다. 이로 인해 AI는 어떻게 움직여야 할지 상상하는 대신 단순히 이전 이미지를 복사하는 지름길을 택하게 됩니다. 이 논문에서 링시아오 양(Lingxiao Yang)과 그의 팀은 **인컨텍스트 포싱(In-Context Forcing)**이라는 영리한 새로운 전략을 제안합니다. 이전 프레임을 결정적인 깨끗한 사진으로 전달하는 대신, "노이즈가 섞인" 버전의 이전 프레임을 전달하는 것입니다. 가이드에 포함된 노이즈의 양을 조절함으로써(직전의 과거는 흐릿하게 유지하여 AI가 움직임을 상상하도록 강제하고, 먼 과거는 더 선명하게 유지하여 일관성을 유지함), 자연스럽게 흐르는 영상을 만들어냅니다. 또한 그들은 AI가 다음 프레임이 끝나기를 기다리지 않고 여러 프레임을 동시에 생성할 수 있는 방법도 찾아냈으며, 이를 통해 전체 과정을 현저히 빠르게 만들었습니다.

"너무 깨끗한" 문제

당신이 친구를 관찰하며 춤을 배우려고 한다고 상상해 보십시오. 만약 친구가 완벽하게 가만히 서 있고 당신이 그들을 너무 가까이서 본다면, 당신은 리듬을 배우는 대신 그들의 정확한 포즈를 그대로 따라 하게 될 수도 있습니다. 이것이 현재의 비디오 AI 모델에서 일어나는 일입니다. 그들은 이전 프레임을 "완전히 디노이징된(완벽하게 깨끗한)" 상태로 바라보며, 이 프레임에는 매우 날카로운 디테일이 많기 때문에 AI는 이전 프레임에 너무 과하게 의존하게 됩니다. AI는 "오, 지난 프레임이 어떻게 생겼는지 정확히 알겠어, 그냥 그대로 복사해야지"라고 생각하며, 장면이 어떻게 진화해야 하는지 파악하는 대신 단순 복사를 선택합니다. 그 결과 캐릭터가 루프에 갇혀 있거나 부자연스럽고 딱딱하게 움직이는 듯한 영상이 만들어집니다. 논문은 이러한 "지름길"이 시간적 역동성(temporal dynamics), 즉 시간이 흐르고 사물이 부드럽게 움직이는 느낌을 망친다고 주장합니다.

"노이즈 가이드" 솔루션

이를 해결하기 위해 저자들은 **인컨텍스트 포싱(In-Context Forcing)**을 도입합니다. 그들은 릴레이 경주의 규칙을 바꿉니다. 다음 단계로 완벽하고 깨끗한 사진을 넘겨주는 대신, 여전히 약간 흐릿한 버전을 넘겨줍니다.

  • 비유: AI를 만화책을 그리는 화가라고 생각해 보십시오. 만약 이전 칸이 완벽하게 완성되어 있다면, 화가는 그것을 그대로 베껴 그릴 수도 있습니다. 하지만 이전 칸이 약간의 얼룩(노이즈)이 있는 거친 스케치라면, 화가는 캐릭터가 다음 칸에서 어떻게 움직여야 할지 머리를 써서 알아내야 합니다.
  • 작동 원리: 시스템은 가이드 프레임에 서로 다른 수준의 "노이즈"를 적용합니다. 현재 프레임 바로 직전의 프레임은 꽤 노이즈가 있는 상태(흐릿한 상태)로 유지하여, AI가 디테일을 복사하는 대신 새로운 움직임을 생성하도록 강제합니다. 더 과거의 프레임들은 더 깨끗하게 유지하여, AI가 전체적인 이야기와 캐릭터의 형태를 기억할 수 있게 합니다. 이는 AI에게 각 단계에서 얼마만큼의 디테일을 발명해야 하는지 정확히 알려주는 "점진적인" 가이드를 생성합니다.

"병렬" 파워업

보통 자기회귀 모델은 단선 도로와 같습니다. 프레임 1이 끝나야 프레임 2가 시작되고, 그다음 프레임 3이 시작됩니다. 이는 느립니다. 논문은 새로운 방식이 완벽하게 깨끗한 이전 프레임에 의존하지 않기 때문에 "비밀 차선"을 열 수 있음을 보여줍니다. 그들은 **교차 프레임 인과적 어텐션(cross-frame causal attention)**을 도입하여 AI가 여러 프레임을 동시에 작업할 수 있도록 합니다.

  • 비유: 화가 팀을 상상해 보십시오. 기존 방식에서는 첫 번째 화가가 벽 하나를 완성할 때까지 두 번째 화가가 기다려야 했습니다. 인컨텍스트 포싱을 사용하면, 팀원 모두가 동의할 수 있는 약간 흐릿한 청사진을 공유하기 때문에 이전 벽이 완벽해질 때까지 기다릴 필요 없이 방 전체를 한꺼번에 칠할 수 있습니다.
  • 결과: 이 병렬 처리 방식은 비디오 생성 속도를 크게 높여줍니다. 논문에 따르면 이 방법은 기존의 최첨단 방식들과 비교했을 때 비디오 생성에 필요한 총 시간을 45.1% 줄였으며, 동시에 영상의 품질도 개선했습니다.

테스트 결과

저자들은 짧은 클립부터 긴 30초 분량의 시퀀스까지 다양한 비디오 생성 작업에 대해 이 방법을 테스트했습니다. 그들은 시각적 품질, 텍스트 설명과의 일치도, 움직임의 역동성 등을 점수화하는 VBench라는 도구를 사용하여 다른 최고 모델들과 비교했습니다.

  • 결과: 인컨텍스트 포싱은 이러한 테스트에서 다른 모든 모델보다 높은 점수를 받았습니다. 구체적으로, 짧은 영상에서 72의 "역동성 정도(Dynamic Degree)" 점수를 기록했으며(차순위 모델은 63), 긴 영상에서는 86.40을 기록하여, 단 40.63점을 받은 롤링 포싱(Rolling Forcing) 방식을 압도적으로 앞질렀습니다.
  • 긴 영상에서 중요한 이유: 논문은 기존 방식들이 영상이 길어질수록 성능이 저하되는 이유가 학습 방식과 수행 방식 사이의 "훈련-테스트 간극(train-test gap)"으로 인해 오류가 누적되기 때문이라고 설명합니다. 인컨텍스트 포싱은 AI가 과거를 복사하는 데 너무 안주하지 않도록 함으로써, 긴 시퀀스에서도 움직임을 다양하고 자연스럽게 유지합니다.

결론

이 논문은 비디오 AI의 모든 문제를 해결했다고 주장하는 것이 아니라, "노이즈"를 단순히 제거해야 할 대상이 아닌 도움이 되는 도구로 취급함으로써 AI가 더 창의적이고 지름길에 덜 의존하도록 가르칠 수 있다는 점을 시사합니다. "노이즈가 섞인" 컨텍스트를 사용하도록 강제함으로써, 모델이 지름길을 택하는 것을 방지하고 결과적으로 더 자연스럽게 움직이며 훨씬 빠르게 생성되는 영상을 만들어냅니다. 저자들은 이 접근 방식이 이론뿐만 아니라 실제에서도 작동함을 입증하며, 더 살아있는 듯한 느낌을 주는 더 빠르고 똑똑한 비디오 생성기를 구축하는 새로운 방법을 제시합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →