← 최신 논문
🤖 AI

Stream4D: 4D-Consistency for Streaming Autoregressive Diffusion Video Models

Stream4D는 정적 비평가(static critics)를 대체하기 위해 피드포워드 4D 재구성 보상과 모션 프라이어를 도입함으로써 스트리밍 자기회귀 확산 비디오 모델을 향상시키며, 이를 통해 기하학적 드리프트를 방지하고 장기 비디오 생성에서 일관되고 자연스러운 움직임을 보존합니다.

원저자: Yuanhao Ban, Jiaqi Feng, Hengguang Zhou, Xiaohuan Pei, Justin Cui, Cho-Jui Hsieh

게시일 2026-08-21
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yuanhao Ban, Jiaqi Feng, Hengguang Zhou, Xiaohuan Pei, Justin Cui, Cho-Jui Hsieh

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

컴퓨터가 마치 살아있는 세계처럼 실시간으로, 프레임 단위로 영화를 꿈꾸듯 만들어내도록 가르치는 것을 상상해 보십시오. 수년 동안 연구자들은 단순한 텍스트 설명을 통해 비디오를 생성할 수 있는 인공지능 모델을 구축해 왔습니다. 이 시스템들은 이야기꾼이 이야기의 다음 문장을 추측하는 것과 매우 유사하게, 시퀀스의 다음 순간을 예측함으로써 작동합니다. 이러한 모델들이 비디오를 끝없이 스트리밍하도록 설계될 때, 그들은 독특한 문제에 직면합니다. 이야기가 길어질수록 등장인물과 사물들이 종종 서로 멀어지거나, 형태를 잃거나, 부자연스러운 정지 상태로 굳어버리는 현상이 발생합니다. 컴퓨터는 세계의 기하학적 구조를 일관되게 유지하는 데 어려움을 겪으며, 이로 인해 자동차가 갑자기 긴 리본처럼 늘어나거나 사람이 완전히 사라지는 일이 발생합니다. 이 문제는 AI에게 길고 연속적인 장면을 생성하도록 요청할 때 특히 두드러지는데, 한 순간의 작은 오류가 쌓여 전체적인 환상을 망쳐버리기 때문입니다.

이를 해결하기 위해 UCLA와 칭화 대학교의 연구진은 Stream4D라고 불리는 새로운 방법을 개발했습니다. 그들의 연구는 현재의 AI 모델들이 가진 특정 결함을 다룹니다. 드리프트(drifting) 문제를 해결하려는 이전의 시도들은 비디오를 경직되고 변하지 않는 3D 객체로 취급하는 기술에 의존했습니다. 컴퓨터는 비디오를 정적인 조각상처럼 재구성하려고 시도했으며, 만약 비디오가 움직이면 시스템은 그 움직임을 오류로 간주했습니다. 이는 역설적인 동기를 부여했습니다. 즉, AI가 높은 점수를 받기 위한 가장 안전한 방법은 아예 움직이지 않는 것이라고 학습하게 만든 것입니다. 그 결과, 카메라는 팬(pan)할 수 있지만 그 안의 사람과 사물은 박물관의 조각상처럼 제자리에 얼어붙은 채 움직이지 않는 비디오가 만들어졌습니다. 연구진은 믿을 만한 세계를 만들기 위해서는 AI가 물체가 움직이고 변하면서도 여전히 동일한 물체로 남아 있을 수 있다는 점을 이해해야 한다는 사실을 깨달았습니다.

연구진은 경직된 3D 관점을 역동적인 4D 관점으로 대체하는 새로운 학습 방식을 도입했습니다. AI에게 정적인 조각상을 만들라고 요구하는 대신, 시간이 흐름에 따라 진화하는 살아있는 장면을 만들라고 요구하는 것입니다. 그들은 캐릭터가 달리거나 자동차가 주행하는 동안에도 형태와 정체성을 유지하며 움직이는 점들의 구름(cloud of moving points)으로 비디오를 재구성할 수 있는 특수 도구를 사용합니다. 이 새로운 시스템은 AI에게 움직임을 처벌하는 대신, 일관된 움직임을 생성하도록 보상합니다. 움직임이 떨리거나 혼란스럽지 않고 자연스럽게 보이도록 하기 위해, 적절한 양의 움직임을 장려하여 영상이 너무 정적이거나 너무 무질서해지는 것을 방지하는 두 번째 레이어의 가이드를 추가했습니다. 세 번째 구성 요소는 시각적 앵커 역할을 하여, 생성된 이미지가 아름답고 원래의 스타일을 유지하도록 보장합니다.

다양한 종류의 비디오 생성 모델에 테스트했을 때, 이 새로운 방식은 훨씬 더 나은 결과를 보여주었습니다. 최대 10초 길이의 비디오를 포함한 실험에서, 이 새로운 접근 방식은 3D 재구성의 명확성과 일관성을 상당한 수준으로 향상시켰으며, 일부 모델은 품질 지표에서 거의 7데시벨(decibels)에 가까운 개선을 보였습니다. 더 중요한 것은, 인간 평가자와 자동화된 심사위원들이 이 비디오들을 선호했다는 점인데, 이는 피사체가 온전하게 유지되며 자연스럽게 움직였기 때문입니다. 장면이 멈추거나 형체가 왜곡되는 경우가 많았던 기존 방식과 달리, Stream4D는 캐릭터들이 형태를 잃지 않고 달리고, 점프하고, 환경과 상호작용하도록 유지했습니다. 연구진은 이 기술이 다양한 유형의 AI 백본(backbone)에서 작동한다는 것을 발견했으며, 이는 장기적인 비디오 일관성 문제에 대한 강력한 해결책임을 시사합니다.

이 연구는 정적인 3D 재구성이 비디오 모델을 훈련하는 데 충분하다는 생각을 명시적으로 부정하며, 오히려 그러한 접근 방식이 움직임의 품질을 해친다는 것을 입증했습니다. 저자들은 훈련 시스템이 움직임을 처벌할 때, AI가 점수를 극대화하기 위해 장면을 고정하는 법을 배운다는 것을 보여주었습니다. 역동적인 변화를 이해하는 시스템으로 전환함으로써, 그들은 이러한 추세를 되돌릴 수 있었습니다. 결과는 수백 개의 프롬프트와 여러 모델 아키텍처에 걸쳐 측정되었으며, 이는 해당 방법이 효과적이라는 강력한 증거를 제공했습니다. 연구진은 자신들의 시스템이 여전히 카메라의 움직임에 대한 특정 가정에 의존하고 있다는 점을 언급했지만, 객체의 정체성과 움직임을 보존하는 데 있어의 개선은 명확합니다. 이 연구는 세상이 실제처럼 느껴지고, 일관되며, 살아있는 것처럼 느껴지는 긴 상호작적인 비디오 스트림을 생성할 수 있는 AI를 향한 실질적인 경로를 제시합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →