← 최신 논문
💻 computer science

4Director: Controlling Video World Models with Rigid 3D Geometry

이 논문은 명시적인 4D 강체 기하 구조와 모션 어댑터(Motion Adapter)를 생성 조건으로 활용하여 정밀한 카메라 및 객체 제어를 달성하는 비디오 월드 모델인 4Director를 소개하며, 이는 새로운 데이터셋과 평가 지표를 통해 기존 방법들을 능가하는 시각적 품질과 모션 일관성을 입증하였다.

원저자: Wei Cao, Hao Zhang, Vikram Voleti, Yuqun Wu, Mallikarjun B R, Shimon Vainer, Mark Boss, Yaoyao Liu

게시일 2026-10-02
📖 3 분 읽기☕ 가벼운 읽기

원저자: Wei Cao, Hao Zhang, Vikram Voleti, Yuqun Wu, Mallikarjun B R, Shimon Vainer, Mark Boss, Yaoyao Liu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

컴퓨터가 단 한 장의 사진을 보고 그 정지된 순간으로부터 영화가 상영되는 것을 상상할 수 있는 세상을 상상해 보십시오. 이것이 바로 비디오 월드 모델(video world models)이 약속하는 미래입니다. 이는 기계가 장면이 시간에 따라 어떻게 변하는지를 예측하도록 학습하는, 빠르게 발전하고 있는 인공지능 분야입니다. 수년 동안 연구자들은 컴퓨터가 물리 법칙과 운동 법칙을 스스로 학습하기를 바라며, 수천 시간의 영상을 보여줌으로써 이 시스템들이 움직이는 이미지를 생성하도록 가르쳐 왔습니다. 그러나 중대한 장애물이 남아 있었습니다. 이러한 컴퓨터들이 현실적인 움직임을 만드는 능력은 향상되고 있지만, 사용자의 지시를 따르는 데는 매우 서툴다는 점입니다. 만약 사용자가 특정 물체가 회전하거나 카메라가 모퉁이를 돌아 휘감아 들어가는 것을 원한다면, 컴퓨터는 종종 그 지시를 무시하거나, 그럴듯해 보이지만 기하학적으로는 틀린 결과를 만들어냅니다. 물체가 멀어지는 대신 크기가 줄어들거나, 카메라가 움직일 때 물체가 유령처럼 흐릿하게 번져 보일 수도 있습니다. 핵심적인 과제는 인간의 명확한 3차원적 의도와, 평면적인 2차원 패턴에 기반해 추측하려는 컴퓨터의 성향 사이의 간극을 메우는 것이었습니다.

Stability AI와 일리노이 대학교 어바나-샴페인 캠퍼스의 연구진은 이 문제를 해결하기 위해 '4Director'라고 불리는 새로운 접근 방식을 선보였습니다. 4Director는 컴퓨터에게 물체의 경로를 추측하도록 요구하는 대신, 비디오 생성이 시작되기도 전에 컴퓨터에게 장면의 완전한 3차원 지도를 제공합니다. 이 시스템에서 시작 사진 속의 모든 물체는, 설령 원래 사진이 앞모습만 보여주더라도 앞, 뒤, 옆면을 모두 가진 찰흙 인형을 만드는 조각가처럼, 견고한 디지털 3D 모델로 재구성됩니다. 배경 또한 공간상의 점 구름(point cloud)으로 들어 올려집니다. 일단 이 디지털 세계가 구축되면, 사용자는 마치 영화 감독이 샷을 계획하듯 카메라의 경로와 물체의 경로를 그릴 수 있습니다. 그러면 컴퓨터는 이 견고한 3D 모델들을 정해진 경로를 따라 완벽한 강체(rigidity)를 유지하며 이동시키며, 이를 통해 물체가 회전할 때는 하나의 통일된 단위로서 회전하고, 카메라가 움직일 때는 배경이 올바르게 변화하도록 보장합니다.

이 혁신의 핵심은 이 견고한 골격이 최종 비디오를 안내하는 방식에 있습니다. 시스템은 먼저 장면의 단순한 흑백 깊이 지도(depth map)를 렌더링하는데, 이는 물체들이 경로를 따라 움직임에 따라 모든 표면이 카메라로부터 떨어진 거리를 보여줍니다. 이 깊이 지도는 모든 픽셀이 시간과 공간 속에서 정확히 어디에 있어야 하는지를 정의하는 엄격한 비계(scaffold) 역할을 합니다. 연구진이 '모션 어댑터(Motion Adapter)'라고 부르는 특화된 훈련 모듈은 이 견고한 골격을 가져와 누락된 세부 사항들을 채워 넣습니다. 이 모듈은 고정된 3D 구조 위에 표면 질감, 조명, 그리고 사람의 팔이 흔들리거나 깃발이 펄럭이는 것과 같은 미세하고 비강체적인 움직임을 그려내는 법을 학습합니다. 이를 통해 최종 비디오는 위치와 방향에 대한 사용자의 정확한 지시를 따르는 동시에, 여전히 자연스럽고 살아있는 장면처럼 보이게 됩니다.

이 시스템이 작동하는 법을 가르치기 위해, 연구진은 기존의 어떤 비디오 모음집에도 필요한 3D 지도가 포함되어 있지 않았기에 방대한 양의 새로운 데이터셋을 구축해야 했습니다. 그들은 2만 개 이상의 비디오 클립을 역설계하여 각각을 카메라 경로와 물체 경로를 가진 견고한 3D 장면으로 변환하는 자동화된 파이프라인을 구축했습니다. 'RealCOD-Rigid'라고 명명된 이 데이터셋을 통해 모션 어댑터는 실세계의 세부 사항이 갖는 유연한 움직임과 단단한 물체의 강체 운동 사이의 차이점을 학습할 수 있었습니다. 결과는 기존 방식보다 눈에 띄는 개선을 보여주었습니다. 테스트에서 4Director는 물체가 완전히 뒤를 돌아보거나 카메라 시야에서 벗어났다가 다시 나타나는 상황에서도, 물체의 정체성을 잃거나 배경 속으로 번져버리는 기존 시스템들의 실패와 달리, 물체를 일관되게 유지하고 인식 가능하게 만드는 능력을 입증했습니다.

연구진은 단순히 물체가 올바른 위치에 있는지 확인하는 것만으로는 부족하다는 점을 인식하고, 물체 자체가 다른 무언가로 변해버리지 않았는지까지 확인하는 새로운 성공 측정 방식을 개발했습니다. 그들의 새로운 지표는 물체의 위치와 정체성을 모두 체크하여, 코너를 도는 자동차가 여전히 동일한 자동차로 보이는지를 보장합니다. 다른 선도적인 비디오 생성 도구들과 비교했을 때, 4Director는 일관되게 더 높은 시각적 품질과 장면 내 카메라 및 물체에 대한 훨씬 더 정확한 제어력을 보여주었습니다. 이 시스템은 컴퓨터에게 비디오 생성을 시작하기 전 세상에 대한 명확한 3차원적 이해를 제공함으로써, 이전에는 도달할 수 없었던 수준의 제어를 달 수 있음을 보여주었으며, 사용자가 전문 영화감독과 같은 정밀함으로 장면의 흐름을 연출할 수 있게 해줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →