← 최신 논문
🤖 AI

ForgeWM: Progressive Causal Training for Few-Step Action-Conditioned Video World Models

ForgeWM은 양방향 비디오 생성기를 효율적이고 저지연인 몇 단계(few-step) 월드 모델로 변환하여 이산 및 연속 게임 컨트롤을 비디오 생성과 정확하게 정렬할 수 있게 하는 점진적 훈련 프레임워크를 도입하며, 인과적 일관성 증류(causal consistency distillation) 및 재생 시간 정교화(replay-time refinement)를 포함한 이중 경로 배포 프로토콜과 같은 기술을 통해 품질과 제어 정확도 측면에서 최첨단 성능을 달성합니다.

원저자: Xinye Li, Lingshuai Lin, Lei Wang, Liuzhou Zhang, Jialin Cui, Qingshan Li, Guanchu Wang, Qingbin Liu, Xi Chen, Jiang Bian, Wai Lam

게시일 2026-08-17
📖 3 분 읽기☕ 가벼운 읽기

원저자: Xinye Li, Lingshuai Lin, Lei Wang, Liuzhou Zhang, Jialin Cui, Qingshan Li, Guanchu Wang, Qingbin Liu, Xi Chen, Jiang Bian, Wai Lam

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신의 컴퓨터가 단순히 영화를 보는 것이 아니라, 당신이 누르는 버튼에 따라 다음에 정확히 어떤 일이 일어날지 예측하며 그 안의 게임을 실제로 플레이하는 세상을 상상해 보십시오. 이것이 바로 현실을 시뮬레이션하려는 인공지능의 한 분야인 **비디오 월드 모델(video world models)**의 영역입니다. 이것은 마치 도서관의 모든 책을 읽은 뒤 다음 장을 즉각적으로 상상해낼 수 있는 매우 똑똑한 이야기꾼과 같습니다. 보통 이러한 이야기꾼들은 길고 상세한 이야기를 쓰는 데는 뛰어나지만, 속도가 느립니다. 만약 당신이 실시간으로 비디오 게임을 하고 싶다면, 다음 문장을 즉시 속삭여 줄 수 있는 이야기꾼이 필요합니다. 그렇지 않으면 게임이 멈추거나 끊기게 됩니다. 문제는 이러한 모델들을 빠르게 만드는 작업이 종종 모델을 서투르게 만든다는 점입니다. 즉, 방금 당신이 말한 내용을 잊어버리거나 캐릭터의 방향을 잘못 잡을 수 있습니다. 이 논문은 AI에게 선명하고 실제 같은 영상을 유지하면서도, 동시에 번개처럼 빠르고 당신의 조작에 완벽하게 순응하도록 가르치는 까다로운 문제를 다룹니다.

여기, 여러 가지 시간 동안 동일한 맛있는 요리를 만들 수 있도록 팀 단위의 보조 셰프들을 훈련시키는 마스터 셰프와 같은 새로운 프레임워크인 ForgeWM이 등장했습니다. 연구진은 어떤 방향(앞 또는 뒤 방향의 시간)으로든 비디오를 생성할 수 있는 강력하고 느리게 움직이는 AI 모델에서 시작했습니다. 그들의 목표는 이 모델을 '몇 단계(few-step)' 모델, 즉 긴 프로세스 대신 단 1단계, 2단계, 또는 4단계의 빠른 단계만으로 다음 몇 초의 비디오를 생성할 수 있는 모델로 바꾸는 것이었습니다. 그들은 단순히 모델의 속도를 높이는 것만으로는 충분하지 않다는 것을 발견했는데, 왜냐하면 AI가 미래를 예측하려고 할 때 자신의 실수로 인해 혼란을 겪기 때문입니다.

이를 해결하기 위해 연구팀은 4단계의 훈련 레시피를 개발했습니다. 첫째, 모델에게 게임 세계의 기초를 가르쳤습니다. 그다음, 깨끗하고 완벽한 예시만을 사용하여(마치 학생이 선생님의 완벽한 글씨체를 베껴 쓰는 것처럼) 모델이 시간을 따라 앞으로 나아가는 법을 배우도록 강제했습니다. 다음으로, 모델이 스스로 연습하게 하되, 실수를 즉각적으로 교정해 주는 안전망을 제공했습니다. 마지막으로, 모델이 시뮬레이션된 게임 속에서 마음껏 뛰어놀게 하여, 실제 게임이 진행되는 방식의 실제 분포와 일치하도록 가르쳤습니다. 그 결과 일련의 특화된 '학생들'이 탄생했습니다: 즉각적이고 낮은 지연 반응을 위한 1단계 모델, 속도와 품질의 균형을 맞춘 2단계 모델, 그리고 더 높은 충실도를 가진 4단계 모델입니다.

이 논문은 이 모델들이 놀라울 정도로 잘 작동한다는 것을 보여줍니다. 마인크래프트(Minecraft)를 이용한 테스트에서, 1단계 모델은 키보드와 마우스 명령을 높은 정확도로 이해하면서도 매끄러운 실시간 게임 플레이에 충분한 72.10 FPS(초당 프레임 수)로 비디오를 생성할 수 있었습니다. 4단계 모델은 훨씬 더 나은 시각적 품질을 만들어냈으며, 의도된 움직임과 조작을 얼마나 잘 따르는지에 있어 다른 최고 수준의 시스템들을 능가했습니다. 흥히, 연구진은 더 나은 품질을 얻기 위해 항상 모델을 다시 훈련시킬 필요는 없다는 것을 발견했습니다. 그들은 "재생 시간 정교화(Replay-Time Refinement)"라는 기술을 도입했습니다: 만약 당신이 빠르고 1단계인 게임 플레이 세션을 기록한다면, 나중에 그 저장된 비디오를 가져와서 동일한 모델에게 '재노이즈(re-noise)' 처리를 요청함으로써, 당신이 이동한 경로를 바꾸지 않고도 디테일을 추가하고 정교하게 다듬도록 할 수 있습니다. 이렇게 정교해진 비디오는 모델이 처음부터 4단계를 거쳐 생성했을 때와 거의 유사한 수준의 품질을 보여주었지만, 당신이 경험했던 것과 정확히 동일한 시점과 장면 구성을 유지했습니다.

연구팀은 또한 이 훈련 방식이 마인크래프트에만 국한되지 않는다는 것을 보여주었습니다. 그들은 동일한 레시피를 게임패드로 제어되는 1인칭 슈팅(FPS) 게임에 적용하여, Halo InfiniteModern Warfare와 같은 게임의 비디오를 성공적으로 생성하는 ForgeWM-CrossFPS라는 모델을 만들었습니다. 논문은 이러한 모델들이 매우 긴 시간 동안(예를 들어 22초 후에 블록 구조를 잃는 등) 어느 정도 성능 저하를 보인다고 언급하고 있지만, 결과적으로 ForgeWM이 제어 가능하면서도 빠른 비디오 월드 모델을 구축할 수 있는 강력하고 유연한 방법을 제공한다는 것을 시사합니다. 저자들은 즉각적인 반응의 필요성과 고품질 비각의 필요성을 분리함으로써, 우리가 최상의 결과물을 얻을 수 있다고 제안합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →