← 최신 논문
💻 computer science

MiniWorld: Democratizing the Training of Video World Models from Scratch

이 논문은 블록 인과적 비디오 확산 트랜스포머(block-causal Video Diffusion Transformer)와 플로우 매칭(Flow Matching), 그리고 최적화된 추론 전략을 활용하여, 적은 계산 자원으로도 스트리밍 비디오 월드 모델을 처음부터 엔드 투 엔드로 학습할 수 있게 해주는 가볍고 완전히 재현 가능한 프레임워크인 MiniWorld를 소개한다.

원저자: Yian Zhao, Ruochong Zheng, Hongcan Guo, Yu Yan, Jian Zhang, Jie Chen

게시일 2026-08-04
📖 5 분 읽기🧠 심층 분석

원저자: Yian Zhao, Ruochong Zheng, Hongcan Guo, Yu Yan, Jian Zhang, Jie Chen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 비디오 게임을 하는 법을 가르치려 한다고 상상해 보세요. 단순히 화면을 보여주는 것이 아니라, 세상의 '규칙'을 이해시키고 싶은 것입니다. 만약 로봇이 블록을 밀면, 블록은 미끄러져야 합니다. 만약 점프를 하면, 중력이 로봇을 아래로 끌어당겨야 합니다. 이것이 바로 "월드 모델(World Models)"의 꿈입니다. 단순히 예쁜 그림을 만들어내는 것이 아니라, 행동을 취했을 때 세상이 어떻게 변하는지를 실제로 이해하는 컴퓨터 프로그램 말이죠. 오랫동안 이러한 스마트한 시스템을 구축하는 유일한 방법은, 거대한 사전 학습된 비디오 생성기(마치 초고성능 애니메이션 스튜디오와 같은)를 가져와서 실시간으로 작동하도록 미세 조정하는 것이었습니다. 하지만 이는 마치 느리고 무거운 크루즈선을 민첩한 스피드보트로 바꾸려는 것과 같았습니다. 엄청난 비용과 거대한 컴퓨팅 파워가 필요했으며, 애초에 목적이 다르게 설계되었기 때문에 배가 여전히 제대로 조종되지 않는 경우가 많았습니다.

연구자들이 던진 핵심 질문은 이것입니다: 가볍고, 이해하기 쉬우며, 표준 컴퓨터 서버에서 실행될 수 있는 월드 모델을 밑바닥부터 구축할 수 있을까? 우리는 전체 장면을 한꺼번에 추측하는 것이 아니라, 영화가 앞으로 재생되는 것처럼 프레임 단위로 미래를 예측할 수 있는 시스템이 필요합니다. 만약 도시 규모의 슈퍼컴퓨터 없이도 이 일을 해낼 수 있다면, 로봇, 게임, 가상 현실을 위한 상호작용형 시뮬레이션을 만드는 데 누구나 참여할 수 있는 문이 열릴 것입니다. 이것이 바로 "MiniWorld"라는 논문이 해결하고자 하는 과제입니다.

MiniWorld 솔루션: 한 단계씩 예측하는 예측기

이 논문의 저자들은 MiniWorld라는 새로운 프레임워크를 소개하며, 비디오 월드 모델을 밑바닥부터 훈련시키는 데 반드시 수십억 달러의 예산이 필요하지 않다는 것을 증명했습니다. 기존의 거대한 사전 제작 비디오 생성기를 고치려고 노력하는 대신, 그들은 미래를 일어나는 대로 예측하도록 특별히 설계된 신선하고 효율적인 시스템을 구축했습니다. 이것은 마치 책 전체를 한 번에 편집하려고 하기보다, 각 문장이 이전 문장에만 의존하여 한 문장씩 이야기를 써 내려가는 법을 학생에게 가르치는 것과 같습니다.

작동 원리: "청크(Chunk)" 전략
대부분의 비디오 모델은 미래 전체를 한꺼번에 보려고 하며, 이로 인해 실시간 생성을 시도할 때 혼란을 겪습니다. MiniWorld는 **블록 인과적 어텐션(block-causal attention)**이라는 영리한 트릭을 사용합니다. 만약 당신이 만화책을 읽고 있는데, 현재 페이지와 그 이전 페이지들만 볼 수 있다고 상상해 보세요. 현재 페이지 내에서는 세부 사항을 파악하기 위해 앞뒤로 훑어볼 수 있지만, 다음 페이지를 훔쳐보는 것은 엄격히 금지됩니다. MiniWorld는 비디오를 작은 "청크"(프레임 그룹)로 나눕니다. 이 방식은 모델이 세부 사항을 정확히 파악하기 위해 청크 내에서는 앞뒤로 훑어볼 수 있게 허용하지만, 미래의 청크를 보는 것은 엄격히 차단합니다. 이를 통해 모델이 실제 로봇이 세상을 경험하는 것처럼, 오직 과거에 기반하여 다음 단계를 예측하는 법을 배우도록 강제합니다.

"노이즈(Noise)" 스케줄
비디오 생성을 매끄럽게 만들기 위해, 모델은 마치 흐릿하고 정전기가 가득한 TV 화면을 선명한 사진으로 서서히 바꾸는 것과 같은 플로우 매칭(Flow Matching) 기술을 사용합니다. 보통의 모델들은 전체 비디오를 동일한 속도로 정화하려고 합니다. 하지만 MiniWorld는 **비감소 노이즈 스케줄(non-decreasing noise schedule)**을 사용합니다. 얼굴 그림을 그려주는 줄을 서 있는 사람들을 상상해 보세요. 맨 앞의 사람(과거)은 이미 깨끗하고 선명합니다. 중간에 있는 사람은 약간 흐릿하고, 맨 뒤의 사람(먼 미래)은 여전히 정전기로 덮여 있습니다. 모델은 이 순서대로, 즉 선명한 과거에서 흐릿한 미래로 순차적으로 정화하는 법을 배웁니다. 이는 우리가 실제로 시간을 경험하는 방식과 일치합니다. 과거는 고정되어 있고, 미래는 불확실합니다.

2단계 훈련 과정
저자들은 모델을 그냥 긴 영화에 던져 놓는다고 해서 학습이 이루어지지 않는다는 것을 발견했습니다. 그래서 그들은 MiniWorld를 두 단계로 훈련시켰습니다. 먼저, 움직임과 인과관계의 기본 규칙을 배울 수 있도록 짧은 21프레임 클립(빠른 GIF 같은 것)으로 학습시켰습니다. 짧은 것을 마스터한 후에는, 시작 부분에서 일어난 일을 잊지 않고 이야기를 계속 이어가는 법을 가르치기 위해 더 긴 클립(최대 253프레임)으로 넘어갔습니다. 이는 평평한 진입로에서 자전거 타기를 배운 후에 긴 언덕을 올라가는 연습을 하는 것과 같습니다.

"롤링 메모리(Rolling Memory)"의 마법
긴 비디오에서 발생하는 가장 큰 문제 중 하나는 컴퓨터가 모든 프레임을 기억하려고 할 때 메모리가 부족해진다는 것입니다. MiniWorld는 **롤링 KV 캐시(Rolling KV Cache)**를 통해 이 문제를 해결합니다. 공장의 컨베이어 벨트를 상상해 보세요. 새로운 프레임이 생성되어 "실제"가 되면 벨트 위에 놓입니다. 벨트의 맨 앞쪽에서 가장 오래된 프레임들은 새로운 것을 위한 공간을 만들기 위해 떨어져 나가지만, 가장 중요한 "앵커(anchor)" 프레임은 영원히 그 자리에 머뭅니다. 이를 통해 모델은 컴퓨터가 다운되지 않고도 이론적으로 무한한 길이의 비디오를 생성할 수 있습니다. 왜냐하면 활성 메모리에는 필요한 이력만을 유지하기 때문입니다.

연구 결과
연구팀은 두 가지 매우 다른 작업에 대해 MiniWorld를 테스트했습니다: 로봇 팔의 움직임을 예측하는 작업(DROID 데이터셋)과 카메라가 3D 환경을 통과하는 움직임을 예측하는 작업(RealEstate10K)입니다.

  • 효과가 입증됨: MiniWorld는 기존 모델을 개조하려 했던 이전 방식들보다 물리 법칙과 사용자의 행동을 훨씬 더 잘 따르는 안정적이고 긴 비디오를 생성할 수 있었습니다.
  • 속도가 빠름: 롤링 메모리를 사용하고 청크를 병렬로 처리함으로써, 이들은 기존 방식보다 비디오 생성 속도를 두 배 높여, 초당 약 3프레임에서 7프레임 이상으로 끌어올렸습니다.
  • 접근성이 좋음: 모델 전체(학습 코드와 최종 가중치 포함)를 8개의 그래픽 카드가 장착된 단일 서버에서 단 몇 일 만에 훈련할 수 있습니다. 이는 일반적으로 수주 또는 수개월의 시간과 수천 개의 GPU가 필요한 기존 방식에 비해 비용을 대폭 낮춘 것입니다.

한계점
논문은 MiniWorld가 비디오 생성 분야의 "최종 보스"가 아님을 명시하고 있습니다. 이 모델은 블록버스터 영화에서 볼 수 있는 절대적인 최고 품질의 실사 영화를 만들어내지는 않습니다. 대신, 이는 **재현 가능한 베이스라인(reproducible baseline)**입니다. 저자들은 좋은 결과를 얻기 위해 반드시 거대한 사전 학습 모델을 사용해야 한다는 생각에 명시적으로 반대합니다. 그들은 더 단순하고 투명한 접근 방식이 "사후 훈련(post-training)"이나 증류(distillation)의 복잡함 없이도 안정적이고 장기적인 예측을 달eric 수 있음을 보여주었습니다.

결론
MiniWorld는 상호작용형 AI의 미래가 값비싼 슈퍼컴퓨터라는 유료 결제 장벽 뒤에 갇혀 있을 필요가 없음을 시사합니다. 시간의 흐름(과거에서 미래로)을 존중하고 스마트한 메모리 트릭을 사용하는 시스템을 구축함으로써, 저자들은 누구나 사용할 수 있는 월드 모델 실험 도구를 만들어냈습니다. 그들이 모든 문제를 해결한 것은 아닙니다. 아주 긴 비디오에서는 여전히 오류가 누적됩니다. 하지만 그들은 단순하고 개방적이며 효율적인 레시피만으로도 충분히 목표를 달ilst 수 있음을 증명했습니다. 이는 더 많은 연구자가 기계가 미래를 예측하는 법을 어떻게 배울 수 있는지 탐구하고, 개선하며, 이해할 수 있는 문을 열어주었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →