← 최신 논문
🤖 AI

Nano World Models: A Minimalist Implementation of Future Video Prediction

본 논문은 다양한 환경에서 세계 모델 설계 선택에 대한 통제된 과학적 연구를 가능하게 하기 위해 확산 강제에 기반하여 구축된 간결하고 재현 가능한 코드베이스인"나노 월드 모델"을 소개하며, 이는 비디오 예측의 다양한 구성 요소를 통합합니다.

원저자: Siqiao Huang, Partha Kaushik, Michael Chen, Hengkai Pan, Omar Chehab, Fernando Moreno-Pino, Max Simchowitz

게시일 2026-05-26
📖 4 분 읽기☕ 가벼운 읽기

원저자: Siqiao Huang, Partha Kaushik, Michael Chen, Hengkai Pan, Omar Chehab, Fernando Moreno-Pino, Max Simchowitz

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

마법 같은 수정 구슬을 상상해 보세요. 그것은 단순히 미래를 보여줄 뿐만 아니라, 그 미래와 상호작용할 수 있게 해줍니다. "이 블록을 밀면 무슨 일이 일어날까?" 또는 "왼쪽으로 돌면 어떨까?"라고 질문하면, 구슬은 즉시 다음 몇 초간의 비디오를 보여줍니다.

이것이 바로 **나노 월드 모델 (NanoWM)**의 핵심입니다. 이는 연구자들이 로봇과 비디오 게임을 위한 이러한 "수정 구슬"을 구축하고 연구하는 데 도움이 되도록 만든 새로운 오픈 소스 툴킷입니다.

다음은 일상적인 비유를 사용하여 작동 방식과 발견된 내용을 간략히 정리한 것입니다:

1. 문제: 너무 많은 다른 레시피

현재 이러한 "미래 예측" 모델을 구축하는 것은 모든 제빵사가 다른 오븐, 다른 계량컵, 그리고 다른 비밀 재료를 사용하여 케이크를 굽는 것과 같습니다. 어떤 이들은 거대하고 비싼 산업용 오븐 (산업용 모델) 을 사용하는 반면, 다른 이들은 작고 고장 난 토스터를 사용합니다. 모두가 다르게 하므로, 왜 한 케이크가 다른 케이크보다 더 맛있는지 인지 알기 어렵습니다. 밀가루 때문일까요? 오븐 때문일까요? 아니면 제빵사 때문일까요?

NanoWM범용 모듈식 주방과 같습니다. 이는 모두에게 동일한 도구 세트, 동일한 계량컵, 동일한 오븐 설정을 제공합니다. 이렇게 하면 "설탕을 더 넣는 것" (특정 설계 선택) 이 케이크를 더 좋게 만드는지 테스트하고 싶을 때, 오븐이 고장 났다는 걱정 없이 공정하게 수행할 수 있습니다.

2. 핵심 엔진: "확산 강제 (Diffusion Forcing)"

이 논문은 확산 강제라는 기술을 사용합니다. 이는 점점 선명해지는 흐릿한 사진과 같습니다.

  • 일반적으로 모델은 한 번에 전체 미래 장면을 추측하려 하는데, 이는 어렵습니다.
  • 확산 강제를 사용하면 모델이 단계별로 미래를 추측합니다. 매우 흐릿하고 잡음이 많은 추측으로 시작하여 마치 선명한 비디오 프레임처럼 보일 때까지 서서히 "잡음을 제거"합니다.
  • "강제" 부분은 비디오의 서로 다른 부분을 서로 다른 선명도 단계에서 처리할 수 있음을 의미합니다. "현재"는 선명하게 유지하면서 "미래"는 여전히 약간 흐릿하게 둔 다음, 그것도 선명하게 만들 수 있습니다. 이는 길고 연속적인 비디오에 매우 적합합니다.

3. "레고" 디자인 (모듈성)

NanoWM 의 가장 큰 특징은 레고 블록처럼 구축되었다는 점입니다. 서로 다른 조각을 연결하여 어떤 일이 일어나는지 확인할 수 있습니다:

  • 뇌 크기: 작은 뇌 (4 천만 개 파라미터) 를 거대한 뇌 (8 억 3 천만 개 파라미터) 로 교체하여 항상 큰 것이 더 좋은지 확인할 수 있습니다.
  • 언어: 모델이 데이터의 서로 다른 "언어"를 배우도록 가르칠 수 있습니다. 일부 모델은 원시 픽셀 (카메라처럼) 을 보는 반면, 다른 모델은 "개념" (형태와 객체를 이해하는 인간처럼) 을 봅니다.
  • 조작: 모델이 사용자의 지시 (동작) 를 어떻게 듣는지 변경할 수 있습니다. 단순히 옆에 메모를 추가할까요? 아니면 사용자의 지시에 따라 전체 성격을 바꿀까요?

4. 발견된 내용 (연구 결과)

연구자들은 이 툴킷을 사용하여 많은 실험을 수행했고 몇 가지 놀라운 사실을 발견했습니다:

  • 크기가 항상 정답은 아니지만 도움이 됩니다: 일반적으로 더 큰 모델 ("XL" 버전) 이 작은 모델보다 미래를 더 정확하게 예측했습니다.
  • "언어"가 매우 중요합니다: 이는 큰 놀라움이었습니다. 그들은 "의미론적" 언어 (객체의 형태와 의미를 이해하는 DINO 또는 V-JEPA 등) 를 사용하여 모델을 가르쳐 보는 것과 "시각적" 언어 (그림이 어떻게 생겼는지 기억하는 VAE 등) 를 사용하여 모델을 가르쳐 보는 것을 시도했습니다.
    • 결과: "시각적" 언어를 학습한 모델은 계획 수립에 탁월했습니다. 그들은 블록을 목표 지점으로 밀어내는 방법을 파악할 수 있었습니다.
    • 실패: "의미론적" 언어를 학습한 모델 (개념을 "이해"하는 모델) 은 계획 수립에 완전히 실패했습니다. 비록 그들이 똑똑해 보였음에도 불구하고, 블록을 움직이는 방법을 파악하지 못했습니다. 사실, 로봇이 물건을 움직이는 법을 배우려면 객체가 무엇인지가 아니라 픽셀이 정확히 어떻게 생겼는지 기억해야 한다는 것이 밝혀졌습니다.
  • "드리프트" 문제: 모델에게 매우 먼 미래 (예: 50 초 후) 를 예측하도록 요청하면, 모델은 자신의 예측에 약간 "취한" 상태가 되기 시작합니다. 처음 몇 초는 완벽하지만, 끝이 가까워질수록 세부 사항이 흐릿하고 기이해집니다. 논문은 각 프레임에 대해 모델에게 더 많은 "생각" 시간 (더 많은 샘플링 단계) 을 주면 더 오래 선명하게 유지된다는 것을 발견했습니다.

5. 이를 통해 무엇을 할 수 있나요?

논문은 이러한 모델을 사용하는 두 가지 주요 방법을 강조합니다:

  • 시뮬레이터: 실제 수행하기 전에 계획을 테스트하는 데 모델을 사용할 수 있습니다. "이 경로를 시도하면 벽에 부딪힐까요?" 모델은 비디오를 시뮬레이션하여 확인하게 합니다.
  • 3D 빌더: 모델이 생성한 비디오를 가져와 3D 장면으로 변환할 수 있습니다. 마치 영화를 비디오 게임 세계로 바꾸어 주변을 돌아다닐 수 있게 하는 것과 같습니다.

결론

Nano 월드 모델은 세계에서 가장 크고 비싼 AI 를 구축하려는 것이 아닙니다. 대신, 그것은 과학 실험실을 구축하는 것입니다. 이는 연구자들이 추측을 멈추고 테스트를 시작할 수 있게 해주는 무료 오픈 소스 키트입니다. 이는 어떤 "재료"가 월드 모델을 똑똑하게 만들고 어떤 것이 실패하게 만드는지 정확히 이해하도록 도와주며, 이를 통해 미래에 더 나은 로봇과 시뮬레이터를 구축할 수 있게 합니다.

연구자들은 모든 코드, 데이터, 사전 훈련된 모델을 무료로 공개하여 전 세계가 레고 블록을 가지고 놀고 AI 의 미래를 구축하는 데 함께할 수 있도록 초대했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →