← 최신 논문
💻 computer science

World-in-World: World Models in a Closed-Loop World

이 논문은 폐쇄 루프 임보디드(embodied) 환경에서 생성형 월드 모델을 벤치마킹하기 위한 최초의 오픈 플랫폼인 "World-in-World"를 소개하며, 제어 가능성, 행동-관측 스케일링, 그리고 추론 시간 연산량이 시각적 품질 자체보다 작업 성공에 더 결정적이라는 점을 밝힙니다.

원저자: Jiahan Zhang, Muqing Jiang, Nanru Dai, Taiming Lu, Arda Uzunoglu, Shunchi Zhang, Yana Wei, Jiahao Wang, Vishal M. Patel, Paul Pu Liang, Daniel Khashabi, Cheng Peng, Rama Chellappa, Tianmin Shu, Alan Y
게시일 2026-08-18
📖 3 분 읽기☕ 가벼운 읽기

원저자: Jiahan Zhang, Muqing Jiang, Nanru Dai, Taiming Lu, Arda Uzunoglu, Shunchi Zhang, Yana Wei, Jiahao Wang, Vishal M. Patel, Paul Pu Liang, Daniel Khashabi, Cheng Peng, Rama Chellappa, Tianmin Shu, Alan Yuille, Yilun Du, Jieneng Chen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보십시오. 한 로봇이 특정 물체를 찾기 위해 어지러운 방을 탐색하려고 합니다. 성공하기 위해서 로봇은 단순히 눈앞에 보이는 것에 반응하는 것만으로는 부족합니다. 한 걸음 앞으로 나아가거나, 왼쪽으로 돌거나, 손을 뻗으면 어떤 일이 일어날지 예측해야 합니다. 즉, 세계에 대한 정신적 모델, 즉 실제로 일어나기 전에 미래를 시뮬레이션할 수 있는 방법이 필요합니다. 수년 동안 과학자들은 움직이는 장면의 놀랍도록 사실적인 영상을 생성할 수 있는 인공지능 시스템을 구축해 왔습니다. 흔히 '월드 모델(world models)'이라 불리는 이 시스템들은 자동차가 길을 따라 운전하거나 컵이 탁자에서 떨어지는 모습을 실제 영상처럼 보이게 할 만큼 뛰어난 시각적 충실도로 이미지를 만들어낼 수 있습니다. 그러나 결정적인 질문 하나가 해결되지 않은 채 남아 있었습니다. 과연 이 시각적 아름다움이 로봇이 더 나은 결정을 내리는 데 실제로 도움이 되는가 하는 점입니다. 지금까지 이 분야는 생성된 영상이 얼마나 예쁘게 보이는지에 따라서만 모델을 판단하는 벤치마크에 의해 지배되어 왔으며, 그 영상이 실제 과업을 수행하려는 로봇에게 유용한지는 무시되었습니다.

한 연구팀은 시각적 완벽함에서 실용적 유용성으로 초점을 전환하는 '월드-인-월드(World-in-World)'라는 새로운 접근 방식을 도입했습니다. 그들은 "이 영상이 얼마나 좋아 보이는가?"라고 묻는 대신, "이 영상이 에이전트의 성공을 돕는가?"라고 묻습니다. 연구진은 인공 에이전트가 네 가지 뚜렷한 물리적 과업을 수행해야 하는 폐쇄 루프(closed-loop) 테스트 플랫폼을 구축했습니다. 이 과업들은 적극적으로 주변을 살펴 숨겨진 물체를 찾는 것, 단 하나의 참조 이미지를 바탕으로 특정 위치로 이동하는 것, 환경을 탐색한 후 3D 환경에 관한 질문에 답하는 것, 그리고 물체를 움직이기 위해 로봇 팔을 제어하는 것입니다. 이 설정에서 월드 모델은 시뮬레이터 역할을 합니다. 로봇이 물리적 행동을 실행하기 전에, 모델을 사용하여 여러 가지 가능한 미래를 상상합니다. 그런 다음 로봇은 이 상상된 시나리오들을 평가하여 성공으로 이어질 가능성이 가장 높은 경로를 선택함으로써, 실제로 행동하기 전에 효과적으로 앞을 내다보며 생각합니다.

이 새로운 평가 방식의 결과는 시각적 품질과 과업 수행 능력 사이의 놀라운 괴리를 드러냈습니다. 연구진은 믿기지 않을 정도로 고해상도이며 미학적으로 아름다운 클립을 생성하는 최첨단 비디오 생성기들을 포함하여 광범위한 모델들을 테스트했습니다. 그들은 높은 시각적 품질이 로봇의 과업 성공을 보장하지 않는다는 것을 발견했습니다. 모델이 방의 아름다운 영상을 생성할 수는 있지만, 만약 그 영상 속의 물리학이 약간 어긋나 있거나 로봇이 시뮬레이션 내에서 카메라 움직임을 정밀하게 제어할 수 없다면, 로봇은 잘못된 결정을 내리게 됩니다. 실제로 이 연구는 제어 가능성(controllability), 즉 특정하고 낮은 수준의 동작으로 시뮬레이션을 조종할 수 있는 능력이 순수한 이미지의 아름다움보다 훨씬 더 중요하다는 것을 보여주었습니다. "두 걸음 앞으로 이동하라"는 명령에 신뢰성 있게 반응하는 모델이, 멋지지만 제어할 수 없는 영상을 만드는 모델보다 더 가치 있습니다.

나아가, 연구팀은 단순히 더 강력한 사전 학습된 비디오 생성기를 사용하는 것이 로봇의 성능을 향상시키는 최선의 방법이 아니라는 것을 발견했습니다. 대신, 그들은 표준 비디오 생성기를 가져와 로봇의 환경과 동작에 특화된 비교적 적은 양의 데이터로 미세 조정(fine-tuning)하는 것이 훨씬 더 나은 결과를 낸다는 것을 발견했습니다. 포스트 트레이닝(post-training)이라고 알려진 이 과정은 모델의 예측을 로봇이 거주하는 물리적 세계의 특정 규칙에 맞춥니다. 데이터 또한 명확한 스케일링 법칙을 보여주었습니다. 즉, 미세 조정 과정에서 모델이 동작과 관찰의 사례를 더 많이 접할수록 로봇의 성공을 돕는 능력이 향려된다는 것입니다. 또한, 시스템에 더 많은 계산 시간을 부여하여(결정을 내리기 전 더 많은 잠재적 미래를 시뮬레이션하도록 허용하여) 성공률을 크게 높일 수 있다는 점도 밝혀졌습니다.

이 연구는 월드 모델이 로봇 공학 및 체화된 AI(embodied AI)에서 진정으로 유용해지려면, 결함 없는 시각물을 만드는 능력이 아니라 의사결정을 지원하는 능력을 기준으로 판단되어야 한다고 결론짓습니다. 현재의 모델들은 여약 물체 간의 정밀한 마찰이나 접촉과 같은 로봇 조작의 복잡한 물리학을 다루는 데 어려움을 겪고 있지만, 새로운 프레임워크는 명확한 발전 방향을 제시합니다. 시각적 아름다움보다 제어 가능성을 우선시하고 포스트 트레이닝을 통해 모델을 특정 과업에 적응시킴으로써, 연구자들은 단순히 실제 세계처럼 보이는 것이 아니라 실제 세계와 상호작용하는 방법을 이해하는 시스템을 구축할 수 있습니다. 판단의 대상을 '그림'에서 '계획'으로 옮긴 이 변화는, 물리적 세계를 신뢰성 있게 탐색하고 조작할 수 있는 지능형 에이전트를 만들기 위한 중요한 진전입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →