← 최신 논문
🤖 AI

World Models for Embodied Intelligence: From Plausible to Controllable to Actionable

이 논문은 체화된 지능(embodied intelligence)에서의 월드 모델을 평가하기 위해 시각적 충실도에서 벗어나 개연성(Plausible), 제어 가능성(Controllable), 실행 가능성(Actionable)이라는 세 단계의 계층 구조로 초점을 전환하는 새로운 프레임워크를 제안하며, 진정한 가치는 작업 관련 구조를 포착하고, 개입 효과를 반영하며, 폐쇄 루프 에이전트의 행동을 측정 가능한 수준으로 개선하는 예측에 있다는 점을 주장한다.

원저자: Nanjie Yao, Hao Wang, Chong Cheng, Zhikang Chen, Wenzhe Li, Jiafei Lyu, Li Shen, Peilin Zhao, Zongqing Lu, Gao Huang, Steven Hoi, Dacheng Tao, Deheng Ye

게시일 2026-09-16
📖 4 분 읽기☕ 가벼운 읽기

원저자: Nanjie Yao, Hao Wang, Chong Cheng, Zhikang Chen, Wenzhe Li, Jiafei Lyu, Li Shen, Peilin Zhao, Zongqing Lu, Gao Huang, Steven Hoi, Dacheng Tao, Deheng Ye

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇이 컵을 집으려고 하는 상황을 상상해 보십시오. 로봇의 손가락이 세라믹에 닿기도 전에, 인간의 정신은 이미 컵의 무게, 표면의 마찰력, 그리고 손잡이의 미세한 저항을 예측하고 있습니다. 이러한 정신적 시뮬레이션 덕분에 우리는 실수를 하기 전에 즉각적으로 움켜쥐는 힘을 조절하여 내용물을 쏟는 것을 방지할 수 있습니다. 수십 년 동안 인공지생능을 구축해 온 과학자들은 기계에게도 이와 같은 '앞을 내다보는 능력'을 부여하기 위해 노력해 왔습니다. 그들은 이러한 내부 시뮬레이션을 "월드 모델(world models)"이라고 부릅니다. 아이디어는 간단합니다. 만약 기계가 자신이 행동할 때 세상이 어떻게 변하는지에 대한 정신적 그림을 구축할 수 있다면, 더 잘 계획하고, 실수를 피하며, 더 빠르게 학습할 수 있다는 것입니다. 하지만 새로운 관점은 단순히 이러한 정신적 그림을 사실적으로 만드는 것만으로는 충분하지 않다고 제안합니다. 어떤 모델은 로봇 팔이 움직이는 모습을 매우 아름답고 사실적인 영상으로 생성할 수는 있지만, 그 팔이 실제로 컵을 쓰러뜨릴 것이라는 사실은 이해하지 못할 수도 있습니다. 월드 모델의 진정한 가치는 그 예측이 얼마나 예쁜 영상처럼 보이는가가 아니라, 그 예측이 기계가 더 나은 결정을 내리는 데 도움이 되는지에 달려 있습니다.

홍콩 과학기술대학교, 칭화 대학교, 난양 공과대학교를 포함한 연구진들의 포괄적인 새로운 조사 보고서는 우리가 이러한 시스템을 생각하는 방식을 재구성합니다. 저자들은 이 시스템들을 복잡한 컴퓨터 코드나 특정 작업 유형에 따라 분류하는 대신, 모델이 실제로 '무엇을 할 수 있는지'를 기준으로 측정하는 새로운 방법을 제안합니다. 그들은 세 단계의 '능력 사다리'를 도입했습니다. 가장 낮은 단계는 "그럴듯한(Plausible)" 모델입니다. 이 단계는 기계가 시간에 따라 일관된 세계의 이야기를 유지할 수 있다면 충족됩니다. 만약 로봇이 블록을 움직인다면, 그럴듯한 모델은 블록이 여전히 그 자리에 있으며 사라지거나 모양이 변하지 않았음을 기억합니다. 이는 기하학적 규칙과 물리 법칙을 온전하게 유지하여, 정신적 그림이 터무니없는 방향으로 흐르지 않도록 보장합니다.

다음 단계는 "제어 가능한(Controllable)" 모델입니다. 여기서 기계는 원인과 결과의 관계를 이해하는 법을 배웁니다. 모델이 단순히 세상을 관찰하는 것만으로는 부족합니다. 자신의 행동이 세상을 어떻게 변화시키는지 이해해야 합니다. 만약 로봇이 블록을 왼쪽으로 밀면, 제어 가능한 모델은 블록이 왼쪽으로 움직일 것이며 장면의 다른 부분은 변하지 않을 것임을 예측해야 합니다. 만약 로봇이 오른쪽으로 민다면, 예측 또한 그에 따라 바뀌어야 합니다. 연구진은 모델이 서로 다른 행동을 구별하고 각 행동이 만들어내는 구체적이고 측정 가능한 차이를 보여줄 수 있을 때 비로소 진정으로 제어 가능하다고 강조합니다. 이는 기계가 단순히 관찰하는 상태에서 벗어나, 어떻게 개입할지를 능동적으로 이해하는 단계로 나아가는 중요한 과정입니다.

사다리의 정점은 "실행 가능한(Actionable)" 모델입니다. 이것이 궁극적인 목표입니다. 즉, 정신적 시뮬레이션이 실제 세계에서의 로봇 성능을 직접적으로 향상시키는 시스템입니다. 실행 가능한 모델은 단순히 미래를 예측하는 것에 그치지 않고, 그 예측을 사용하여 더 나은 경로를 선택하거나, 새로운 기술을 더 빨리 배우거나, 실수로부터 회복합니다. 예를 들어, 로봇이 방을 항해하다가 계획대로 진행했을 때 충돌이 예상된다면, 실행 가능한 모델은 로봇이 실제로 충돌하기 전에 시뮬레이션 단계에서 위험을 감지하여 안전한 경로로 전환할 수 있게 해줍니다. 이 조사는 많은 현재 시스템들이 '그럴듯함'에는 능숙하고 일부는 '제어 가능성' 단계에 도달하고 있지만, 시뮬레이션이 복잡한 실제 과업에서 확실한 성공으로 이어지는 '실행 가능성' 단계를 완전히 마스터한 시스템은 매우 드물다는 점을 밝혀냈습니다.

연구진은 또한 이러한 모델들이 로봇의 나머지 두뇌와 어떻게 상호작용하는지도 정리했습니다. 그들은 월드 모델이 기계의 개선을 돕는 네 가지 주요 방식을 식별했습니다. 첫째, 모델은 다음에 수행할 실험이 무엇인지 제안함으로써 더 나은 데이터를 수집하도록 도울 수 있습니다. 둘째, 모델은 로봇이 계획을 실행하기 전에 그 계획이 얼마나 잘 작동할지 점수를 매기는 심판 역할을 할 수 있습니다. 셋째, 모델은 안전한 가상 환경에서 로봇이 수백만 번 연습할 수 있는 훈련장이 될 수 있습니다. 마지막으로, 모델은 안전망 역할을 하여 로봇의 행동을 예측값과 끊임없이 대조하고, 현실이 계획에서 벗어나기 시작하면 경로를 수정하도록 개입할 수 있습니다.

이 프레임워크는 물건을 집는 섬세한 조작부터 자율 주행 자동차, 낯선 건물 탐색에 이르기까지 광범위한 로봇 작업에 적용되었습니다. 조사는 각기 다른 작업마다 서로 다른 종류의 "접지(grounding)"가 필요함을 보여줍니다. 컵을 집는 로봇은 마찰력과 무게 같은 물리적 힘을 이해해야 합니다. 자율 주행 자동차는 다른 차량의 의도와 도로의 기하학적 구조를 이해해야 합니다. 걷는 로봇은 균형과 지형을 이해해야 합니다. 저자들은 특정 환경의 규칙을 이해하지 못한다면 한 가지 작업에는 잘 작동하는 모델이 다른 작업에서는 실패할 수 있다고 주장합니다.

이러한 진전에도 불구하고, 논문은 여전히 남아있는 큰 장애물들을 강조합니다. 한 가지 주요 과제는 정신적 그림을 장기간 일관되게 유지하는 것입니다. 만약 로봇이 방 안을 오랫동안 돌아다닌다면, 내부 지도가 어긋나기 시작하여 물체가 엉뚱한 곳에 나타날 수 있습니다. 또 다른 과제는 모델이 단순히 훈련 데이터의 패턴을 암기하는 것이 아니라, 정말로 인과관관계를 이해하고 있는지 테스트하는 것입니다. 연구진은 또한 많은 현재 시스템들이 빠르게 움직이는 작업에 사용되기에는 너무 느리며, 모델을 실제 세계에 배치하기 전에 그것이 정말로 안전한지 검증하는 것이 어렵다고 지적합니다.

이 조사는 연구 분야의 초점이 바뀌어야 한다고 결론짓습니다. 생성된 영상이 얼마나 사실적인지를 축하하는 대신, 예측이 더 나은, 더 안전한, 더 효율적인 행동으로 이어지는지를 우선시해야 합니다. 저자들은 이 분야를 '그럴듯함, 제어 가능성, 실행 가능성'이라는 세 가지 능력 수준으로 조직함으로써 차세대 체화된 지능(embodied intelligence)을 위한 명확한 로드맵을 제공합니다. 목표는 더 이상 미래를 상상할 수 있는 기계를 만드는 것이 아니라, 그 상상을 사용하여 현재를 현명하게 행동할 수 있는 기계를 만드는 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →