← 최신 논문
💻 computer science

Riemann-1.0: An Embodied World Action Model for Physical AI

Riemann-1.0은 다각적 관측, 로봇 상태, 그리고 행동을 단일 프레임워크로 통합하는 통합 인과적 자기회귀 세계 행동 모델(unified causal autoregressive World Action Model)로서, 20만 시간 이상의 다양한 임바디드(embodied) 데이터를 활용한 점진적 사전 학습 전략을 통해 시뮬레이션과 실제 환경의 장기 지평 조작 작업 모두에서 최첨단 성능을 달성합니다.

원저자: Haofeng Sun, Jiangbo Pei, Fei Kang, Zexiang Liu, Yaokun Li, Boyi Jiang, Hua Xue, Cindy Zhou, Wei Li, Yichen Wei, Mengyin An, Fanliang Zhao, Biao Jiang, Zile Wang, Yang Liu, Yangguang Li

게시일 2026-08-28
📖 4 분 읽기☕ 가벼운 읽기

원저자: Haofeng Sun, Jiangbo Pei, Fei Kang, Zexiang Liu, Yaokun Li, Boyi Jiang, Hua Xue, Cindy Zhou, Wei Li, Yichen Wei, Mengyin An, Fanliang Zhao, Biao Jiang, Zile Wang, Yang Liu, Yangguang Li

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인공지능은 오랫동안 디지털 영역의 대가로서 컴퓨터 화면이라는 틀 안에서 텍스트를 읽고, 이미지를 인식하며, 퍼즐을 풀어왔습니다. 하지만 기계가 진정으로 우리와 함께 물리적 세계에 참여하려면, 단순히 무엇을 보는지 이해하는 것을 넘어 그 안에서 움직이는 법을 배워야 합니다. 이것이 바로 '체화된 지능(embodied intelligence)'의 과제입니다. 즉, 로봇이 주변 환경을 인지하고, 원인과 결과에 대해 추론하며, 인간이 컵을 집거나 옷을 접을 때 사용하는 것과 같은 유연함으로 물리적 움직임을 실행하도록 가르치는 것입니다. 기계가 성공하기 위해서는 물체가 어떻게 보이는지뿐만 아니라, 만졌을 때 어떻게 움직이고 변하는지를 이해하는 세계 모델이 필요합니다. 블록을 밀면 미끄러진다는 것과, 뚜껑을 들어 올리면 그 안의 내용물이 드러난다는 것을 배워야 합니다. 지금까지 이러한 물리적 행동을 계획하는 것과 그 행동의 시각적 결과를 예측하는 것을 하나의 시스템으로 만드는 것은 어려운 난관이었으며, 종종 사고(thinking)를 위한 시스템과 움직임(moving)을 위한 시스템을 별도로 구축해야 했습니다.

한 연구팀은 로봇의 행동과 그로 인해 발생하는 세상의 변화를 하나의 연속적인 이야기로 취급함으로써 이 간극을 메우기 위해 설계된 '리만-1.0(Riemann-1.0)'이라는 새로운 시스템을 선보였습니다. 이 모델은 무엇을 할지 결정하는 도구와 다음에 무슨 일이 일어날지 상상하는 도구를 따로 만드는 대신, 두 가지를 동시에 수행하는 법을 학습합니다. 이 모델은 단순하지만 강력한 원리에 기반하여 작동합니다. 즉, 현실 세계에서는 항상 행동이 먼저 일어나고 그 결과가 관찰된다는 점입니다. 로봇이 숟가락을 향해 손을 뻗는다면, 움직임이 먼저 발생하고 그에 따른 시각적 변화인 '숟가락의 이동'이 뒤따릅니다. 리만-1.0은 이 순서를 존중하도록 설계되었으며, 방대한 양의 비디오와 움직임 데이터를 통해 로봇이 다음에 무엇을 해야 하는지, 그리고 그 행동을 한 후에 세상이 어떻게 보일지를 정확히 예측하도록 학습합니다.

이 시스템을 가르치기 위해 연구진은 총 20만 시간 이상의 상호작용이 담긴 방대한 경험 라이브러리를 수집했습니다. 이 컬렉션은 단순히 로봇 영상의 더미가 아니라, 세 가지 다른 유형의 학습 자료를 정교하게 큐레이션한 혼합물입니다. 첫째, 요리나 청소와 같은 일상적인 과업을 수행하는 사람의 시점에서 촬영된 수천 시간의 영상을 포함했습니다. 이 영상들은 비록 로봇의 구체적인 기계적 데이터는 부족할지라도, 사물이 어떻게 상호작용하고 과업이 시간이 흐름에 따라 어떻게 전개되는지에 대한 폭넓은 이해를 제공했습니다. 둘째, 인간의 손 움직임이 어떻게 기계적인 제어로 변환되는지를 보여주는 가교 역할을 하는 핸드헬드 로봇 그리퍼와 웨어러블 장치의 시연 데이터를 추가했습니다. 마지막으로, 실제 로봇의 움직임을 정밀하게 기록한 데이터를 포함하여, 기계가 자신의 팔다리를 어떻게 움직여야 하는지 가르치는 데 필요한 정확하고 실행 가능한 지침을 제공했습니다. 이러한 소스들을 결합함으로써, 연구진은 모델이 인간 경험의 폭넓은 지혜로부터 배울 수 있는 동시에 그 지식을 로봇 제어의 정밀한 역학 관계에 접목할 수 있는 통합된 데이터셋을 구축했습니다.

리만-1.0의 학습 과정은 일반적인 관찰에서 구체적인 실행으로 나아가는 학교 커리큘럼처럼 구조화되었습니다. 첫 번째 단계에서 모델은 방대한 양의 인간 영상을 학습했습니다. 이 영상들에는 로봇의 움직임 데이터가 없었기 때문에, 시스템은 화면에 보이는 시각적 변화를 일으켰을 것이 분명한 보이지 않는 '행동'을 추정하는 보조 도구를 사용했습니다. 이를 통해 모델은 완벽한 로봇 데이터 없이도 세상이 어떻게 움직이는지에 대한 기본적인 역학을 학습할 수 있었습니다. 두 번째 단계에서 모델은 인간의 손과 로봇 그리퍼가 섞인 데이터를 접하며, 자신의 움직임에 대한 이해를 실제 물리적 제어와 일치시키는 법을 배웠습니다. 마지막으로 세 번째 단계에서 모델은 로봇이 과업을 수행하는 고품질의 기록에 집중했습니다. 이 최종 단계는 모델이 생성하는 명령이 단순히 시각적으로 그럴듯할 뿐만 아니라, 실제 기계가 수행 가능한 물리적인 명령이 되도록 정밀하고 실행 가능한 명령을 생성하는 능력을 날카롭게 다듬었습니다.

이러한 접근 방식의 결과는 놀라웠습니다. 컴퓨터 시뮬레이션과 실제 로봇 모두에서 다양한 과업을 테스트했을 때, 리만-1.0은 기존의 방법들을 상당한 차이로 앞질렀습니다. 여러 단계를 포함하는 길고 복잡한 과업을 테스트하기 위해 설계된 시뮬레이션에서, 이 모델은 62.6%의 성공률을 기록하며 기존의 최고 시스템들보다 눈에 띄는 개선을 보여주었습니다. 두 팔을 가진 로봇에 초점을 맞춘 또 다른 시뮬레이션에서는 94.3%의 성공률을 달enced했습니다. 가장 인상적인 점은, 색깔이 있는 블록 쌓기, 옷 접기, 어지러운 책상 정리, 주방 용품 배치 등의 과업을 수행하기 위해 실제 로봇에 배치되었을 때, 시스템이 85%의 확률로 과업을 성공적으로 완료했다는 것입니다. 또한, 루빅스 큐브를 상자에 넣거나 수건을 대야에 넣는 것과 같이 이전에 본 적 없는 새로운 상황에도 적응하는 탁월한 능력을 보이며 85%의 성공률을 기록했습니다.

단순히 로봇 컨트롤러 역할을 하는 것을 넘어, 리만-1.0은 시뮬레이터로서도 기능할 수 있습니다. 이 모델은 행동과 그 시각적 결과 사이의 인과 관계를 이해하기 때문에, 연구자들은 로봇이 특정 움직임을 수행했을 때 어떤 일이 일어날지 모델에게 물어볼 수 있습니다. 모델은 제공된 행동을 바탕으로 물체가 어떻게 움직이고 어디에 놓이게 될지, 즉 미래의 모습을 담은 비디오를 생성할 수 있습니다. 이러한 이중적 능력은 이 시스템이 로봇이 실제로 움직이기 전에 계획이 제대로 작동할지 확인할 수 있는 '결정하는 뇌'이자 '상상하는 마음'의 역할을 모두 수행할 수 있음을 의미합니다. 행동이 어떻게 변화를 일으키는지에 대한 실재적 근거를 바탕으로 물리적 세계의 미래를 예측하는 이 능력은, 인공지능이 물리적 세계에서 신뢰할 수 있는 파트너가 되는 데 있어 중요한 진전을 나타냅니다. 이 연구는 행동하는 법을 배우는 것과 세상이 어떻게 반응하는지를 배우는 것을 통합함으로써, 기계가 우리가 매일 수행하는 과업들에 대해 더욱 견고하고 일반화된 이해를 발달시킬 수 있음을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →