← 최신 논문
💬 NLP

MiMo-Embodied: X-Embodied Foundation Model Technical Report

본 논문은 다단계 학습, 선별된 데이터, 그리고 CoT/RL 미세 조정을 활용하여 자율 주행과 embodied AI 간의 강력한 긍정적 전이를 입증함으로써 자율 주행과 embodied AI 모두에서 최첨단 성능을 달성하는 최초의 오픈소스 크로스-embodied 기반 모델인 MiMo-Embodied를 소개합니다.

원저자: Xiaoshuai Hao, Lei Zhou, Zhijian Huang, Zhiwen Hou, Yingbo Tang, Lingfeng Zhang, Guang Li, Zheng Lu, Shuhuai Ren, Xianhui Meng, Yuchen Zhang, Jing Wu, Jinghui Lu, Chenxu Dang, Jiayi Guan, Jianhua Wu
게시일 2026-04-29
📖 4 분 읽기☕ 가벼운 읽기

원저자: Xiaoshuai Hao, Lei Zhou, Zhijian Huang, Zhiwen Hou, Yingbo Tang, Lingfeng Zhang, Guang Li, Zheng Lu, Shuhuai Ren, Xianhui Meng, Yuchen Zhang, Jing Wu, Jinghui Lu, Chenxu Dang, Jiayi Guan, Jianhua Wu, Zhiyi Hou, Hanbing Li, Shumeng Xia, Mingliang Zhou, Yinan Zheng, Zihao Yue, Shuhao Gu, Hao Tian, Yuannan Shen, Jianwei Cui, Wen Zhang, Shaoqing Xu, Bing Wang, Haiyang Sun, Zeyu Zhu, Yuncheng Jiang, Zibin Guo, Chuhong Gong, Chaofan Zhang, Wenbo Ding, Kun Ma, Guang Chen, Rui Cai, Diyun Xiang, Heng Qu, Fuli Luo, Hangjun Ye, Long Chen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

교실에 두 가지 매우 다른 학생이 있다고 상상해 보세요.

  • 학생 A로봇 집사입니다. 이들은 지저분한 부엌을 이동하는 것, 컵의 어느 부분을 잡을지 파악하는 것, 주름 없이 셔츠를 접는 방법을 계획하는 데 뛰어납니다. 이들은 "구체적 AI(Embodied AI)"(방 안의 사물과 상호작용) 의 전문가입니다.
  • 학생 B자율주행차입니다. 이들은 도로를 주시하고, 보행자가 횡단보도를 무단으로 건너갈지 예측하며, 붐비는 교차로에서 제동할지 왼쪽으로 방향을 틀지 결정하는 데 뛰어납니다. 이들은 "자율주행(Autonomous Driving)"의 전문가입니다.

보통 학교는 이 두 학생을 따로 가르칩니다. 로봇 집사는 운전하는 법을 모르고, 자율주행차는 숟가락을 집어 올리는 법을 모릅니다.

MiMo-Embodied 가 등장합니다.

이 논문은 샤오미가 개발한 새로운 "슈퍼 학생"을 소개합니다. 이는 로봇 집사와 자율주행차의 두뇌를 단일 패키지로 성공적으로 결합한 최초의 오픈소스 모델입니다. 마치 와인 병을 따는 것만큼이나 고속도로를 주행하는 데도 뛰어난 스위스 군용 칼과 같다고 생각하면 됩니다.

이 슈퍼 학생은 어떻게 만들어졌을까요?

연구자들은 두 가지를 단순히 섞어놓은 것이 아니라, 학생이 모든 것을 배우되 혼란스러워하지 않도록 보장하는 4 단계 훈련 레시피를 사용했습니다.

  1. 1 단계: "방" 수업: 먼저, 모델에게 방, 사물, 그리고 집 안을 이동하는 방법에 대해 가르쳤습니다. 로봇이 사물을 집어 올리고 3 차원 공간에서 사물의 위치를 이해하는 데이터가 사용되었습니다.
  2. 2 단계: "도로" 수업: 다음으로, 같은 학생을 운전 시뮬레이터에 투입했습니다. 교통 신호등, 다른 차량, 그리고 앞의 트럭이 무엇을 할지 예측하는 방법을 가르쳤습니다.
  3. 3 단계: "생각하기" 수업: 이것이 비결입니다. 단순히 답을 주는 대신, 모델은 소리를 내어 생각하도록 (Chain-of-Thought) 가르쳤습니다. "왼쪽으로 돌아라"라고 말하기 전에, "빨간 불을 보았으니 멈춰야 한다. 차가 회전하는 것을 보았으니 기다려야 한다"라고 말하도록 학습시켰습니다. 이는 모델이 왜 그 결정을 내리는지 이해하도록 돕습니다.
  4. 4 단계: "코치" 수업: 마지막으로, 좋은 플레이에는 점수를 주고 나쁜 플레이에는 페널티를 주는 코치와 같은 강화 학습 기법을 사용했습니다. 이를 통해 모델을 미세 조정하여 더 정밀하게 만들었고, 단순히 추측하는 것이 아니라 가장 안전하고 논리적인 움직임을 계산하도록 보장했습니다.

이 슈퍼 학생은 무엇을 할 수 있을까요?

이 논문은 MiMo-Embodied 를 29 가지 다른 과제(벤치마크) 에서 테스트했으며, 전문화된 로봇과 전문화된 자동차는 물론 대형 상용 AI 모델보다 거의 모든 분야에서 최상위 성능을 보임을 발견했습니다.

"로봇 집사" 세계 (구체적 AI) 에서:

  • 적성 예측 (Affordance Prediction): 의자 사진을 보여주면 단순히 "의자"로만 보지 않습니다. "앉을 수 있는 것"과 "팔걸이를 잡을 수 있는 것"으로 봅니다. 물건을 집어 올리기 위해 정확히 어디를 잡아야 하는지 알고 있습니다.
  • 작업 계획: "배고파, 간식을 가져와"라고 말하면 이를 분해합니다. 부엌으로 가라 -> 냉장고 열기 -> 사과 찾기 -> 여기로 가져오기.
  • 공간 이해: "창문"은 멀리 있고, "테이블"은 가깝고, "고양이"는 의자 아래에 있다는 것을 알고 있습니다. 물체에 부딪히지 않고 방을 이동할 수 있습니다.

"자율주행차" 세계 (자율주행) 에서:

  • 환경 인식: 혼란스러운 거리 풍경을 바라보며 즉시 빨간 신호등, 보도에서 내려오는 보행자, 그리고 길가에 주차된 트럭을 발견할 수 있습니다.
  • 상태 예측: 다른 운전자들이 무엇을 생각하고 있는지 추측할 수 있습니다. "저 차는 속도를 줄이고 있군; 아마 방향을 틀고 싶은 모양이야." "저 보행자는 기다리고 있군; 곧 건널 것 같아."
  • 주행 계획: 단순히 운전하는 것이 아니라 안전하게 운전합니다. 인간 운전자처럼 추론을 설명하며 매끄러운 차선 변경이나 부드러운 정지를 계획할 수 있습니다.

큰 발견: "크로스 트레이닝"이 작동합니다

이 논문에서 가장 흥미로운 부분은 한 가지 기술을 배우는 것이 다른 기술을 돕는다는 발견입니다.

보통 운전 데이터로 훈련된 모델은 컵을 집는 법을 잊고, 로봇으로 훈련된 모델은 운전하는 법을 잊을 것이라고 생각했습니다. 하지만 MiMo-Embodied 는 이러한 기술들이 실제로 서로 강화된다는 것을 증명했습니다.

  • 차가 어디로 갈지 예측하는 법을 배우는 것은 모델이 방 안의 사물이 어떻게 움직이는지 이해하는 데 도움을 줍니다.
  • 손잡이를 잡는 방법을 파악하는 법을 배우는 것은 모델이 스티어링 휠의 물리적 제약 조건을 이해하는 데 도움을 줍니다.

결론

MiMo-Embodied 는 물리적 기계들을 위한 보편적인 두뇌 역할을 하는 "기초 모델"입니다. 기계가 로봇 청소기이든, 휴머노이드 로봇이든, 자율주행차이든, 이 단일 모델은 세상을 이해하고, 행동을 계획하며, 이를 안전하게 실행할 수 있습니다.

이 논문은 "실내 로봇"과 "실외 자동차" 사이의 장벽을 허물어 단일 통합 AI 가 전체 물리적 세계의 복잡성을 처리할 수 있음을 보여줌으로써 이것이 중요한 진전이라고 주장합니다. 그들은 심지어 누구나 사용할 수 있고 연구할 수 있도록 코드와 모델을 공개했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →