← 최신 논문
💻 computer science

RoboMIND 2.0: A Multimodal, Bimanual Mobile Manipulation Dataset for Generalizable Embodied Intelligence

이 논문은 6 가지 로봇 구현체와 739 가지 복잡한 작업에서 수집된 31 만 개 이상의 이족 조작 궤적, 촉각 데이터, 모바일 조작 데이터 및 디지털 트윈 시뮬레이션 데이터를 포함한 대규모 다중 모달 데이터셋 'RoboMIND 2.0'과 이를 활용하여 추상적 지시를 구체적인 하위 목표와 정밀한 동작으로 변환하는 계층적 이중 시스템 'MIND-2'를 제안합니다.

원저자: Chengkai Hou, Kun Wu, Jiaming Liu, Zhengping Che, Di Wu, Fei Liao, Guangrun Li, Jingyang He, Qiuxuan Feng, Zhao Jin, Chenyang Gu, Zhuoyang Liu, Nuowei Han, Xiangju Mi, Yaoxu Lv, Yankai Fu, Gaole Dai
게시일 2026-03-02
📖 3 분 읽기☕ 가벼운 읽기

원저자: Chengkai Hou, Kun Wu, Jiaming Liu, Zhengping Che, Di Wu, Fei Liao, Guangrun Li, Jingyang He, Qiuxuan Feng, Zhao Jin, Chenyang Gu, Zhuoyang Liu, Nuowei Han, Xiangju Mi, Yaoxu Lv, Yankai Fu, Gaole Dai, Langzhe Gu, Tao Li, Yuheng Zhang, Yixue Zhang, Xinhua Wang, Shichao Fan, Meng Li, Zhen Zhao, Ning Liu, Zhiyuan Xu, Pei Ren, Junjie Ji, Haonan Liu, Kuan Cheng, Shanghang Zhang, Jian Tang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

1. 거대한 요리책: RoboMIND 2.0 (데이터셋)

과거의 로봇 학습 데이터들은 마치 **"오직 스푼만 들고 국만 떠먹는 법"**만 알려주는 책처럼 제한적이었습니다. 하지만 RoboMIND 2.0 은 전 세계의 다양한 주방과 공장에서 일하는 **6 가지 다른 종류의 로봇 (휴머노이드, 바퀴 달린 로봇, 고정형 로봇 등)**이 수행한 31 만 건 이상의 작업 기록을 담고 있습니다.

  • 다양한 로봇 (6 가지): 책상 위에 고정된 로봇 팔부터, 바퀴를 타고 돌아다니는 로봇, 인간처럼 두 손과 다리를 가진 로봇까지 다양한 '몸체'를 가진 로봇들의 기록이 모두 들어있습니다.
  • 다양한 작업 (759 가지): 단순히 물건을 집어 올리는 것뿐만 아니라, 옷을 개거나, 공장을 정리하거나, 장바구니를 들고 계산대로 가는 등 매우 복잡한 일들까지 포함되어 있습니다.
  • 촉각의 중요성 (만져보는 경험): 기존 데이터는 로봇이 '보는 것 (시각)'만 기록했지만, 이 데이터셋은 로봇이 물건을 **'만지는 느낌 (촉각)'**까지 기록했습니다. 마치 요리사가 식재료를 만져보고 익었는지, 단단한지 확인하는 것처럼, 로봇이 물건을 잡을 때 미끄러지지 않게 하거나 힘을 조절하는 데 결정적인 역할을 합니다.
  • 가상 현실 (디지털 트윈): 실제 로봇을 움직이는 데는 비용과 시간이 많이 들기 때문에, 이 데이터셋은 실제 환경과 똑같이 만든 '가상 현실 (시뮬레이션)' 데이터도 제공합니다. 마치 비행 조종사가 실제 비행기 없이도 시뮬레이터로 수만 시간을 훈련하는 것과 같습니다.

2. 현명한 요리사: MIND-2 시스템 (로봇 두뇌)

이제 이 거대한 요리책을 바탕으로 로봇이 실제로 일을 할 수 있게 해주는 **'MIND-2'**라는 두 가지 시스템을 소개합니다. 이 시스템은 인간의 뇌처럼 **'느린 사고 (계획)'**와 **'빠른 반사 (행동)'**로 나뉩니다.

  • 느린 두뇌 (MIND-2-VLM): "대장 (Plan)"
    • 이 부분은 로봇의 '전략가' 역할을 합니다. "식료품점을 정리해줘"라는 복잡한 명령을 받으면, "일단 바구니를 가져와 → 과일을 담고 → 계산대로 가"처럼 큰 그림을 그립니다.
    • 카메라로 주변을 보며 현재 상황을 파악하고, 다음에 무엇을 해야 할지 언어로 지시합니다.
  • 빠른 두뇌 (MIND-2-VLA): "실무자 (Action)"
    • 이 부분은 '실무자' 역할을 합니다. 대장으로부터 "과일을 바구니에 담아"라는 지시를 받으면, 즉시 로봇 팔을 움직여 과일을 잡고 바구니에 넣는 정밀한 동작을 수행합니다.
    • 이 실무자는 실패한 경험 (물건을 떨어뜨린 경우 등) 도 학습하여, 다시는 같은 실수를 하지 않도록 교정합니다.

이 두 시스템이 협력하면, 로봇은 복잡한 상황에서도 유연하게 대처할 수 있게 됩니다.

3. 왜 이것이 중요한가요? (기존과의 차이)

  • 이전에는: 로봇은 "컵을 집어"라고 하면 컵을 집는 법은 알지만, "컵을 집어서 싱크대에 넣고 물을 채워"라고 하면 길을 잃거나 멈춰버렸습니다.
  • 이제부터는: RoboMIND 2.0 이라는 방대한 경험과 MIND-2 시스템 덕분에 로봇은 **장거리 여행 (긴 작업)**을 하더라도, 중간에 넘어지거나 길을 잃지 않고 목적지까지 도달할 수 있게 되었습니다.
  • 촉각의 힘: 로봇이 물건을 잡을 때 '미끄러지는 느낌'을 알 수 있게 되어, 깨지기 쉬운 유리그릇도 안전하게 잡을 수 있게 되었습니다.

4. 결론: 로봇의 미래가 열렸습니다

이 연구는 로봇이 단순히 정해진 동작만 반복하는 기계가 아니라, 다양한 환경에서 새로운 일을 배우고, 서로 다른 로봇 몸체에서도 똑똑하게 일할 수 있는 '일반적인 지능'을 가진 존재로 발전하는 중요한 디딤돌이 되었습니다.

마치 수천 시간의 요리 실습을 통해 요리사가 된 것처럼, 이 데이터와 시스템을 통해 로봇들도 이제 우리 집이나 공장에서 더 똑똑하고 안전하게 일할 준비를 마쳤습니다.


한 줄 요약:

"다양한 로봇의 31 만 건의 작업 기록 (촉각 포함) 을 담은 거대한 요리책과, 이를 바탕으로 복잡한 일을 계획하고 실행하는 두뇌 시스템을 만들어, 로봇이 이제 진짜 사람처럼 똑똑하게 일할 수 있게 했습니다."

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →