RoboMIND 2.0: A Multimodal, Bimanual Mobile Manipulation Dataset for Generalizable Embodied Intelligence
이 논문은 6 가지 로봇 구현체와 739 가지 복잡한 작업에서 수집된 31 만 개 이상의 이족 조작 궤적, 촉각 데이터, 모바일 조작 데이터 및 디지털 트윈 시뮬레이션 데이터를 포함한 대규모 다중 모달 데이터셋 'RoboMIND 2.0'과 이를 활용하여 추상적 지시를 구체적인 하위 목표와 정밀한 동작으로 변환하는 계층적 이중 시스템 'MIND-2'를 제안합니다.
과거의 로봇 학습 데이터들은 마치 **"오직 스푼만 들고 국만 떠먹는 법"**만 알려주는 책처럼 제한적이었습니다. 하지만 RoboMIND 2.0 은 전 세계의 다양한 주방과 공장에서 일하는 **6 가지 다른 종류의 로봇 (휴머노이드, 바퀴 달린 로봇, 고정형 로봇 등)**이 수행한 31 만 건 이상의 작업 기록을 담고 있습니다.
다양한 로봇 (6 가지): 책상 위에 고정된 로봇 팔부터, 바퀴를 타고 돌아다니는 로봇, 인간처럼 두 손과 다리를 가진 로봇까지 다양한 '몸체'를 가진 로봇들의 기록이 모두 들어있습니다.
다양한 작업 (759 가지): 단순히 물건을 집어 올리는 것뿐만 아니라, 옷을 개거나, 공장을 정리하거나, 장바구니를 들고 계산대로 가는 등 매우 복잡한 일들까지 포함되어 있습니다.
촉각의 중요성 (만져보는 경험): 기존 데이터는 로봇이 '보는 것 (시각)'만 기록했지만, 이 데이터셋은 로봇이 물건을 **'만지는 느낌 (촉각)'**까지 기록했습니다. 마치 요리사가 식재료를 만져보고 익었는지, 단단한지 확인하는 것처럼, 로봇이 물건을 잡을 때 미끄러지지 않게 하거나 힘을 조절하는 데 결정적인 역할을 합니다.
가상 현실 (디지털 트윈): 실제 로봇을 움직이는 데는 비용과 시간이 많이 들기 때문에, 이 데이터셋은 실제 환경과 똑같이 만든 '가상 현실 (시뮬레이션)' 데이터도 제공합니다. 마치 비행 조종사가 실제 비행기 없이도 시뮬레이터로 수만 시간을 훈련하는 것과 같습니다.
2. 현명한 요리사: MIND-2 시스템 (로봇 두뇌)
이제 이 거대한 요리책을 바탕으로 로봇이 실제로 일을 할 수 있게 해주는 **'MIND-2'**라는 두 가지 시스템을 소개합니다. 이 시스템은 인간의 뇌처럼 **'느린 사고 (계획)'**와 **'빠른 반사 (행동)'**로 나뉩니다.
느린 두뇌 (MIND-2-VLM): "대장 (Plan)"
이 부분은 로봇의 '전략가' 역할을 합니다. "식료품점을 정리해줘"라는 복잡한 명령을 받으면, "일단 바구니를 가져와 → 과일을 담고 → 계산대로 가"처럼 큰 그림을 그립니다.
카메라로 주변을 보며 현재 상황을 파악하고, 다음에 무엇을 해야 할지 언어로 지시합니다.
빠른 두뇌 (MIND-2-VLA): "실무자 (Action)"
이 부분은 '실무자' 역할을 합니다. 대장으로부터 "과일을 바구니에 담아"라는 지시를 받으면, 즉시 로봇 팔을 움직여 과일을 잡고 바구니에 넣는 정밀한 동작을 수행합니다.
이 실무자는 실패한 경험 (물건을 떨어뜨린 경우 등) 도 학습하여, 다시는 같은 실수를 하지 않도록 교정합니다.
이 두 시스템이 협력하면, 로봇은 복잡한 상황에서도 유연하게 대처할 수 있게 됩니다.
3. 왜 이것이 중요한가요? (기존과의 차이)
이전에는: 로봇은 "컵을 집어"라고 하면 컵을 집는 법은 알지만, "컵을 집어서 싱크대에 넣고 물을 채워"라고 하면 길을 잃거나 멈춰버렸습니다.
이제부터는: RoboMIND 2.0 이라는 방대한 경험과 MIND-2 시스템 덕분에 로봇은 **장거리 여행 (긴 작업)**을 하더라도, 중간에 넘어지거나 길을 잃지 않고 목적지까지 도달할 수 있게 되었습니다.
촉각의 힘: 로봇이 물건을 잡을 때 '미끄러지는 느낌'을 알 수 있게 되어, 깨지기 쉬운 유리그릇도 안전하게 잡을 수 있게 되었습니다.
4. 결론: 로봇의 미래가 열렸습니다
이 연구는 로봇이 단순히 정해진 동작만 반복하는 기계가 아니라, 다양한 환경에서 새로운 일을 배우고, 서로 다른 로봇 몸체에서도 똑똑하게 일할 수 있는 '일반적인 지능'을 가진 존재로 발전하는 중요한 디딤돌이 되었습니다.
마치 수천 시간의 요리 실습을 통해 요리사가 된 것처럼, 이 데이터와 시스템을 통해 로봇들도 이제 우리 집이나 공장에서 더 똑똑하고 안전하게 일할 준비를 마쳤습니다.
한 줄 요약:
"다양한 로봇의 31 만 건의 작업 기록 (촉각 포함) 을 담은 거대한 요리책과, 이를 바탕으로 복잡한 일을 계획하고 실행하는 두뇌 시스템을 만들어, 로봇이 이제 진짜 사람처럼 똑똑하게 일할 수 있게 했습니다."
RoboMIND 2.0: 일반화 가능한 구체적 지능을 위한 멀티모달 양손 이동 조작 데이터셋 기술 요약
이 논문은 로봇 조작 분야에서 데이터의 부족과 다양성 부재로 인한 일반화 한계를 해결하기 위해 제안된 RoboMIND 2.0 대규모 데이터셋과 이를 활용한 MIND-2 이중 시스템 아키텍처에 대해 상세히 설명합니다.
1. 문제 제기 (Problem)
기존의 데이터 기반 로봇 조작 연구는 다음과 같은 주요 한계에 직면해 있습니다:
데이터의 부족과 편향: 대규모이고 다양한 실제 세계 데모 데이터가 부족하여, 장기간의 양손 (bimanual) 작업이나 낯선 환경에서의 이동 조작 (mobile manipulation) 과 같은 복잡한 작업에 대한 일반화 능력이 부족합니다.
다양성 부재: 기존 데이터셋 (Open X-Embodiment, RH20T 등) 은 주로 단일 팔 고정 베이스 조작에 치중하거나, 하나의 로봇 형태 (embodiment) 에만 국한되어 있어 교차 형태 (cross-embodiment) 일반화를 어렵게 합니다.
멀티모달 정보 결여: 대부분의 데이터셋이 시각적 관찰과 기본 작동 상태만 포함하며, 접촉 (contact), 미끄러짐 (slip), 정밀 조작에 필수적인 촉각 (tactile) 피드백이 누락되어 있습니다.
장기적 계획의 어려움: 기존 VLA(Vision-Language-Action) 모델들은 장기간의 이동 조작 작업에서 성능이 제한적입니다.
2. 방법론 (Methodology)
A. RoboMIND 2.0 데이터셋 구축
RoboMIND 2.0 은 실제 세계에서 수집된 대규모 멀티모달 양손 이동 조작 데이터셋입니다.
규모 및 구성: 6 가지 이질적인 로봇 플랫폼 (Franka, UR5e, AgileX, ARX, Tien Kung, Tian Yi) 에서 수집된 31 만 개 이상의 양손 조작 궤적을 포함하며, 총 1,000 시간 이상의 운영 경험을 담고 있습니다.
다양성:
작업: 759 개의 복잡한 작업, 129 개의 기본 로봇 기술, 1,139 개의 다양한 객체.
환경: 가정 (부엌, 침실, 슈퍼마켓 등) 과 산업 (물류, 실험실, 조립 라인) 환경이 균등하게 분포.
멀티모달: 12,000 개의 촉각이 강화된 시퀀스 (Tashan Tactile 센서 사용) 와 20,000 개의 이동 조작 궤적을 포함합니다.
주석: 모든 궤적에 세밀한 자연어 주석이 부착되어 VLA 모델 학습을 지원합니다.
디지털 트윈 (Digital Twin): 실제 환경의 고충실도 시뮬레이션 자산 (USD) 과 20,000 개의 시뮬레이션 궤적을 공개하여 Sim-to-Real 전이를 용이하게 합니다.
데이터 품질 관리: HACTS, VR, 물리적 유도 등 다양한 원격 조작 시스템을 활용하여 수집되었으며, 12 가지 품질 기준 (불필요한 접촉, 불규칙한 운동, 재그립 등) 에 따른 엄격한 검수 프로세스를 거쳤습니다.
B. MIND-2 이중 시스템 아키텍처
RoboMIND 2.0 데이터를 활용하여 제안된 MIND-2는 장기적 작업을 처리하기 위한 느린 (Slow) - 빠른 (Fast) 이중 시스템입니다.
MIND-2-VLM (Slow System - "두뇌"):
고수준의 Vision-Language Model (InternVL3-8B 기반) 입니다.
복잡한 자연어 지시를 구체적인 실행 가능한 하위 목표 (subgoals) 로 분해합니다.
현재 작업 상태를 인식하고 다음 단계로 전환할 시점을 결정합니다.
MIND-2-VLA (Fast System - "실행기"):
Vision-Language-Action 모델로, 하위 목표를 기반으로 정밀한 모터를 제어합니다.
**오프라인 강화학습 (Implicit Q-Learning, IQL)**을 통해 훈련됩니다. 성공 시퀀스와 실패 시퀀스를 모두 학습하여 실패 모드 (예: 약한 그립, 잘못된 정렬) 를 피하고 최적의 행동을 학습합니다.
시각, 프로프리오셉션 (자세), 언어 지시를 통합하여 정밀한 제어 명령을 생성합니다.
3. 주요 기여 (Key Contributions)
대규모 멀티모달 양손 이동 조작 데이터셋: 6 가지 로봇 형태, 759 개 작업, 129 개 기술을 포함하며, 촉각 정보와 이동 조작을 동시에 지원하는 최초의 오픈 데이터셋입니다.
다차원적 다양성: 로봇 형태, 환경, 작업 의미, 실패 모드, 멀티모달 센싱 (시각, 촉각, 힘/토크) 을 포괄하여 진정한 일반화 가능한 정책 학습을 가능하게 합니다.
고충실도 디지털 트윈: 실제 데이터와 구조, 언어, 객체 구성이 일치하는 20,000 개의 시뮬레이션 궤적과 자산을 공개하여 비용 효율적인 Sim-to-Real 전이를 입증했습니다.
MIND-2 프레임워크: 고수준 계획 (VLM) 과 저수준 실행 (VLA) 을 결합한 이중 시스템으로, 기존 VLA 모델이 실패하는 복잡한 장기적 양손 이동 작업에서 뛰어난 성능을 발휘합니다.
포괄적인 실험적 검증: 단일 작업 모방 학습, VLA 모델, 교차 형태 일반화, 촉각의 역할, Sim-to-Real 전이 등 다양한 측면에서 데이터셋과 모델의 유효성을 입증했습니다.
4. 실험 결과 (Results)
모방 학습 및 VLA 모델 벤치마크:
3D 기반 학습의 우위: 양손 조정이 필요한 작업에서 3D 포인트 클라우드를 입력으로 사용하는 방법 (DP3 등) 이 2D 이미지 기반 방법 (ACT 등) 보다 우수한 성능을 보였습니다.
XR-1 의 우수성: 평가된 VLA 모델 중 XR-1 이 6 가지 로봇 플랫폼 전반에 걸쳐 가장 높은 교차 형태 일반화 성능을 보였습니다.
촉각의 효과: 촉각 정보를 프로프리오셉션 입력에 통합한 결과, 정밀 조작 및 접촉이 많은 작업에서 성공률이 유의미하게 향상되었습니다 (XR-1 의 경우 특히 두드러짐).
MIND-2 시스템 성능:
장기적 이동 조작 및 다중 로봇 협업 작업 (슈퍼마켓, 산업, 화학 실험실 시나리오) 에서 기존 단일 작업 모방 학습 및 VLA 베이스라인을 크게 능가했습니다.
오프라인 RL (IQL) 의 효과: 성공과 실패 데이터를 1:1 비율로 혼합하여 IQL 로 미세 조정 (Fine-tuning) 한 MIND-2-VLA 가 가장 높은 성공률 (슈퍼마켓 작업 90%, 산업 작업 80% 등) 을 기록했습니다.
Sim-to-Real 전이:
실제 데이터와 시뮬레이션 데이터를 혼합하여 학습한 모델이 실제 로봇 성능을 향상시켰으며, 특히 XR-1 과 Diffusion Policy 에서 시뮬레이션 데이터의 추가가 성능 향상에 기여함을 확인했습니다.
객체 일반화: 훈련된 모델이 훈련 데이터에 없던 색상, 모양, 재질의 객체 (예: 다른 색상의 그릇, 폼 블록 등) 에 대해서도 높은 성공률을 보이며 강력한 객체 수준의 일반화 능력을 입증했습니다.
5. 의의 (Significance)
RoboMIND 2.0 과 MIND-2 는 구체적 지능 (Embodied AI) 연구에 다음과 같은 중요한 의의를 가집니다:
데이터 중심 접근의 표준화: 다양한 로봇 형태와 환경, 멀티모달 센싱을 포괄하는 고품질 데이터셋의 중요성을 재확인하고, 향후 로봇 학습을 위한 새로운 벤치마크를 제시합니다.
촉각의 중요성 부각: 시각 정보만으로는 해결하기 어려운 접촉 기반 정밀 조작에서 촉각 피드백이 필수적임을 실증적으로 증명했습니다.
효율적인 학습 패러다임: 오프라인 강화학습 (IQL) 과 시뮬레이션 데이터의 활용을 통해 실제 데이터 수집의 비용과 위험을 줄이면서도 고성능 정책을 학습할 수 있음을 보여주었습니다.
실용적 적용 가능성: 가정과 산업 현장의 복잡한 장기적 작업을 수행할 수 있는 일반화 가능한 로봇 제어 시스템을 제시하여, 실제 세계에서의 로봇 배포 가능성을 크게 높였습니다.
이 연구는 로봇이 다양한 환경과 형태에서 인간과 유사한 수준의 유연성과 지능을 갖추기 위한 핵심적인 토대를 마련했다는 점에서 의의가 큽니다.