IGen: Scalable Data Generation for Robot Learning from Open-World Images
IGen 은 오픈 월드 이미지를 3D 장면 표현으로 변환하고 비전 - 언어 모델의 추론 능력을 활용해 실행 가능한 로봇 행동을 생성함으로써, 실제 데이터 수집의 한계를 극복하고 일반 로봇 정책 학습을 위한 확장 가능한 시각 - 운동 데이터 생성을 가능하게 하는 프레임워크입니다.
이 논문은 **"로봇이 실제로 움직여 데이터를 모으는 대신, 인터넷에 떠도는 수많은 사진 하나만으로도 일을 배울 수 있다"**는 획기적인 방법을 소개합니다. 이를 IGen이라고 부릅니다.
비유하자면, 로봇이 '실제 요리사'가 되어 재료를 사서 요리하는 과정 (기존 방식) 을 거치지 않고, '요리책의 사진' 하나만 보고도 요리를 완벽하게 익히는 것과 같습니다.
1. 왜 이런 기술이 필요한가요? (문제 상황)
지금까지 로봇을 가르치려면, 사람이 직접 로봇을 조종해서 "이것을 집어라", "저것을 옮겨라" 하는 행동을 수천 번, 수만 번 반복해서 기록해야 했습니다.
문제점: 이는 마치 비행기 조종사가 실제 비행기를 타고 수천 번 훈련해야 하는 것처럼 시간도 많이 들고, 비용도 비싸며, 위험하기도 합니다. 게다가 배운 기술은 그 특정 장소에서만 통하는 경우가 많아, 다른 곳으로 가면 다시 처음부터 배워야 합니다.
2. IGen 은 어떻게 해결하나요? (해결책)
IGen 은 인터넷에 있는 아무 사진 (예: "꽃에 물을 주는 사진") 하나만 가져와서 로봇이 배울 수 있는 완벽한 훈련 데이터를 만들어냅니다.
이 과정은 크게 3 단계로 나뉩니다.
1 단계: 사진 속 세상을 3D 놀이터로 변환하기 🎨
비유: 평면적인 사진을 입체적인 레고 조립도로 바꾸는 작업입니다.
작동 원리: AI 가 사진 속 물체 (꽃, 물병, 테이블) 를 인식하고, 이것이 공간에서 어디에 있는지 3 차원 좌표로 변환합니다. 마치 사진 속의 사물을 꺼내어 실제 로봇이 다룰 수 있는 '가상의 3D 공간'에 배치하는 것과 같습니다.
2 단계: 로봇에게 "어떻게 해야 할지" 생각하게 하기 🧠
비유:명령을 내리는 지휘자가 등장합니다.
작동 원리: "꽃에 물을 주라"는 명령을 받으면, AI(시각 - 언어 모델) 가 이를 분석합니다. "먼저 물병을 잡고, 들어 올린 뒤, 꽃 위로 가져가야 해"라고 단계별 계획을 세웁니다. 그리고 로봇의 손 (엔드 이펙터) 이 정확히 어디로 움직여야 하는지 수학적 좌표로 계산해냅니다.
3 단계: 로봇이 움직이는 모습을 만들어내기 🎬
비유:가상 현실 (VR) 영화 촬영입니다.
작동 원리: 계산된 로봇의 움직임대로 가상의 로봇이 움직이면, 그 과정에서 물체가 어떻게 움직이고 배경이 어떻게 변하는지 점 (Point Cloud) 으로 된 동영상을 만들어냅니다. 이때 물리 법칙 (중력, 충돌 등) 을 따르도록 하여, 마치 실제 촬영한 것처럼 자연스러운 영상을 생성합니다.
3. 이 기술의 놀라운 점 (결과)
논문의 실험 결과는 정말 놀랍습니다.
실제 로봇 없이도 학습 가능: 사람이 한 번도 로봇을 조종해 본 적이 없어도, IGen 이 만든 가상의 데이터만으로도 로봇이 실제 세계에서 일을 잘 해냈습니다.
실제 데이터보다 더 잘할 때도 있음: 때로는 사람이 직접 모은 100 개의 데이터보다, IGen 이 만들어낸 1,000 개의 데이터로 학습한 로봇이 더 똑똑하게 움직였습니다.
무한한 확장성: 인터넷에 있는 사진은 끝이 없습니다. 이 기술을 쓰면 어떤 환경에서도 로봇을 가르칠 수 있는 무한한 도서관을 갖게 되는 셈입니다.
4. 한 줄 요약
IGen 은 "인터넷의 사진 한 장"을 "로봇이 배울 수 있는 무한한 훈련 데이터"로 바꿔주는 마법 상자입니다.
이제 로봇은 더 이상 비싼 장비와 긴 시간, 그리고 위험한 현장 훈련 없이도, 우리가 매일 보는 사진들 속에서 세상을 배우고 성장할 수 있게 되었습니다.
IGen: 오픈 월드 이미지 기반의 로봇 학습을 위한 확장 가능한 데이터 생성
1. 문제 정의 (Problem)
데이터 수집의 한계: 범용 로봇 정책 (Generalist Robotic Policies) 을 학습시키기 위해서는 대규모의 시각 - 동작 쌍 (Visual-Action Pairs) 데이터가 필요하지만, 실제 로봇을 통한 데이터 수집은 노동 집약적이며 비용이 많이 들고 특정 환경에 국한되는 경향이 있습니다.
오픈 월드 이미지의 활용 부재: 인터넷상의 오픈 월드 이미지는 방대한 다양성과 실제 로봇 작업과 자연스럽게 일치하는 장점이 있으나, 로봇의 실행 가능한 동작 (Action) 정보가 결여되어 있어 로봇 학습에 직접 활용하기 어렵습니다.
기존 방법의 한계:
Real-to-Sim-to-Real: 물리적 작업 공간을 명시적으로 재구성해야 하므로 확장성이 떨어집니다.
비디오 생성 모델: 물리 법칙을 따르는 명시적인 로봇 동작을 제공하지 못하거나, 긴 시간 범위 (Long-horizon) 의 복잡한 작업 생성에 어려움을 겪습니다.
2. 방법론 (Methodology)
IGen 은 비구조화된 오픈 월드 이미지를 로봇이 실행 가능한 시각 - 운동 (Visuomotor) 데이터로 변환하는 프레임워크입니다. 주요 파이프라인은 다음과 같은 3 단계로 구성됩니다.
1 단계: 픽셀에서 구조화된 3D 표현으로 변환 (Scene Reconstruction)
입력: 단일 오픈 월드 RGB 이미지.
3D 재구성:
깊이 및 기하학 추정: Metric3Dv2 와 같은 기초 비전 모델을 사용하여 깊이 (Depth) 와 기하학적 구조를 추정합니다.
객체 분할 및 마스킹: SAM (Segment Anything Model) 을 사용하여 작업 관련 객체를 식별하고 마스킹합니다.
3D 객체 생성: TRELLIS 와 같은 3D 생성 모델을 사용하여 단안 (Monocular) 뷰에서 객체의 완전한 3D 형태와 외관을 재구성하고 점구름 (Point Cloud) 으로 변환합니다.
배경 복원: Inpainting 모델을 사용하여 제거된 객체의 배경을 복원하고, 이를 3D 점구름으로 변환합니다.
공간 키포인트 추출: DINOv2 를 사용하여 특징을 추출하고 K-means 클러스터링을 통해 공간적 키포인트 (Spatial Keypoints) 를 생성합니다. 이는 로봇의 작업 공간 이해를 위한 구조화된 표현입니다.
2 단계: 공간 계획 및 행동 생성 (Spatial Planning & Behavior Generation)
고수준 작업 계획: 비전 - 언어 모델 (VLM) 에게 이미지, 3D 키포인트 좌표, 그리고 자연어 작업 지시 (Task Instruction) 를 입력합니다.
VLM 은 전체 작업을 하위 단계 (Sub-stages) 로 분해하고, 각 단계에 대한 동작 설명을 생성합니다.
저수준 제어 명령 생성:
VLM 은 3D 키포인트 좌표를 기반으로 이동 거리, 들어 올리는 높이 등의 파라미터를 추론합니다.
이를 Python 기반의 실행 가능한 제어 함수 (SE(3) 엔드 이펙터 포즈 시퀀스) 로 변환합니다.
시뮬레이션 실행: 생성된 제어 명령을 Isaac Sim 환경에서 실행하여 로봇의 궤적 (Trajectory) 과 엔드 이펙터 포즈를 생성합니다.
3 단계: 경험 합성 및 시각 관측 생성 (Experience Synthesis)
동적 점구름 합성:
로봇의 엔드 이펙터 포즈 궤적을 기반으로, 잡힌 객체의 점구름을 강체 변환 (Rigid-body transformation) 하여 움직임을 시뮬레이션합니다.
정적인 배경 점구름, 로봇 점구름, 조작된 객체 점구름을 결합하여 전체 작업 시퀀스를 구성합니다.
렌더링: 가상 카메라를 통해 점구름 시퀀스를 프레임 단위로 렌더링하여, 실제 로봇이 보는 것과 유사한 시각적 관측 (Visual Observations) 을 생성합니다.
결과: 작업 지시와 일치하는 시각적 관측과 실행 가능한 동작 궤적의 쌍 (Paired Data) 이 생성됩니다.
3. 주요 기여 (Key Contributions)
확장 가능한 데이터 생성 프레임워크: 오픈 월드 이미지에서 대규모 시각 - 동작 데이터셋을 자동으로 생성하는 IGen 을 제안했습니다. 이는 인간 개입 없이도 다양한 장면, 지시어, 장시간 작업에 적용 가능합니다.
비구조화 이미지에서 실행 가능한 3D 표현으로의 변환: 단순한 2D 픽셀을 로봇의 작업 추론과 운동 계획에 적합한 3D 점구름 및 키포인트 표현으로 변환하여 물리적으로 일관된 행동을 생성합니다.
시뮬레이션 없는 점구름 합성: 전통적인 물리 기반 시뮬레이션 구축 없이도, 점구름의 강체 변환을 통해 사실적인 시각 관측을 생성하는 경량화된 방법을 제시했습니다.
실제 로봇 학습에서의 검증: 인간이 수집한 데이터 없이 IGen 으로 생성된 데이터만으로 학습된 정책이 실제 세계의 조작 작업을 성공적으로 수행함을 입증했습니다.
4. 실험 결과 (Results)
시각적 충실도 (Visual Fidelity): 기존 Real-to-Sim 방법 (Simpler 등) 과 비교했을 때, IGen 이 생성한 장면은 원본 이미지와의 시각적 유사도 (PSNR, SSIM, LPIPS) 에서 월등히 높은 성능을 보였습니다.
행동 품질 (Action Quality):
지시 따르기 (Instruction Following) 및 물리 정렬 (Physics Alignment): DreamGen Bench 에서 GPT-4o, Qwen-VL 등 다양한 평가 모델을 통해 평가한 결과, IGen 은 TesserAct, Cosmos 와 같은 기존 비디오 생성 모델들보다 지시 따르기 성공률과 물리 법칙 준수 측면에서 압도적으로 우수했습니다.
계산 효율성: IGen 은 기존 방법들보다 약 30~200 배 더 높은 데이터 생성 효율성을 보였습니다 (GPU 메모리 8.3GB, 샘플당 약 18.6 초).
실제 로봇 학습 (Real-World Transfer):
Franka Research 3 로봇을 사용하여 '꽃에 물 주기', '상자 치기', '장난감 배치' 등의 작업을 수행했습니다.
성능 비교: 인간 원격 조종 (Teleoperation) 데이터 100 개로 학습한 모델보다, IGen 으로 생성된 데이터 100 개로 학습한 모델이 더 높은 성공률을 보였습니다.
확장성: IGen 데이터 1,000 개로 학습한 모델은 인간 데이터 100 개로 학습한 모델보다 훨씬 높은 성능 (예: 병 배치 작업에서 66.7% vs 58.3%) 을 달성했습니다.
5. 의의 및 결론 (Significance)
IGen 은 로봇 학습의 핵심 병목 현상인 '대규모 고품질 데이터 부족' 문제를 해결할 수 있는 강력한 솔루션을 제시합니다.
비용 절감 및 확장성: 고비용의 실제 로봇 데이터 수집을 대체하거나 보완하여, 인터넷상의 방대한 이미지 자원을 로봇 학습에 활용할 수 있게 합니다.
범용 로봇 정책의 발전: 오픈 월드 이미지에서 학습된 정책이 실제 세계에서도 일반화되어 작동할 수 있음을 증명함으로써, 범용 로봇 (Generalist Robot) 개발의 새로운 패러다임을 열었습니다.
미래 전망: 이 연구는 로봇이 다양한 환경에서 인간과 상호작용할 수 있는 능력을 키우는 데 있어 데이터 중심 접근법의 중요성을 강조하며, 로봇 학습의 민주화와 확장성을 크게 향상시킵니다.