DreamDojo: A Generalist Robot World Model from Large-Scale Human Videos
DreamDojo는 44,000시간의 1인칭 시점 인간 영상을 통해 학습된 파운데이션 월드 모델로서, 연속적인 잠재 행동(latent actions)을 통해 다양한 정교한 상호작용을 학습하며, 이를 통해 개방형 세계의 접촉이 빈번한 환경에서 범용 로봇을 위한 실시간 시뮬레이션, 정밀한 행동 제어 가능성, 그리고 효과적인 정책 계획을 가능하게 합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 로봇에게 요리, 청소, 수리, 장난감 놀이 등 인간이 할 수 있는 모든 것을 가르치고 싶다고 상상해 보세요. 문제는 로봇은 비싸고, 쉽게 고장 나며, 로봇의 모든 기술을 가르칠 만큼 로봇 영상 데이터가 충분하지 않다는 점입니다.
DreamDojo는 이 문제를 해결하는 새로운 로봇용 "두뇌"입니다. 이는 로봇 영상을 통해 배우는 대신 인간의 영상으로부터 학습하는 방식입니다. 이것은 마치 로봇이 모든 작업을 직접 수행하기 위해 매번 로봇 영상을 찍는 대신, 유튜브나 틱톡에 올라온 수백만 시간의 일상적인 인간 영상을 보고 배우는 것과 같습니다.
작동 원리는 다음과 같이 간단한 개념으로 나누어 설명할 수 있습니다.
1. 거대한 도서관 (데이터)
보통 로봇 학습 데이터는 "빨간 블록을 집는 법"에 대한 책 몇 권만 있는 작은 도서관과 같습니다. 하지만 DreamDojo의 도서관은 44,000시간의 인간 영상이 담긴 거대하고 무한한 도서관입니다.
- 규모: 이는 단 한 권의 공책과 미국 의회 도서관 전체를 비교하는 것과 같습니다.
- 다양성: 주방에서 요리하는 것부터 차고에서 자동차를 수리하는 것까지, 수천 가지의 서로 다른 물체와 기술을 다룹니다.
- 비법 소스: 이 영상들에는 "로봇을 위한 지침"이 붙어 있지 않기 때문에, 연구진은 **잠재적 행동(Latent Actions)**이라는 특별한 번역기를 발명했습니다. 누군가 병을 따는 영상을 본다고 상상해 보세요. 로봇은 그 사람의 정확한 근육 움직임을 볼 수는 없지만, 이 번역기는 병과 손이 어떻게 움직이는지를 관찰함으로써 "비틀고 당기는" 의도와 물리 법칙을 파악해 냅니다. 이는 영상을 어떤 로봇이라도 이해할 수 있는 보편적인 설명서로 변환해 줍니다.
2. 시뮬레이터 (세계 모델)
로봇 두뇌가 이 영상들로부터 학습을 마치면, 그것은 하나의 **세계 모델(World Model)**이 됩니다.
- 비유: 세계 모델은 조종사를 위한 비행 시뮬레이터와 같습니다. 조종사가 실제 비행기를 타기 전에 시뮬레이터에서 연습하는 것과 같습니다. 시뮬레이터에서 실수를 하더라도 아무도 다치지 않습니다.
- DreamDojo의 작동 방식: 당신이 DreamDojo에게 "로봇이 컵을 향해 손을 뻗었지만 놓치는 상황을 상상해 봐"라고 말하면, 모델은 그다음에 어떤 일이 일어날지에 대한 영상을 생성합니다. 이 모델은 물리 법칙을 이해합니다. 만약 당신이 컵을 밀면 컵은 미끄러지고, 너무 세게 밀면 테이블 아래로 떨어질 것이라는 점을 알고 있습니다. 이 모델은 한 번도 본 적 없는 물체나 환경에 대해서도 즉각적으로 결과를 시뮬레이션할 수 있습니다.
3. 속도 향상 (증류)
원래의 "두뇌"는 매우 똑똑하지만 느립니다. 마치 수학 문제를 푸는 데 10분이 걸리는 천재 교수와 같습니다. 로봇이 실시간으로 움직이려면 인간처럼 빠르게 생각해야 합니다.
- 해결책: 연구진은 **증류(Distillation)**라고 불리는 과정을 사용했습니다. 그들은 느리지만 똑똑한 교수(원본 모델)를 가져와서, 그를 흉내 내는 빠르고 젊은 학생(학생 모델)을 훈련시켰습니다.
- 결과: 이제 학생 모델은 초당 10.81 프레임의 속도로 미래를 예측할 수 있습니다. 이는 실시간으로 구동하기에 충분한 속도입니다. VR 컨트롤러로 가상 로봇을 제어하면, 로봇은 실제 사람처럼 즉각적으로 움직이고 반응할 것입니다.
무엇을 할 수 있는가? (논문의 주장 기반)
논문은 이 기술이 활용되는 세 가지 주요 방식을 강조합니다.
정책 테스트 ("로봇을 위한 비행 시뮬레이터"):
로봇을 과일 포장 작업에 투입하기 전에, DreamDojo에서 그 "두뇌"를 테스트할 수 있습니다. 논문에 따르면, 만약 어떤 로봇 전략이 DreamDojo 시뮬레이션에서 잘 작동한다면, 실제 세계에서도 거의 확실하게 잘 작동합니다(99.5%의 상관관계). 이는 시간을 절약하고 로봇이 학습하는 동안 물건을 부수는 것을 방지합니다.앞서 계획하기 ("체스 플레이어"):
로봇이 복잡한 작업을 수행해야 할 때, DreamDojo를 사용하여 다양한 결과를 "꿈꿀" 수 있습니다. 로봇은 머릿속으로 사과를 잡는 다섯 가지 서로 다른 방법을 시도해 보고, 어떤 방법이 최선의 결과로 이어지는지 확인한 다음, 그 특정 동작을 실행할 수 있습니다. 이를 통해 로봇은 훨씬 더 똑똑해지고 어려운 작업에서도 성공률이 높아집니다.실시간 원격 제어 ("가상 쌍둥이"):
모델이 매우 빠르기 때문에, 인간은 VR 헤드셋을 쓰고 실시간으로 가상 로봇을 제어할 수 있습니다. 인간이 손을 움직이면 가상 로봇도 즉시 움직입니다. 이는 인간이 직접 하기에는 너무 위험하거나 어려운 작업에 인간이 원격으로 "로봇이 되는" 것을 가능하게 합니다.
요약
DreamDojo는 무질서하고 다양한 실제 세상과 정밀한 로봇의 세계 사이를 잇는 가교 역할을 합니다. 온라인상의 방대한 인간 활동으로부터 학습하고, 특별한 "번역기"를 사용하여 라벨 없이도 행동을 이해함으로써, DreamDojo는 미래를 상상하고, 아이디어를 안전하게 테스트하며, 실시간으로 행동할 수 있는 로봇 두뇌를 만들어냅니다. 이는 로봇을 단순히 명시적으로 배운 것만 할 줄 아는 경직된 기계에서, 세상이 어떻게 돌아가는지 이해하는 유연한 에이전트로 변화시킵니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.