WholeBodyWAM: Learning Whole-Body World Action Models with Scalable Motion Priors
이 논문은 대규모의 이종 모션 코퍼스(UniMotion-4K)를 활용하여 전이 가능한 모션 프라이어를 사전 학습함으로써, 비대칭 Mixture-of-Transformers 어텐션을 통해 비디오 및 액션 전문가와 결합되었을 때 데이터 효율성과 다운스트림 조작 성능을 크게 향상시키는 휴머노이드 월드-액션 모델인 WholeBodyWAM을 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
로봇이 인간처럼 움직이게 만들기 위해, 엔지니어들은 근본적인 문제에 직면합니다. 바로 기계에게 전신을 조절하는 법을 가르치는 것이 매우 어렵다는 점입니다. 인간은 컵을 향해 손을 뻗거나 방을 가로질러 걸을 때 각 개별 근육을 어떻게 움직일지 생각하지 않습니다. 몸은 하나의 유동적인 단위로서 움직입니다. 그러나 로봇의 경우, 모든 관절과 사지를 각각 별도로 제어해야 하며, 특정 로봇에게 이 기술을 가르치기 위해 필요한 수백만 시간의 연습 데이터를 수집하는 것은 느리고 비용이 많이 들며 종종 불가능하기도 합니다. 과학자들이 언어를 이해하고 세상을 보는 강력한 모델들을 구축해 왔지만, 이러한 시스템들은 종-종 로봇 자신의 몸이 미래에 어떻게 움직일지를 예측하는 데 어려움을 겪으며, 대신 현재 일어나고 있는 일에 반응하는 것에 의존합니다. 이러한 한계는 로봇이 울퉁불퉁한 지면을 통과하며 무거운 상자를 운반하거나, 균형을 잃지 않고 물건을 집기 위해 무릎을 굽히는 것과 같이 앞을 내다보고 계획해야 하는 복잡한 과업을 수행하는 것을 어렵게 만듭니다.
연구진은 특정 로봇으로부터 얻은 값비싼 시연에만 의존하는 대신, 인터넷에 존재하는 방대한 인류의 움직임 라이브러리로부터 로봇이 학습하도록 가르침으로써 이 과제를 해결했습니다. 그들은 로봇의 신체를 위한 예측 엔진 역할을 하는 WHOLEBODYWAM이라는 새로운 시스템을 만들었습니다. 이 시스템은 단순히 영상을 보고 다음에 무엇을 할지 추측하는 대신, 시간이 흐름에 따라 신체가 어떻게 움직이는지에 대한 근저에 깔린 물리 법칙을 학습합니다. 이 시스템은 인간의 영상, 특화된 3D 모션 캡처 데이터셋, 그리고 다른 휴머노이드 로봇들로부터 기록된 4,100시간 이상의 움직임을 포함하는 UniMotion-4K라는 거대한 모션 데이터 모음으로 훈련되었습니다. 이 다양한 소스들을 하나의 공유된 움직임 언어로 변환함으로써, 시스템은 신체가 한 포즈에서 다른 포즈로 어떻게 전환되어야 하는지에 대한 일반적인 "직관"을 학습했습니다. 이 직관은 실제 휴머노이드 로봇으로 전이되어, 로봇이 자신의 미래 움직임을 예측하고 이전 방식들보다 훨씬 더 뛰어난 기술과 효율성으로 복잡한 전신 과업을 실행할 수 있게 해주었습니다.
이 작업의 핵심은 일반적인 움직임의 규칙을 배우는 것과 이를 특정 기계에 적용하는 법을 배우는 것을 분리하는 2단계 훈련 과정에 있습니다. 첫 번째 단계에서 시스템은 대상 로봇의 실제 명령을 단 하나도 보지 않은 채 거대한 인간 및 로봇 모션 데이터셋을 연구했습니다. 시스템은 "장난감을 집어라" 또는 "무릎을 꿇어라"와 같은 단순한 텍스트 설명에 기반하여 신체가 다음에 무엇을 할지 예측하는 법을 배웠습니다. 이는 인간다운 움직임에 필요한 조화로운 팔다리의 움직임과 균형을 이해하는 강력한 토대, 즉 예측적 사전 지식(predictive prior)을 형성했습니다. 두 번째 단계에서는 이 사전 훈련된 지식이 비디오 이해 모듈 및 액션 생성기와 결합되었습니다. 그 후 시스템은 특정 로봇인 TianGong 3.0으로부터 얻은 적은 수의 시연을 통해, 자신의 일반적인 움직임 이해를 해당 로봇의 관절이 실행해야 하는 구체적인 모터 명령으로 변환하는 법을 배웠습니다. 결정적으로, 시스템은 단순히 현재의 장면에 반응하는 것이 아니라, 학습된 지식을 사용하여 자신의 신체의 미래 상태를 상상하고, 이 예측을 사용하여 실시간으로 행동을 안내합니다.
여섯 가지 까다로운 실제 과업에 대해 테스트했을 때, 결과는 놀라웠습니다. 로봇은 장난감을 집거나, 세탁기에 빨랫감을 넣거나, 베개를 소파로 옮기거나, 테이블로 상자를 운반하는 등의 동작을 수행하도록 요청받았습니다. 이 과업들은 로봇이 동시에 몸을 굽히고, 걷고, 무릎을 꿇고, 물체를 조작하는 것을 요구했습니다. 새로운 시스템은 기존의 가장 우수한 방법들을 능가하며 모든 과업에서 현저히 높은 성공률을 달ей했습니다. 예를 들어, 로봇이 상자를 들어 올려 측면 테이블로 걷고 내려놓아야 하는 상자 전달 과업에서, 새 시스템은 73.3%의 성공률을 기록하며 다른 방식들보다 훨씬 높은 성과를 보였습니다. 연구진은 초기 "모션 전문가"를 훈련하는 데 더 많은 모션 데이터를 사용할수록 로봇의 성능이 향려졌다는 점을 발견했는데, 이는 시스템이 단순히 특정 사례를 암기한 것이 아니라 확장 가능한 기술을 진정으로 학습했음을 시사합니다. 더욱 중요한 것은, 연구진이 훈련을 위한 특정 로봇의 시연 양을 절반으로 줄였을 때도, 거대한 모션 데이터셋으로 사전 훈련된 로봇이 전체 시연 데이터로 훈련된 다른 로봇들보다 더 나은 성능을 보였다는 점입니다.
이 접근 방식은 환경의 변화를 처리하는 데 있어서도 탁ارية한 능력을 보여주었습니다. 연구진이 대상 바구니를 약간 옮기거나 로봇이 집어야 할 장난감의 색상과 모양을 변경했을 때, 시스템은 빠르게 적응하며 다른 모델들이 어려움을 겪는 상황에서도 높은 성능을 유지했습니다. 시스템은 미래의 영상을 생성하는 대신에 이를 수행함으로써 계산 비용이 많이 들고 속도가 느려지는 문제를 피했습니다. 대신, 시스템은 자신의 관절 위치를 직접 예측하여 약 363밀리초 만에 결정을 내릴 수 있었으며, 이는 실시간 제어가 가능한 충분한 속도였습니다. 이 연구는 로봇이 자신의 신체가 다르기 때문에 단순히 인간의 움직임을 복제할 수는 없지만, 인간 움직임의 방대한 패턴으로부터 학습하여 자신의 몸을 어떻게 움직일지에 대한 견고하고 예측적인 이해를 발달시킬 수 있음을 확인시켜 줍니다. 세상에 존재하는 풍부한 인간의 움직임 데이터를 활용함으로써, 이 방법은 복잡한 과업을 수행할 수 있을 뿐만 아니라 이전에 생각했던 것보다 훨씬 적은 시연만으로도 이를 학습할 수 있는 휴머노이드 로봇을 만드는 새로운 길을 제시합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.