OmniTrack: General Motion Tracking via Physics-Consistent Reference
이 논문은 인간과 로봇 간의 물리적 불일치로 인한 문제를 해결하기 위해 시뮬레이션에서 물리적으로 타당한 참조 동작을 생성한 후 이를 추적하는 2 단계 프레임워크인 'OmniTrack'을 제안하여, 인간과 유사한 복잡한 동작을 포함한 안정적이고 일반적인 로봇 운동 추적을 가능하게 합니다.
상상해 보세요. 인간이 춤을 추는 영상을 보고 로봇에게 "이거 똑같이 따라 해!"라고 시켰다고 칩시다. 하지만 인간과 로봇은 **몸의 구조 (뼈대, 근육, 무게 중심)**가 완전히 다릅니다.
인간: 발이 땅에 닿을 때 자연스럽게 체중을 싣습니다.
로봇: 인간 데이터를 그대로 가져오면, 발이 공중에 뜬 채로 걷거나 (Floating), 발이 땅을 뚫고 지나가는 (Penetration) 기이한 현상이 발생합니다.
기존 기술들은 이 불가능한 데이터를 로봇이 따라 하려고 애쓰다 보니, 로봇은 "이걸 따라 하려고 하면 넘어져!"라는 딜레마에 빠졌습니다. 마치 발이 없는 사람이 신발을 신으려다 넘어지는 상황과 비슷하죠. 로봇은 "동작을 따라 하는 것"과 "넘어지지 않는 것" 사이에서 혼란을 겪으며 실패했습니다.
💡 해결책: 오미트랙의 두 단계 전략
오미트랙은 이 문제를 해결하기 위해 **"먼저 로봇에게 맞는 현실적인 동작을 만들고, 그다음에 따라 하게 한다"**는 두 단계 전략을 사용합니다.
1 단계: "현실감 있는 리허설" (Physical Motion Generation)
비유: 연극 배우가 무대에 오르기 전에, 무대 감독이 배우의 동작을 수정하는 과정입니다.
작동 원리: 컴퓨터 시뮬레이션 속에서, 로봇이 물리 법칙 (중력, 마찰력 등) 을 완벽하게 이해하는 **'초능력 감독'**이 인간 동작 데이터를 받아봅니다.
이 감독은 "이건 로봇이 하면 넘어져!"라고 판단되면, 로봇이 실제로 가능하도록 동작을 수정합니다. 발이 땅에 닿는 순간, 무게 중심이 어떻게 이동해야 하는지 등 물리적으로 불가능한 부분 (공중에 뜀, 땅 뚫기) 을 모두 제거합니다.
결과: 로봇이 실제로 수행할 수 있는 **완벽한 '리허설 영상'**이 만들어집니다.
2 단계: "실전 연습" (General Motion Tracking)
비유: 이제 배우가 수정된 리허설 영상을 보고 무대 (실제 로봇) 에서 공연을 하는 것입니다.
작동 원리: 로봇은 이제 물리적으로 불가능한 명령을 받지 않습니다. 대신 1 단계에서 만들어낸 안전하고 현실적인 동작만 따라 하면 됩니다.
로봇은 "내가 넘어질까 봐 걱정할 필요 없이, 오직 동작을 따라 하는 데만 집중"할 수 있게 됩니다. 덕분에 복잡한 공중제비나 손바닥 돌리기 같은 고난이도 동작도 안정적으로 수행할 수 있습니다.
🚀 오미트랙의 놀라운 성과
이 방법을 적용한 결과, 로봇은 다음과 같은 놀라운 능력을 보여주었습니다:
오래 지속되는 안정성: 로봇이 1 시간 이상 연속으로 다양한 동작 (걷기, 뛰기, 춤추기, 무술 동작 등) 을 넘어지지 않고 수행했습니다.
고난이도 액션 성공: 공중제비 (Flip) 나 손바닥 돌리기 (Cartwheel) 처럼 매우 역동적이고 위험한 동작도 성공적으로 수행했습니다.
실시간 원격 조종 (Teleoperation): 사람이 VR 안경을 쓰거나 모션 캡처 장비를 통해 실시간으로 움직이면, 로봇이 그 사람의 동작을 즉시 따라 합니다. 사람이 넘어질 듯 움직여도 로봇은 물리 법칙을 고려해 자연스럽게 균형을 잡으며 따라갑니다.
🌟 핵심 요약
기존 기술은 "인간의 모든 동작을 무조건 따라 하려다" 실패했습니다. 하지만 오미트랙은 "로봇이 할 수 있는 현실적인 동작으로 먼저 수정한 뒤, 그걸 완벽하게 따라 하게 함으로써" 성공했습니다.
마치 비행기 조종사가 비행기 기체 한계를 고려한 시뮬레이션으로 훈련한 뒤, 실제 하늘을 나는 것과 같습니다. 이 기술 덕분에 로봇은 이제 인간처럼 유연하고 역동적으로 움직일 수 있는 새로운 시대를 열었습니다.
1. 문제 정의 (Problem Statement)
인간형 로봇 (Humanoid) 이 다양한 인간 동작을 학습하고 추종하는 것은 로봇 제어의 핵심 과제이나, 기존 방법론들은 다음과 같은 근본적인 한계에 직면해 있습니다.
형태 및 동역학의 차이 (Embodiment Gap): 인간과 로봇의 신체 구조 (관절 범위, 체중 분포, 자유도 등) 가 다르기 때문에, 인간의 모션 캡처 데이터를 로봇에 단순히 매핑 (Retargeting) 할 경우 물리적으로 불가능한 아티팩트가 발생합니다.
주요 아티팩트: 공중에 뜨는 현상 (Floating), 바닥 침투 (Penetration), 미끄러짐 (Foot skating), 불균형한 질량 중심 운동 등.
학습의 모순 (Conflict): 이러한 물리적으로 불가능한 참조 모션을 추종하려 하면 로봇은 안정성을 잃고 넘어지거나, 반대로 안정성을 유지하려다 참조 모션을 따르지 못하게 됩니다.
부분 관측성 (Partial Observability): 실제 환경에서는 로봇이 전역 위치나 속도 같은 '특권 정보 (Privileged Information)'를 알 수 없으므로, 참조 모션이 물리적으로 불가능한지 판단하고 보정하는 것이 매우 어렵습니다. 기존 방법들은 이러한 아티팩트를 보정하는 과제를 추종 정책 (Tracking Policy) 에 동시에 부과하여 학습의 불안정성과 일반화 실패를 초래했습니다.
2. 방법론 (Methodology)
저자들은 OMNITRACK을 제안하며, 물리적 실현 가능성 (Physical Feasibility) 과 일반 모션 추종 (General Motion Tracking) 을 명시적으로 분리하는 2 단계 학습 프레임워크를 도입했습니다.
Stage 1: 물리적 모션 생성 (Physical Motion Generation)
목적: 원시 (Raw) 참조 모션에서 물리적으로 불가능한 아티팩트를 제거하고, 로봇의 동역학에 부합하는 정제된 참조 궤적을 생성합니다.
구현:
시뮬레이션 환경에서 **특권 정보 (Global pose, velocity, contact state 등)**를 모두 가진 '일반적 정책 (Generalist Policy)'을 훈련합니다.
이 정책은 참조 모션을 추적하되, 로봇의 동역학 제약 (토크 한계, 접촉 상태 등) 을 엄격히 준수하도록 **궤적 롤아웃 (Trajectory Rollout)**을 수행합니다.
결과: 침투나 공중 부유가 제거되고, 동역학적으로 일관된 (Dynamics-consistent) 고품질 참조 궤적이 생성됩니다. 이 단계에서는 도메인 랜덤화 (Domain Randomization) 를 적용하지 않고 모션 명령에 노이즈만 주입하여 재구성 정확도를 극대화합니다.
Stage 2: 일반 모션 추종 (General Motion Tracking)
목적: Stage 1 에서 생성된 물리적으로 타당한 참조 궤적을 기반으로, 실제 로봇 (부분 관측 조건) 에서 안정적으로 동작을 추종하는 정책을 학습합니다.
구현:
입력: 실제 로봇 센서에서 얻은 프로프리오셉티브 정보 (관절 각도, 속도, IMU 등) 만을 사용합니다.
학습 전략: 참조 모션이 이미 물리적으로 타당하므로, 정책은 '불가능한 목표 보정'에 에너지를 쏟지 않고 순수한 '모션 추종'과 'Sim-to-Real 전이'에 집중할 수 있습니다.
보상 함수: 접촉 일관성 (Contact consistency) 과 동작의 부드러움을 장려하는 보상 항목을 추가하며, 관찰 노이즈와 광범위한 도메인 랜덤화를 적용하여 실제 환경 적응력을 높입니다.
3. 주요 기여 (Key Contributions)
이원적 학습 프레임워크: 물리적 실현 가능성과 일반 모션 추종을 분리하여, 단일 정책이 1 시간 이상 지속되는 다양한 복잡한 동작 (달리기, 손바닥 회전, 춤 등) 을 안정적으로 수행할 수 있게 했습니다.
고품질 물리 일관성 데이터셋 구축: 원시 인간 모션 데이터에서 동역학적 아티팩트를 제거하여, 인간형 로봇 제어의 표준 벤치마크가 되는 물리적으로 일관된 로봇 모션 데이터를 생성했습니다.
강력한 Sim-to-Real 전이 및 실시간 텔레오퍼레이션: 실제 로봇 (Unitree G1) 에서 제로샷 (Zero-shot) 전이를 성공적으로 달성했으며, 인간操作员의 불규칙하고 노이즈가 많은 실시간 입력에도 안정적으로 반응하는 동적 텔레오퍼레이션을 구현했습니다.
4. 실험 결과 (Results)
시뮬레이션 성능:
기존 방법 (Dagger, OmniH2O, ExBody2 등) 과 비교했을 때, **성공률 (Success Rate)**과 **추종 오차 (MPJPE)**에서 모든 지표에서 우위를 보였습니다.
특히 고동적 (High-dynamic) 이고 접촉이 많은 동작 (뒤집기, 손바닥 회전 등) 에서 기존 방법들의 성능이 급격히 저하되는 반면, OmniTrack 은 84.81% 의 높은 성공률을 유지했습니다.
데이터셋 크기가 커질수록 기존 방법은 학습이 불안정해지거나 성능이 떨어지는 반면, OmniTrack 은 물리적으로 일관된 참조를 사용하여 확장성 (Scalability) 을 입증했습니다.
실제 로봇 실험 (Unitree G1):
장기 안정성: 다양한 동작 (걷기, 뛰기, 춤, 무술, 넘어짐 복구, 공중제비 등) 을 1 시간 이상 연속적이고 안정적으로 추종했습니다.
고동적 동작: 17 번 연속으로 측면 공중제비 (Side flips) 를 성공적으로 수행하며 동역학적 일관성을 입증했습니다.
실시간 텔레오퍼레이션: 모션 캡처 시스템과 VR 헤드셋을 통한 실시간 입력에 대해, 입력 데이터에 노이즈와 불연속성이 있더라도 로봇은 매끄럽고 인간다운 동작을 유지하며 안정적으로 반응했습니다.
Sim-to-Real 정렬: 시뮬레이션과 실제 로봇 간의 추종 오차 (관절 위치, 회전, 각속도) 가 매우 유사하게 나타나 효과적인 전이 학습을 확인했습니다.
5. 의의 및 결론 (Significance)
이 논문은 인간형 로봇의 범용 제어 (General Control) 를 위한 중요한 패러다임 전환을 제시합니다.
핵심 통찰: "추종 정책이 물리적으로 불가능한 참조를 보정하도록 강요하는 것"은 비효율적이며 불안정합니다. 대신 학습 전 단계에서 물리적 일관성을 보장하는 참조 데이터를 생성함으로써, 정책이 본질적인 추종 능력과 Sim-to-Real 전이에 집중하게 하는 것이 핵심입니다.
영향: 이 접근법은 인간형 로봇이 복잡한 동적 환경에서도 장시간 안정적으로 작동하고, 인간과 자연스럽게 상호작용 (Teleoperation) 할 수 있는 기반을 마련했습니다. 이는 향후 인간형 로봇의 실용화와 범용성 확보에 중요한 이정표가 될 것으로 기대됩니다.