← 최신 논문
💻 computer science

MotionWAM: Towards Foundation World Action Models for Real-Time Humanoid Loco-Manipulation

MotionWAM은 중간 비디오 디노이징 특징을 활용하여 협응된 동작 토큰을 예측함으로써 휴머노이드의 전신 로코-매니퓰레이션 제어를 통합하고, 이를 통해 전통적인 계층적 정책의 속도 및 일관성 한계를 극복하며 복잡한 작업에서 Vision-Language-Action 베이스라인을 크게 능가하는 실시간 파운데이션 월드 액션 모델이다.

원저자: Jia Zheng, Teli Ma, Yudong Fan, Zifan Wang, Shuo Yang, Junwei Liang

게시일 2026-06-09
📖 3 분 읽기☕ 가벼운 읽기

원저자: Jia Zheng, Teli Ma, Yudong Fan, Zifan Wang, Shuo Yang, Junwei Liang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇에게 인간처럼 도움을 줄 수 있는 능력을 가르치는 상황을 상상해 보세요. 보통 우리는 로봇을 두 단계로 나누어 가르칩니다. 먼저 로봇의 '뇌'(상체)가 물건을 잡는 법을 가르치고, 그다음 '다리'(하체)가 걷고 균형을 잡는 법을 가르칩니다. 문제는 이 두 부분이 서로 잘 소통하지 못한다는 점입니다. 뇌는 "컵을 잡아"라고 말하지만, 다리는 그저 "알았어, 네가 넘어지지 않게 앞으로 걸어갈게"라고만 답합니다. 이 때문에 다리가 단순히 '균형 잡기용'으로만 제한되어 있어, 공을 차거나 페달을 밟는 등의 동작은 할 수 없습니다.

MotionWAM은 전체 몸을 하나의 통합된 팀으로 취급함으로써 이 문제를 해결하는 새로운 로봇 뇌입니다. 이 기술이 어떻게 작동하는지 쉬운 비유를 통해 설명하겠습니다.

1. "영화 감독" vs "작가"

대부분의 로봇 뇌는 작가와 같습니다. 이들은 사진과 문장(예: "상자를 집어라")을 보고 이전에 보았던 것들을 바탕으로 다음 동작을 추측합니다. 이들은 물리 법칙이 어떻게 작용하는지, 혹은 사물이 시간이 지남에 따라 어떻게 움직이는지를 실제로 이해하지 못합니다.

MotionWAM은 다릅니다. 이 모델은 수천 시간의 영화를 본 영화 감독과 같습니다. 로봇에게 명령을 내리기 전, MotionWAM은 다음 몇 초간의 영화 장면이 어떻게 펼쳐질지 짧은 "정신적 시뮬레이션"을 실행합니다.

  • 비결: 장면 전체가 완전히 그려질 때까지(시간이 너무 오래 걸림) 기다리는 대신, MotionWAM은 장면이 그려지는 도중의 스케치를 봅니다. 이 스케치에서 미래 움직임의 '분위기'를 포착하여 즉시 로봇에게 어떻게 움직일지 알려줍니다. 이것이 실시간으로 빠르게 생각할 수 있는 비결입니다.

2. "통합 리모컨"

기존 시스템에서는 로봇에게 팔을 위한 리모컨과 다리를 위한 리모컨, 두 개의 리모컨이 있었습니다. 다리 리모컨은 매우 단순해서 오직 똑바로 걷거나 회전하는 법만 알고 있었습니다.

  • MotionWAM의 혁신: 이 모델은 온몸을 제어하는 단 하나의 통합 리모컨을 사용합니다. 로봇이 축구공을 차야 할 때, "차라"는 명령은 다리에만 내려지는 명령이 아닙니다. 이는 팔은 균형을 잡고, 상체는 기울이며, 발은 휘두르도록 하는 하나의 통합된 지시입니다. 이를 통해 로봇은 다리가 단순히 '균형을 잡는 용도'가 아니라 '작업의 일부'가 될 수 있음을 이해하게 되어, 기존의 "두 개 리모컨" 시스템으로는 불가능했던 페달 밟기나 축구공 차기 같은 동작을 수행할 수 있습니다.

3. "3단계 훈련 캠프"

이런 방식으로 로봇을 가르치는 것은 매우 어렵기 때문에, 연구진은 3단계 훈련 캠프를 사용했습니다.

  • 1단계 (영화광): 로봇에게 인간의 시점(머리에 고프로를 쓴 듯한 시점)에서 촬영된 수천 시간의 영상을 보여주었습니다. 로봇는 아직 움직임을 배우는 것이 아니라, 움직일 때 세상이 어떻게 보이는지를 배웠습니다. 즉, "시각의 물리 법칙"을 배운 것입니다.
  • 2단계 (번역가): 이러한 영화적 기술을 실제 로봇의 움직임으로 번격하는 법을 가르쳤습니다. 다양한 종류의 로봇 신체 데이터를 사용하여, 로봇이 특정 신체 형태에 국한되지 않고 "움직임"이라는 일반적인 개념을 이해하도록 했습니다.
  • 3단계 (특수 부대): 마지막으로, VR 고글을 쓴 인간 운영자가 유도하는 방식으로 특정 과제(카트 싣기, 화이트보드 닦기 등)를 연습하게 했습니다. 여기서 로봇은 영화에서 배운 지식을 실제 까다로운 작업에 적용하는 법을 배웠습니다.

결과

연구진이 이 9가지 어려운 과제(축구공 차기, 카트 싣기, 빨래하기 등)에 대해 MotionWAM을 테스트했을 때, 큰 성공을 거두었습니다.

  • 속도: 로봇이 넘어지지 않고 서 있기 위해 필요한 속도(초당 약 5회)로 실시간 구동이 가능할 만큼 빠르게 생각합니다.
  • 성공률: 기존의 가장 뛰어난 로봇 뇌들이 약 44%의 성공률을 보인 반면, MotionWAM은 **76%**의 높은 성공률을 기록했습니다.
  • "킥(Kick)" 요소: 가장 큰 성과는 발을 사용하는 작업에서 나타났습니다. 기존 로봇들은 공 주변을 걸어 다니려 했지만, MotionWAM은 실제로 공을 찼습니다.

핵심 요약

MotionWAM은 세상이 어떻게 움직이는지 이해하는 "영화 감독" 뇌를 부여하고, 온몸을 하나의 통합된 계획으로 제어하게 한다면, 걷기와 잡기를 별개의 문제로 취급하는 로봇보다 훨씬 더 복잡하고 인간다운 업무를 더 잘 수행할 수 있음을 증명했습니다.

한계점: 논문에서는 이 테스트가 특정 로봇 모델(Unitree G1)에서 진행되었음을 명시했습니다. 만약 카메라가 머리에 달려 있어 로봇이 들고 있는 물체를 놓치게 되면, 혼란을 느껴 작동을 멈출 수 있습니다. 또한 아직 다른 로봇 신체에 대한 테스트는 이루어지지 않았습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →