← 最新の論文
💻 computer science

MotionWAM: Towards Foundation World Action Models for Real-Time Humanoid Loco-Manipulation

MotionWAMは、中間ビデオデノイジング特徴量を利用して協調的なモーショントークンを予測することで、ヒューマノイドの全身的な移動・操作制御を統合し、従来の階層的ポリシーにおける速度と一貫性の限界を克服するとともに、複雑なタスクにおいてVision-Language-Actionベースラインを大幅に上回る、リアルタイムの基盤ワールドアクションモデルである。

原著者: Jia Zheng, Teli Ma, Yudong Fan, Zifan Wang, Shuo Yang, Junwei Liang

公開日 2026-06-09
📖 1 分で読めます☕ さくっと読める

原著者: Jia Zheng, Teli Ma, Yudong Fan, Zifan Wang, Shuo Yang, Junwei Liang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 ✨ これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ロボットに人間のようなお手伝いができるよう教える場面を想像してみてください。通常、ロボットの教育は2つの別々のステップで行われます。まず、「脳」(上半身)に物の掴み方を教え、次に「脚」(下半身)に歩き方やバランスの保ち方を教えます。問題は、この2つの部分がうまく連携できていないことです。脳が「そのコップを掴んで」と言っても、脚はただ「了解、転ばないように前方に歩くよ」と言うだけです。これでは、ボールを蹴ったりペダルを踏んだりといった動作はできません。なぜなら、脚は「バランスを取るための動作」しか許されていないからです。

MotionWAMは、全身を一つの協調したチームとして扱うことで、この問題を解決する新しいロボットの「脳」です。その仕組みを、簡単な例えを用いて説明します。

1. 「映画監督」対「脚本家」

ほとんどのロボットの脳は、脚本家のようなものです。彼らは画像と文章(例えば「箱を持ち上げる」など)を見て、過去に見たものに基づいて次の動きを予測しようとします。しかし、彼らは物理学がどのように機能するかや、時間が経過するにつれて物がどう動くかという本質的な理解を持っていません。

MotionWAMは異なります。それは、何千時間もの映画を観てきた映画監督のようなものです。ロボットに指示を出す前に、次の数秒間の映画がどのようなシーンになるか、素早い「メンタル・シミュレーション(脳内シミュレーション)」を行います。

  • コツ: シーン全体が完全に描き切られるのを待つ(それでは時間がかかりすぎる)のではなく、MotionWAMはシーンが描かれている最中の「スケッチ」を観察します。そのスケッチから未来の動きの「雰囲気(バイブス)」を掴み取り、即座にロボットへ動きを指示します。これが、リアルタイムで動けるほど速く思考できる理由です。

2. 「統合されたリモコン」

従来のシステムでは、ロボットには腕用のリモコンと脚用のリモコンの2つがありました。脚用のリモコンは非常に単純で、ただ真っ直ぐ歩くか曲がるかを知っているだけでした。

  • MotionWAMの革新性: これは全身を操作するたった一つのリモコンを使用します。ロボットがサッカーボールを蹴る必要があるとき、「キック」という命令は脚だけの指示ではありません。それは、腕をバランスさせ、胴体を傾け、足を振ることを同時に指示する、単一の命令となります。これにより、ロボットはペダルを踏んだりボールを蹴ったりといった動作が可能になります。従来の「2つのリモコン」方式では、脚を単なる「バランス維持」のためではなく「タスクの一部」として理解できなかったため、こうした動作は不可能でした。

3. 「3段階のトレーニングキャンプ」

このようにロボットを教えるのは困難なため、研究者たちは3段階のトレーニングキャンプを用いました。

  • ステージ1(映画マニア): ロボットに、人間の視点(GoProを頭部に装着したような視点)からの動画を何千時間も見せました。この段階ではまだ動きは学習せず、動きながら世界がどのように見えるかを学びました。つまり、「視覚の物理学」を学んだのです。
  • ステージ2(翻訳者): これらの映画のスキルを、実際のロボットの動きへと翻訳する方法を教えました。異なる種類のロボットの体型データを用いることで、特定のボディ形状だけでなく、「動く」という概念全般を理解できるようにしました。
  • ステージ3(特殊部隊): 最後に、VRゴーグルを使用して人間が操作する形で、特定の具体的なタスク(カートへの積み込みやホワイトボードの拭き掃除など)を練習させました。ここで、ロボットは映画の知識を、実際の難易度の高い仕事に応用する方法を学びました。

結果

Motion研究チームが、9つの難しいタスク(サッカーボールを蹴る、カートへの積み込み、洗濯物たたみなど)でMotionWAMをテストしたところ、大きな成功を収めました。

  • スピード: 転倒せずに直立し続けるために必要な、リアルタイム(約1秒間に5回)の思考速度を備えています。
  • 成功率: 従来の最高のロボット脳が約44%の成功率であったのに対し、MotionWAMは**76%**のタスクで成功しました。
  • 「キック」の要素: 最大の成果は、足を使ったインタラクションが必要なタスクにおいて現れました。従来のロボットはボールの周りを歩こうとしましたが、MotionWAMは実際にボールを蹴りました。

まとめ

MotionWAMは、世界がどのように動くかを理解する「映画監督」のような脳を与え、全身を一つの統一されたプランで制御させることで、歩行と把持を別々の問題として扱うロボットよりも、はるかに複雑で人間らしい仕事を遂行できることを証明しました。

制限事項: 本論文では、これは特定のロボットモデル(Unitree G1)でテストされたものであり、カメラが頭部にあるために保持している物体を見失った場合、混乱して動作が停止する可能性があると指摘しています。また、他のロボットの体型についてはまだテストされていません。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →