あなたは、全く異なる種類のロボットたちにダンスを教えようとしているところだと想像してください。そこには、人間のような姿をしたロボット、少し背が高くてひょろ長いロボット、そして背が低くてがっしりしたロボットがいます。通常、ロボットにダンスの動きをコピーさせたい場合、一台ずつ個別に教えるか、あるいはダンスを「腕の動き」と「脚の動き」のように細かく分解して教える必要があります。
この論文では、これらすべてのロボットを一度に、かつ動きをバラバラに分解することなく扱うことができる「万能なダンスの先生」であるVENOM(Versatile Embodied Network for Omni-bodied Motion tracking)を紹介しています。
以下に、その仕組みを簡単な比喩を用いて説明します。
1. 問題点:「スペシャリスト」対「ジェネラリスト」
これまでのほとんどのロボット学習手法は、スペシャリストの家庭教師のようなものでした。ロボットに歩かせたいなら、歩行のコーチを雇い、手を振らせたいなら、手を振るコーチを雇います。もし新しいロボットが少し異なる体型をしていたとしても、古いコーチはその教え方を知りません。彼らは計算を簡単にするために、ロボットの体を「上半身」と「下半身」に分割して教えることが多く、それが表現力や自然な動きを制限していました。
2. 解決策:VENOM、「ダンスするロボットのためのGPT」
著者たちは、VENOMをTransformer(ChatGPTのようなチャットボットの背後にある技術)と呼ばれるAIアーキテクチャを用いて構築しました。
- 比喩: VENOMは、膨大なダンス動画のライブラリを読み込んだ、非常に賢い学生のようなものだと考えてください。特定のロボットのために特定のダンスを暗記するのではなく、この学生は「動きの概念」を学んだのです。
- 魔法のような仕組み: この「GPT」スタイルの基盤があるおかணி、VENOMはダンスの動きを見て、「よし、背の高いロボットならこう動くはずだ。そして、同じ動きを背の低いロボットに合わせてこう適応させよう」と判断できます。体を上半身と下半身に分ける必要はなく、全身を一続きのユニットとして捉えています。
3. 学習データ:「練習ジム」
VENOMを教えるために、研究者たちはVENOMデータセットと呼ばれる大規模なデータセットを作成しました。
- 作成方法: 彼らは既存の「エキスパート」ロボット(強化学習と呼ばれる非常に複雑な手法によって訓練されたもの)を取り上げ、5種類の異なるロボット上で、数千時間のダンスの動きを行わせました。
- 「ノイズ」の要素: 決定的なのは、VENOMに完璧なビデオだけを見せたのではないという点です。彼らは、ロボットが少しよろけたり、センサーが少しぼやけていたりするビデオ(ノイズの追加)も見せました。
- 結果: これは、学生が完璧なダンスフロアだけでなく、滑りやすくデコボコした床の上でも練習しているようなものです。これにより、VENOMはより堅牢(ロバスト)になりました。現実世界でダンスをしようとする際、不完全な状況にも慣れているため、簡単に転倒することがありません。
4. 結果:エキスパートに匹敵する実力
研究者たちは、VENOMを以下の2つのグループと比較テストしました。
- 「古き良き」教師たち: 同じデータで訓練された単純なニューラルネットワーク(MLP)ですが、これらには「GPT」のような脳の力はありませんでした。
- 「エリート」エキスパートたち: 元々の複雑な報酬ベースの強化学習法によって訓練されたロボットたちです。
何が起きたのでしょうか?
- VENOM vs 古き良き教師たち: VENOMは単純な教師たちを圧倒しました。ダンスの動きをより正確にトレースし、ロボットの安定性を維持しました。
- VENOM vs エリートエキスパートたち: これが最も驚くべき部分です。VENOMは教師あり学習(単に見ることをして真似る)を用いて訓練されましたが、エキスパートたちは強化学習(報酬を用いた試行錯誤)を用いて訓練されました。通常、「試行錯誤」を行うエキスパートこそが安定性の王様です。
- 発見: VENOMはエキスパートに驚くほど肉薄しました。トレーニング中に「報酬」や「罰」を与えられず、単に模倣することによって学んだにもかかわらず、動きの精度においてエキスパートとほぼ同等のレベルに達しました。
- 注意点: ジャンプやホップのような非常に激しいダイナミックな動きにおいては、エキスパートの方が依然としてバランスを保つのがわずかに上手でした。VENOMは、こうした高エネルギーな瞬間において、完璧に直立を保つことに苦労することがありました。しかし、それでも非常に印象的な結果でした。
5. まとめ
この論文が画期的であると主張しているのは、体のパーツに分割することなく、多くの異なるロボットの体を同時に制御できる単一の統一されたモデルを構築できることを証明したからです。
- 多才である: 5種類の異なるロボットタイプに対応しています。
- 表現力が高い: 単なる歩行だけでなく、複雑な全身のダンスを扱えます。
- 効率的である: 最も高価で複雑な訓練手法に迫る性能を持ちながら、単に「見て真似る(教師あり学習)」だけで、試行錯誤(強化学習)を必要としません。
要するに、VENOMは、一つのAIの脳が、ダンスをしたり、歩いたり、調和して動いたりする、一族のような様々なロボットを制御できる未来への一歩なのです。
技術要約: VENOM - 多様な形態に対応した全身体モーショントラッキングのための汎用エンボディード・ネットワーク
問題提起
単一のデモンストレーションデータのみを用いて、複数のヒューマノイドロボット間でエキスパートレベルかつ表現力豊かな全身モーショントラッキングを実現することは、ロボット学習における依然として大きな課題である。現在のクロスエンボディメント(形態横断的)なアプローチは、制御を上半身と下半身のセグメントに分離したり、特権情報を必要とする非対称アクター・クリティックを用いた強化学習(RL)に依存したりすることが多い。さらに、多様なヒューマノイドのための大規模な低レベル制御データセットが不足しているため、多才な基盤モデルの訓練が制限されている。既存のモデルは、ロコモーション(移動)タスクに限定されていることが多く、観測空間と行動空間の手動による整合なしには、異なる形態間で効果的に汎化できないことが多い。
手法
VENOMデータセット
著者らは、大規模な低レベル制御データの不足に対処するため、新しいマルチヒューマノイド・モーショントラッキング・データセットであるVENOMデータセットを構築した。
- ソースデータ: データセットは、5種類のヒューマノイド(Unitree G1, Unitree H1, Unitree H1 v2, Fourier N1, Booster T1 [29自由度])に対してエキスパート・トラッカーを訓練するために、TWIST2訓練フレームワーク(RLベースのモーショントラッキング・パイプライン)を使用して生成された。
- データ生成: エキスパートはAMASSデータセット全体を用いて訓練された。各モーションに対し、エキスパートは1つのクリーンなロールアウトと8つのノイズを含むロールアウトを生成した。ノイズは、観測空間(ルートの位置、方位、速度、および関節位置)におけるリファレンス・モーションに適用された。
- 規模: VENOMデータセットは、状態、行動、および報酬を含む、6秒間のクリップに分割された約7,705時間のデータで構成されている。
モデルアーキテクチャ (VENOM)
VENOMは、複数のヒューマノイドに対する全身制御のために設計された、**GPTベース(Transformer)**のモーショントラッカーである。
- アーキテクチャ: コアコントローラーは、8つのアテンションヘッドと768の埋め込み次元を持つ8層のTransformer層で構成される。上半身と下半身の制御を分離しない統一されたアーキテクチャを利用している。
- 入力処理: モデルは、リファレンス・モーションを処理するために特定のエンコーダを採用している:
- モーション・エンコーダ: 1ステップのリファレンス・モーションをエンコードする。
- ヒストリー・エンコーダ: 1次元畳み込みを用いて、10ステップのリファレンス・モーションの履歴をエンコードする。
- フューチャー・エンコーダ: MLPを用いて、1ステップの未来のリファレンス・モーションをエンコードする。
- マルチエンボディメントへの対応: モデルは、ヒューマノイドごとに異なるトークン埋め込み層とアクションヘッドを使用する。訓練中、すべてのヒューマノイドからの入力はバッチ次元に沿って結合され、共有Transformerデコーダに供給される。推論時には、対象となるヒューマノイドに対応する特定の入力モジュールとアクションヘッドのみがアクティブになる。
- 訓練目的: モデルは、予測されたアクションとエキスパートのアクションとの間の平均二乗誤差(MSE)を最小化するように、教師あり学習を用いて訓練される。堅牢性を高めるために、クリーンなロールアウトとノイズを含むロールアウトの両方で訓練される。
ベースライン
本研究では、VENOMを以下のモデルと比較している:
- TWIST2ベースライン: 同様の教師あり学習フレームワークを用いて、VENOMデータセット上で訓練されたMLPベースのモデル(単一のロボット、または複数のロボット)。
- RLエキスパート: TWIST2フレームワーク内で直接訓練された非対称アクター・クリティック・モデルであり、性能の上限(アッパーバウンド)として機能する。
主な結果
スケーリングとアーキテクチャ
- マルチロボット汎化: 複数のロボットで訓練された際、MLPベースのTWIST2ベースラインは負の転移(negative transfer)に苦しみ、リファレンス・モーションを追従しながらロボットを安定させることに失敗した。対照的に、TransformerベースのVENOMは、異なる形態間での汎化に成功した。
- ノイズへの堅牢性: VENOM-noisyモデル(ノイズを含むロールアウトで訓練されたもの)は、クリーンなデータのみで訓練されたモデルよりも優れたモーショントラッキング能力を示した。ノイズの導入により、ポリシーが未探索の観測領域にさらされ、堅牢性が向上した。
- 性能指標: Unitree G1において、VENOM-noisyは0.1052ラジアンの関節トラッキングRMS誤差を達成し、マルチロボットMLPベースライン(0.1686)を上回り、単一ロボットMLPベースライン(0.1067)と同等の性能を実現した。
モーショントラッキングと安定性
- 関節トラッキング: VENOMモデルは、様々な行動カテゴリ(アスレチック、クラウチング、ダンス、ホッピング、ロコモーション)において、マルチロボットMLPベースラインを一貫して上回る関節トラッキング精度を示した。
- 安定性と教師あり学習: VENOM-noisyは高い成功率(92–100%)と低いドリフトを実現し、他の教師あり学習モデルよりも優れていたが、RLエキスパートのモーション安定性には完全には及ばなかった。RLエキスパートはより高い成功率とより低いルートエラー率を達成しており、これは報酬フィードバックなしの教師あり学習のみに依存する場合の、モーションの忠実度と安定性の間のトレードオフを示唆している。
- 限界: すべてのモデル(RLエキスパートを含む)は、飛行フェーズ(ジャンプやスプリントなど)を伴う高度にダイナミックな動きに苦戦しており、安定性を確保するために接地を維持するような挙動を学習する傾向があった。
意義と主張
本論文は、上下半身の制御を分離せずに動作する、初のマルチヒューマノイド全身モーショントラッキングモデルとしてVENOMを位置づけている。その主な貢献は以下の通りである:
- データセットの構築: エキスパートによる模倣を通じて生成された、大規模でマルチエンボディメントなデータセットであるVENOMデータセットの作成。これは、多才なモーショントラッカーを訓練するための基盤として機能する。
- 基盤モデルの実現可能性: 多様なノイズを含むデータを用いた教師あり学習によって訓練されたGPTベースの基盤モデルが、従来のMLPベースラインを凌駕する、クロスエンボディメントの全身モーショントラッキング能力を達成できることを示した。
- 教師あり学習とRLのギャップ: 教師あり学習とRLエキスパートの間の差を定量化した。著者らは、教師あり学習はエキスパートの能力の多くを回復できるものの、特に高度にダイナミックなタスクにおいては、現状ではモーションの安定性において妥協が生じることを示している。
著者らは、VENOMが汎用的な低レベル制御に向けた重要な一歩である一方で、今後の課題として、モーショントラッキングのための直接的なRL訓練、任意の形態を扱うためのオンライン・リターゲティング・ポリシー、およびダイナミックな飛行フェーズの動きに対する予測ホライゾンの改善などを挙げている。
毎週最高の computer science 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。登録