ロボットが部屋に入り、特定の物体を見つけ、それを手に取るという夢は、長らくロボット工学における中心的な目標となってきました。数十年にわたり、研究者たちは機械にこのような複雑な行動を教えようと苦闘してきました。なぜなら、これには「空間内での身体の移動」と「手を使って世界と相互作用すること」という2つの困難なスキルを同時に機能させる必要があるからです。ロボットは単独での歩行については非常に優れたものになっていますが、二足歩行でバランスを取りながら、手を伸ばして物を掴む能力を加えることは、プログラミングによる手動制御が極めて困難な、物理学の混沌とした混合状態を生み出します。また、このようにロボットを教えるために必要なデータを収集することも大きな障壁です。人間が、あらゆる部屋において、ボウルに向かって歩き、それを拾い上げるためのあらゆる可能な方法を実演し続けることは、何年もかかるでしょうし、ロボットを破損させるリスクもあります。これを解決するために、科学者たちはコンピュータ・シミュレーションへと目を向け、ロボットが損傷の恐れなく何百万回も練習できるデジタル世界を作り出してきました。しかし、大きな疑問が残っていました。デジタル世界で完全に訓練されたロボットは、実際の家という、乱雑で予測不可能な現実を扱うことができるのだろうか、という点です。
カリフォルニア大学ロサンゼルス校の研究チームは、アレン人工知能研究所およびワシントン大学の共同研究者と共に、「FetchMan」と呼ぶ新しいシステムを用いてこの課題に取り組みました。彼らの研究は、人間によく似た動きをするヒューマノイド・ロボット「Unitree G1」に焦点を当てています。チームは、コンピュータ・シミュレーションの中で数千もの例を見せるだけで、このロボットに部屋を移動してターゲットとなる物体を掴むことを教え、さらなる追加訓練なしに、実世界でそのタスクを完璧に遂行させることができるかどうかを確かめたいと考えました。彼らは、単にロボットにタスクの例を増やして見せるだけでは不十分であることを発見しました。15万通り以上の異なるシーンで訓練を行った後でも、ロボットの性能は厳しい限界に突き当たりました。ロボットはデジタルの教師を模倣することはできましたが、歩行からリーチング(手を伸ばす動作)へとスムーズに移行するために必要な、微妙なタイミングを学習することができなかったのです。ロボットは物体を掴もうとするのが早すぎたり、歩行を止めるのが早すぎたりすることがあり、それはロボットには見えない「秘密の情報」を使用している教師をコピーしようとしたために失敗が生じたのでした。
この障壁を打破するために、研究者たちは訓練プロセスに第2段階を追加しました。デジタルの教師をただコピーするのではなく、シミュレーション内でロボット自身に練習させ、物体まで歩いていき、それを拾い上げるというタスク全体を成功させた時のみ報酬を与えるようにしたのです。この手法は「強化学習」と呼ばれる技術を用いたもので、これによりロボットは正しいタイミングと動きを自ら編み出すことができました。ロボットは、単に模倣していた時に犯していた間違いを修正しながら、リーチングを行う前に物体に近づいて歩くことを学んだのです。チームがこの洗練されたロボットを実世界でテストした際、その結果は驚くべきものでした。訓練中に実際の部屋や実際の物体を一度も見学していなかったにもかかわらず、ロボットは未知の空間に入り、ターゲットとなるボウルを特定し、73パーセント以上の成功率でそれを掴むことができました。これは、初期の訓練手法が実世界のテストで約57パーセントの成功率しか達成できなかったのと比較して、大幅な改善でした。
研究者たちはまた、このアプローチがボウルだけでなく、多くの異なる種類の物体に対しても機能するかどうかを調査しました。彼らは、物体の名前をヒントとして与えることで、パン、ボトル、本といったアイテムを認識して拾い上げるシステムを訓練しました。このマルチオブジェクト版は、シングルオブジェクト版ほど高い成功率には至りませんでしたが、それでも多様な状況下でタスクを遂行することができ、この手法がスケールアップ可能であることを証明しました。この研究は、教師を模倣することは優れた出発点ではあるものの、複雑な物理的タスクをマスターするにはそれだけでは不十分であることを浮き彫りにしています。ロボットが世界の中での動き方を真に理解するためには、自らの成功と失敗から探索し、学ぶ自由が必要なのです。膨大な量のシミュレーションによる練習と、自己修正のための最終段階を組み合わせることで、チームは、一歩一歩人間の手助けを必要とすることなく、新しい環境に適応できるロボットを作り出すための明確な道筋を示しました。
技術要約: FetchMan
問題提起
本論文は、個別のシーンごとにチューニングを行うことなく、未知のシーンや物体に対して汎化可能な視覚的ヒューマノイド・ロコ・マニピュレーション(loco-manipulation)ポリシーを学習させるという課題に取り組んでいる。シミュレーションはヒューマノイドの歩行(ロコモーション)において標準的な手法となりつつあるが、これを「ロコ・マニピュレーション」(歩行しながら物体を掴み、移動させる動作)へと拡張することは依然として困難である。主な障壁は以下の通りである:
- データの不足: ヒューマノイドの全身のバランス回復や安全管理のための監督が必要なため、実世界でのデータ収集は極めてコストが高く、リスクが大きい。
- シミュレーションの限界: 既存のシミュレーション手法は、制約のある視覚環境や、複雑な手作業による報酬設計に依存することが多い。
- イミテーション・ギャップ(模倣の溝): 合成データを用いた行動クローニング(Behavior Cloning, BC)による学習は、性能の天井に突き当たることが多い。これは、スクリプト化されたデモンストレーターが持つ「特権情報」(例:隠れたフェーズ変数)をポリシーが観測できないことに起因しており、その結果、動作が不連続になったり、ナビゲーションからマニピュレーションへのフェーズ移行を正しく学習できなかったりする。
手法
著者らは、シミュレーションのみで学習し、実機のUnitree G1ヒューマノイドにゼロショットで展開可能なエンドツーエンドのsim-to-realパイプラインであるFetchManを提案している。このアプローチは、以下の4つのコンポーネントで構成される。
1. データ生成 (FetchMan-Bench)
- 規模: プロシージャルに生成された屋内シーン(MolmoSpacesを使用)と多様な物体を用いて、15万エピソード以上のデータを生成する。
- スクリプト・デモンストレーター: 特権的な全身コントローラー(πctrl)が、隠れた状態(物体のポーズ、占有格子、フェーズインデックスなど)を用いてタスクを解決する。これは、A*経路計画によるナビゲーションと、離散的なフェーズシーケンス(リーチ、下降、閉じる、持ち上げる)によるマニピュレーションを実行する。
- ドメイン・ランダム化: 視覚的な汎化を確実にするため、すべてのエピソードにおいて、テクスチャ、照明、カメラの内部・外部パラメータ、表面の高さ、およびアクションノイズを独立してランダム化する。
- エピソードの混合: データセットには、80%の「フェッチ(取得)」エピソード(ナビゲーション+把持)と、20%の「ピックのみ」エピソード(把持のみ)が含まれており、これにより上半身の初期構成をランダム化している。
2. ポリシー・アーキテクチャ
- 観測事項: ポリシー(πθ)は、頭部装着型の魚眼RGB画像、手首装着型のRGB画像、およびプロプリオセプション(固有感覚)ベクトル(ベースの高さ、ロール/ピッチ、上半身の関節位置、グリッパーの開口度)を受け取る。
- モデル: Flow-Matching DiT (Diffusion Transformer) アーキテクチャを採用。
- 視覚: フリーズされたDINOv3 ViTバックボーンが視覚入力をエンコードする。
- アクション・ヘッド: トランスフォーマーが視覚トークンと状態トークンにクロスアテンションを行い、15次元のアクション(ベース速度、ベースの高さ、腰/腕の関節ターゲット、グリッパーの開口度)のチャンクを予測する。
- 制御インターフェース: ポリシーは、事前学習済みの下半身コントローラー(SONIC、バランス/歩行用)およびPDコントローラー(上半身用)によって追従される高レベルなコマンドを出力する。これにより、アクション空間を29個の関節トルクから15個の意味のあるコマンドへと削減している。
3. 二段階学習パイプライン
学習は、特定の二段階プロセスを通じてイミテーション・ギャップに対処する。
- ステージ1: 模倣事前学習 (Behavior Cloning): 15万件の合成デモンストレーションを用いてポリシーを学習させる。これは高次元の制御問題に対する強力な事前知識を提供するが、デモンストレーターの隠れたフェーズ構造によって制限を受ける。
- ステージ2: Flow-GRPOによる精緻化: パフォーマンスの天井を打破するため、Flow-GRPO(フローマッチング・ポリシーに適応させたGroup-Relative Policy Optimization)を用いてポリシーを微調整する。
- メカニズム: 同一のタスクに対して環境のグループをリセットする。注入されたノイズを伴ってポリシーが軌跡をロールアウトする。アドバンテージは、学習された価値関数ではなく、グループ相対のリターン(成功か失敗か)に基づいて計算される。
- 報酬: ステップごとの報酬設計を避け、単一のスパース報酬(成功すれば1、そうでなければ0)を使用する。
- 結果: このステージにより、ポリシーは、スクリプトされたデモンストレーターが隠れた状態を用いて管理していた、暗黙的なフェーズ遷移(ナビゲーションからマニピュレーションへの受け渡し)を学習することができ、BCによって残された構造的なアーティファクトを効果的に「修復」できる。
4. マルチオブジェクトへの拡張
レシピは、マルチオブジェクトの汎化に対応したテキスト条件付きのバリアントへと拡張されている。このモデルは、dino.txtバックボーンを使用して、物体の名前(例:「ボウル」、「ポット」)を視覚トークンに接地(グラウンディング)させ、多様な物体カテゴリのゼロショット把持を可能にする。
主な結果
論文では、FetchManをFetchMan-Bench(シミュレーション・ベンチマーク)で評価し、実機のUnitree G1に展開している。
- 模倣の天井: 行動クローニングを5kから150kのデモンストレーションへとスケールアップすると、シミュレーションにおける成功率(SR)は40%から67%に向上するが、パフォーマンスは67%で飽和する。これは、データ量を増やすだけでは、特権情報のギャップを克服できないことを裏付けている。
- RLによるブレイクスルー: 150kのBCチェックポイントにFlow-GRPOを適用することで、シミュレーションにおけるロコ・マニピュレーションのSRを**83%**まで引き上げた。
- ゼロショット実世界性能:
- シングルオブジェクト: 最終的なモデルは、未知のシーンにおいて、実機のUnitree G1上で**73.3%**のロコ・マニピュレーション成功率を達成した。これには実世界での学習データは一切使用していない。
- アブレーション研究: DINOv3をSigLIPに置き換えたり、デルタ(差分)ターゲットの代わりに絶対的なアクションターゲットを使用したりすると、実世界のパフォーマンスが崩壊(ロコ・マニピュレーションSRが0%に低下)した。これは、幾何学的特徴とデルタ・アクション・パラメータ化の必要性を強調している。
- マルチオブジェクト: テキスト条件付きモデルは、シミュレーションにおいて62%のSRを達成した(タスクの複雑さにより、シングルオブジェクトの83%より低い)。また、実機ロボットにおいて、様々な物体(ポット、パン、ボトルなど)のゼロショット・フェッチに成功することを示したが、シングルオブジェクトのポリシーと比較すると堅牢性はやや劣る。
意義と主張
本論文は、個別の環境ごとにチューニングを行うことなく、多様なシーンにわたって汎化する、視覚的ヒューマノイド・ロコ・マニピュレーションのための初のエンドツーエンドのsim-to-realパイプラインを提示していると主張している。その意義は以下の点にある:
- 合成BCの限界の提示: 合成デモンストレーションのスケールアップだけでは、スクリプト化されたコントローラーが持つ隠れたフェーズ変数のために、ロコ・マニピュレーションにおけるイミテーション・ギャップを克服するには不十分であることを実証的に示した。
- Flow-GRPOの有効性の検証: クローンされたポリシーを、スパース報酬を用いたグループ相対RLで精緻化することで、イミテーションの天井を打破できることを証明した。これにより、シミュレーション内だけで、歩行から把持への複雑なフェーズ遷移を学習することが可能となった。
- スケーラブルなレシピ: MolmoSpaces + Flow-GRPOという、シングルオブジェクトからマルチオブジェクトの汎用ポリシーへとスケール可能な再現可能なレシピを提供し、このデータスケールにおけるタスク汎用ヒューマノイドへの「第一歩」を踏み出した。
- ゼロショット展開: 学習パイプラインがイミッション学習の構造的な限界を正しく対処していれば、シミュレーションデータのみを用いて、実機ハードウェア上で高性能なロコ・マニピュレーションが実現できることを確立した。
著者らは、ポリシーのステートレス性(履歴を持たない)、固定された下半身コントローラー(SONIC)、および現在のフェッチタスクへの限定といった限界についても言及しており、より複雑なマニピュレーションや長期的な行動については今後の課題としている。
毎週最高の computer science 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。登録