人型ロボットに、箱を持ち上げて特定の場所に移動させる、あるいはボールを蹴るといった複雑な作業を教える場面を想像してみてください。通常、こうした作業をロボットに教えるには、人間が完璧にこなしている様子を数百時間録画する必要があります。しかし、それはコストがかかり、時間がかかり、あらゆるバリエーション(例えば、箱がもっと重かったら? 目標地点がもっと遠かったら?)に対応するのは困難です。
この論文は、わずかな手本(わずか4つ!)から、ロボットがこれらのタスクを習得することを教える賢明なシステム、Humanoid-DARTを紹介しています。これは、単に見たものを繰り返すのではなく、新しいやり方を想像し、それがうまくいくまで練習するという、「クリエイティブなコーチ」のように振る舞うことで実現しています。
システムの仕組みを、シンプルなパーツに分解して説明します:
1. 二人一組の戦略(Two-Team Strategy)
すべてを一つの巨大な脳に教え込もうとする代わりに、Humanoid-DARTは、互いに助け合う2つの専門化されたチームに役割を分割します。
- 「夢想家(Dreamer)」(拡散モデル / Diffusion Model): これはクリエイティブなプランナーです。その役割は、ロボットが従うべき経路を想像することです。持っている数少ない例題をもとに、目標に到達するための、少しずつ異なる新しい経路を「夢想」し始めます。地図の上に新しいルートをスケッチするアーティストのようなものです。最初は、物理的に不可能なスケッチ(壁の中を歩いたり、床の上を滑ったりするなど)になることもありますが、これらはロボットが「どこへ行けるか」を探求する上で非常に重要です。
- 「アスリート(Athlete)」(強化学習ポリシー / Reinforcement Learning Policy): これは物理的な実行者です。その役割は、「夢想家」が描いたスケッチを受け取り、それを実際のロボットで実行してみることです。これは厳格なコーチのように振る舞います。もし夢想家が、足が滑ったり転倒したりするような経路をスケッチした場合、アスリートは「いや、それはうまくいかない」と言い、動きを修正して物理的に可能なものにします。
2. 「練習ループ」(カリキュラム)
魔法は、これら2つのチームが時間の経過とともにどのように対話するかで行われます。システムは、トレーニングキャンプのようにサイクルを実行します:
- 目標の設定: システムはターゲット(例:「この新しい場所に箱を移動させる」)を選びます。
- 夢想: 「夢想家」がそこへ到達するための大まかな計画を作成します。
- テスト: 「アスリート」が物理シミュレータ内でその計画を実行しようと試みます。
- フィルタリングとラベル付け:
- ロボットが転倒したり失敗したりした場合、その計画は破棄されます。
- 秘訣(Secret Sauce): もしロボットが「惜しい」状態(ニアミス)だった場合、システムはそれを失敗として扱いません。代わりに、「よし、意図した場所には到達できなかったが、実際には『この場所』には到達できた」と判断します。そして、実際に到達した新しい地点に対して、その試行を成功として**ラベル付け(Relabel)**します。
- 学習: 「夢想家」は、これらの成功(または成功に近い試行)から学び、それらの特定の地点に対する計画を夢想するのが上手くなるように学習します。「アスリート」も、それらを実行するのが上手くなります。
- 反復: システムは、学んだばかりの知識に基づいて、少しずつ難易度の高い新しい目標を選び、雪玉が転がるようにスキルを拡大していきます。
3. 「デュアル・ブレイン(二重脳)」アーキテクチャ
「夢想家」が歩行と物体保持の両方を巧みに扱うために、この論文では特別な二部構成の脳構造を与えています。
- ナビゲーター(Navigator): 大きな絵(足がどこへ向かうか)に焦点を当てます。
- ローカライザー(Localizer): 細部(物体に対する手や関節の動き)に焦点を当てます。
これらを分離することで、ロボットは混乱することなく全身の協調を学習できます。これにより、箱に向かって歩いている間に、手がしっかりと物を掴む準備ができている状態を実現します。
4. 結果
研究者たちは、実機のロボット(Unitree G1)とシミュレーションを用いてテストを行いました。彼らは、押す、蹴る、受け渡しをする、あるいは箱を持ち上げるといった基本例を、わずか4つからスタートしました。
- 成果: システムは単にその4つの例をコピーしただけではありません。元の例よりも4〜5倍遠い目標に対しても、これらのタスクを実行できるようになりました。
- カバー範囲: 「ピック・アンド・プレース(持ち上げて置く)」のタスクにおいて、ロボットは可能なターゲット領域の**96%**をカバーすることを学習しました。これに対し、他の手法はごくわずかな部分しかカバーできませんでした。
まとめ
Humanoid-DARTは、最初は少数の教科書的な例題からスタートしますが、以下のプロセスを通じて、何千もの新しい問題を解く方法を学ぶ学生のような存在です:
- 新しい解決策を想像する。
- それを試し、何が実際に機能するかを確認する。
- 「惜しい失敗」を新たな学習の機会として祝福する。
- 人間にすべてのバリエーションを記録させることなく、膨大なスキルのライブラリを徐々に構築していく。
この論文は、このアプローチによって、ロボットが非常に疎なデータから複雑な全身タスクを学習できることを結論づけており、これにより、ロボットを教えるプロセスを従来よりもはるかに高速かつ効率的にできるとしています。
技術サマリー: Humanoid-DART
問題提起
ヒューマノイドの移動操作(loco-manipulation)には、協調的な全身制御と動的な物体相互作用が必要である。模倣学習や強化学習(RL)の最近の進展により、エキスパートのデモンストレーションを追従することで印象的な移動スキルが可能となったが、これらの手法を接触の多い移動操作へとスケールアップさせることは依然として大きな課題である。移動(locomotion)とは異なり、移動操作は身体の動き、物体の状態、および環境との相互作用によって定義される、広大かつ連続的なタスク空間を伴う。物体のポーズ、搬送構成、把持戦略、および相互作用のタイミングのバリアーションは、人間のデモンストレーションのみでカバーするには極めて高価な組合せ爆発を引き起こす。既存の手法は通常、大規模な人間のモーションデータセットに依存するか、単一のリファレンス動作の追従に焦点を当てており、多様な条件下で多様な移動操作タスクをロバストに解決することには失敗している。
手法
本論文では、疎な初期デモンストレーションからブートストラップし、その行動レパートリーを漸進的に拡大するように設計された、自己教師ありの反復フレームワークであるHumanoid-DARTを提案する。このパイプラインは、ゴール条件付きモーション生成器と物理ベースのモーション追従ポリシーという、密接に結合された2つのコンポーネントを交互に実行する。
1. アルゴリズムの概要
システムは、成功した軌跡のエリートアーカイブ E によって定義されるスキル分布に対する進化的なカリキュラムとして機能する。
- ゴールサンプリング: 各イテレーションにおいて、カリキュラムは現在の分布 E の周囲の新しいゴール状態をサンプリングし、既存スキルの洗練と、未表現領域の探索の両方をターゲットとする。
- 運動学的生成: ゴール条件付き拡散モデル (πθ) が、サンプリングされたゴールに対して運動学的なリファレンス軌跡を生成する。これらの軌跡には、物理的な不整合(例:足のスライディング、めり込み)が含まれる可能性がある。
- 物理評価: 強化学習(RL)を通じて訓練されたモーション追従ポリシー (πϕ) が、物理シミュレータ内でこれらの運動学的リファレンスを実行する。これは動的なフィルタとして機能し、潜在的に実行不可能な計画を、物理的に一貫したロールアウトへと変換する。
- 選択とリラベル: 生成された軌跡は、追従の忠実度、接触の正確性、および安定性を測定する適合度関数 F(τ) を用いて評価される。閾値 τf を超える軌跡は、エリートアーカイブ E に保持される。重要な点は、サンプリングされたゴールと完全に一致しない成功したロールアウトであっても、達成されたタスク指標でリラベルされ、「惜しい失敗(near-misses)」が有効な学習信号へと変換されることである。
- 反復更新: 拡散生成器と追従ポリシーの両方が、拡張されたアーカイブに基づいて再訓練され、実行可能な軌跡の多様性とタスク空間のカバー率を漸進的に向上させる。
2. 主要なアーキテクチャ・コンポーネント
- 運動学的モーション生成器 (Diffusion Transformer):
- デュアルブランチ・バックボーン: アーキテクチャは、状態をグローバルストリーム(ルート動作および物体相対特徴)とローカルストリーム(身体ポーズ/関節)に分離する。ローカルストリームはグローバルストリームにクロスアテンションを行い、粗いナビゲーションと微細なポーズ合成を分離しつつ、同期を維持する。
- 構造化部分的アンマスキング: 訓練中、モデルは将来のフレームからのノイズを含む特徴グループを選択的に開示する。これにより、プランナーが欠落したモーション成分を部分的な観測から推論することを促し、特徴グループを独立して扱うのではなく、相関関係(例:全身ポーズと物体相互作用の間)を学習させる。
- 推論: 重複するセグメント上での自己回帰的合成と、履歴のインペインティング(RePaintスタイル)を使用し、時間的一貫性を確保する。
- モーション追従ポリシー:
- PPO(Proximal Policy Optimization)を用いて訓練された、DeepMimicに着想を得た非対称なアクター・クリティック・コントローラ。
- 5ステップのリファレンスホライゾン、固有受容状態、および物体ポーズを観測し、クリティックは特権的なシミュレーション状態を受け取る。
- シム・トゥ・リアル(sim-to-real)転送を確実にするため、ドメインランダム化(物体の質量、摩擦、押し出し)を組み込んで訓練される。
- カリキュラムとゴール・リラベル:
- フロンティア・ターゲット・サンプリング: タスク空間はビン(bin)に離散化される。サンプリングの重みは、現在のエリートセットからの距離に基づいて割り当てられる:Refine(既存のエリートの近傍)、Explore(中間距離)、Frontier(遠方の未解決領域)。探索範囲の拡大を駆動するため、探索ビンには最も高い重みが割り当てられる。
- ゴール・リラベル: ロールアウトがサンプリングされたゴールに達しなかった場合でも、それを破棄するのではなく、達成された状態を意図されたゴールとして遡及的に扱うことで、生成器が未学習であっても密な学習信号を提供する。
主な貢献
- Humanoid-DART パイプライン: 疎なデモンストレーションからゴール条件付き移動操作スキルを学習するための、初の反復的軌跡拡張パイプライン。
- 新規のデザイン選択:
- 疎なデータ環境下での軌跡合成を改善するための、デュアルブランチ・アーキテクチャと構造化部分的アンマスキングを備えた階層的なゴール条件付きDiffusion Transformer (DiT)。
- 物体ポーズに条件付けられた、生成された軌跡を追従するRL全身コントローラ。
- ゴール・リラベル戦略を用いて、ニアミスしたロールアウトを有効な学習信号に変換するカリキュラムベースのアルゴリズム。
- 実証的検証: Unitree G1ヒューマノイドを用い、4つの移動操作タスク(プッシュ、キック、ハンドオフ、ピックアンドプレース)におけるフレームワークの検証。わずか4つのベースデモンストレーションからタスク空間のカバー率を実現し、シード分布を大幅に超えるゴールへと汎化することを示した。
実験結果
- タスク空間のカバー率: ピックアンドプレース・タスクにおいて、Humanoid-DARTはわずか4つのベースデモンストレーション(約20秒の動作)から、ターゲット・タスク空間の96.4%のカバー率を達成した。これは、4世代を経て0.1%からほぼ完全なカバーへと成長したことを示している。
- 汎化性能: システムは、ベースデモンストレーションよりも4〜5倍遠いゴールに対しても軌跡を正常に生成・追従することができ、堅牢な汎化能力を示した。
- 実世界への展開: 生成された軌跡は、物理的なUnitree G1ヒューマノイド上でプッシュ、キック、ピックアンドプレースのタスクに正常に展開され、ハードウェア上での動的な実現可能性を確認した。
- アブレーション研究:
- アーキテクチャ: デュアルブランチ構造を除去(単一のフラットなDiTに集約)すると、ゴール到達成功率が1.00から0.25に低下した。構造化部分的アンマスキングは、経路の直線性と把持の一貫性を向上させた。
- ベースライン: 「パラメータ化されたモーション(Parameterized Motion)」(高品質な狭い領域に焦点を当てるもの)および「階層的Diffusion + RL」(進化ループなしの共同訓練)と比較して、Humanoid-DARTは優れたタスク空間カバー率を示した。進化ループが性能の主要な推進力であることが特定された。
- 初期化: 動的に実現可能な(DF)シード軌跡は、運動学的にのみ実現可能な(KF)シード(拡散モデルが物理的不整合を増幅させやすい)と比較して、より速い収束と高いカバー率をもたらした。
意義と主張
本論文は、生成モデルを用いて軌跡リファレンスを反復的に拡張することにより、ヒューマノイドの移動操作におけるデータ不足のボトルネックを解決できると主張している。高レベルのモーション生成と低レベルの制御を分離し、ゴール・リラベルを伴うカリキュラムを利用することで、本フレームワークは、最小限のエキスパートの監督で、堅牢なゴール条件付きポリシーの学習を可能にする。著者らは、このアプローチが、膨大な人間のモーションデータセットを必要とせずに、初期のシードデモンストレーションの範囲を大幅に超える多様な行動や長期間のスキルを発見することを可能にすると強調している。
限界と今後の課題: 現在の評価は、単一の物体形状と平坦な地形に限定されている。著者らは、パイプラインがシードデモンストレーションのバイアスを継承しており、手動調整された適合度関数に依存していることを指摘している。今後の課題は、多様な物体、接触特性、および凹凸のある地形への拡張、および適合度関数を適応的で学習された基準へと置き換えることである。
毎週最高の computer science 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。登録