Learning Multi-Humanoid Pickup and Transport via Decentralized Object-Centric Control
本論文は、グリッパーを用いない両手によるピンチ動作を通じて、サイズの異なる物体を複数のヒューマノイド・チームが協力して持ち上げ、搬送することを可能にする、分散型のオブジェクト中心制御フレームワークを提案しており、単一ロボットのタスクで学習された方策がマルチロボットのシナリオへ効果的に転移すること、および明示的な協調学習によってさらなる恩恵を受けることを実証している。
原著者: Bikram Pandit, Mohitvishnu S. Gadde, Aayam Kumar Shrestha, Alan Fern
原著者: Bikram Pandit, Mohitvishnu S. Gadde, Aayam Kumar Shrestha, Alan Fern
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 ✨ これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
技術要約:分散型オブジェクト中心制御によるマルチヒューマノイドのピックアップと搬送の学習
問題提起
近年のヒューマノイドの移動・操作(loco-manipulation)技術の進展により、単一のロボットが様々なサイズや重量の物体を持ち上げ、搬送することが可能になりました。しかし、現実世界の多くのペイロードは、単一のヒューマノイドでは扱うには大きすぎたり、重すぎたり、あるいは形状が不規則であったりします。これらのタスクには、共有された負荷を介して相互作用しながら、ロボットチームが全身運動を協調させる必要があります。既存のアプローチは、解析モデルや固定されたチームサイズ、あるいは特定のリーダー・フォロワーの仮定に依存することが多く、協調的なヒューマノイド搬送に関する研究は乏しいのが現状です。さらに、従来の学習ベースの手法は、タスクごとの再設計を行うことなく、変化するチームサイズ、アタッチメントのレイアウト、およびオブジェクトの幾何学的形状に対して汎化することに苦慮してきました。
対処すべき核心的な課題は、直接的なロボット間通信や精密なグローバル・ポーズ指令を必要とせずに、可変サイズのチーム、多様なオブジェクトの幾何学的形状、およびシームレスなロボット間のハンドオーバーをサポートする、マルチヒューマノイドの協調的移動・操作のための学習ベースのフレームワークを開発することです。
手法
分散型オブジェクト中心制御 (decMHT)
著者らは、decMHTと呼ばれる、分散型のオブジェクト中心制御抽象化を導入しています。このフレームワークは、単一ロボットによるピックアップ、協調的なマルチロボット搬送、およびロボット間のハンドオーバーを単一のポリシーの下で統合します。
1. インターフェース設計:
システムは、各ロボットに提供される2つの主要な入力に依存しています。
- アタッチメント仕様 (A(r)): エピソードの開始時に提供される局所的な幾何学的定義です。これは、ロボットの胴体に対する相対的なローカル・アタッチメント・フレーム、2つの対称的なアタッチメント・ポイント(左および右)、および前方のクリアランス距離を指定します。決定的なのは、これがペイロードの全幾何形状を記述するものではない点であり、これにより同じ表現を用いて、コンパクトな箱、細長い棒、あるいは不規則なパネルを扱うことが可能になります。
- オブジェクト中心コマンド (Cpl): オブジェクト上の参照フレーム(例:その重心)の所望の平面速度、ヨーレート、および高さを指定するハイレベルなコマンドです。このグローバルなコマンドは、ロボットのアタッチメント・オフセットに基づく固定された剛体変換を用いて、各ロボット用のローカルなコマンド (Ccf(r)) へと変換されます。
2. 制御アーキテクチャ:
システムは、各ロボットがローカルな観測のみを使用して独立して同じポリシーを実行する、階層的な分散型アーキテクチャを採用しています。
- 低レベル移動ポリシー (πl): 指令されたベース速度、ヨーレート、および胴体高を脚の関節ターゲットに変換する、事前学習済みの凍結されたニューラルネットワークです。
- 高レベル操作ポリシー (πh): 自己受容感覚状態、アタッチメント仕様、ローカルコマンド、およびモードフラグを入力とするリカレント・ポリシー(2層LSTM)です。これは、目標とする上半身の関節位置および移動コマンドを出力します。モードフラグ (m(r)) は、ロボットを
idle(定常ポーズの維持)とtrack(接近、アタッチ、およびオブジェクトの追従)の間で切り替えます。
3. 学習アプローチ:
ハイレベル・ポリシーは、シミュレーション(IsaacLab内のAgility Robotics Digit V3モデル)において、独立型近接方策最適化 (IPPO) を用いて学習されます。
- カリキュラム: 学習は、単一ロボットによるピックアップおよび搬送タスクから始まり、支援付き接触形成、非支援保持、高さ追従、および完全なコマンド追従の段階へと進行します。
- ファインチューニング: 単一ロボットのポリシーは、2台のロボットによる協調エピソードを用いてファインチューニングされ、共有ペイロードによる結合ダイナミクスにコントローラをさらします。
- 汎化戦略: ポリシーは、N≥3 のロボットを用いた学習は一切行われません。より大きなチーム(最大10台)での評価は、ゼロショットで行われます。
- ドメインランダム化: シム・トゥ・リアル(sim-to-real)の堅牢性を確保するため、センサーノイズ、摩擦、モーター剛性、および外部摂動のランダム化を含めて学習を行います。
主な貢献
- decMHT 抽象化: タスクごとの再設計なしに、可変サイズのチーム、アタッチメント・レイアウト、およびオブジェクトの幾何学形状をサポートする、高レベルのオブジェクト中心インターフェースの導入。
- 階層的分散制御: 直接的な通信やローカルな観測のみを用いて、ヒューマノイドが共有オブジェクトを通じて協調することを可能にする、制御アーキテクチャと学習カリキュラムの開発。
- スケーラビリティとゼロショット転送: 最大2台のロボットで学習された単一のコントローラが、多様なオブジェクトの幾何学的形状およびアタッチメント構成において、最大10台のヒューマノイドチームをサポートすることをシミュレーションで実証。
- Sim-to-Real 検証: 追加の実世界でのファインチューニングなしに、2台の実際のDigit V3ヒューマノイドによる協調的なオブジェクト操作の成功。
実験結果
スケーラビリティとパフォーマンス
- チームサイズ: システムは N∈{1,…,10} 台のロボットチームで評価されました。ピックアップ成功率はすべてのチームサイズで97%を上回りました。搬送の質は一般にチームサイズとともに向上しました。線形および高さの追従誤差が減少し、ペイロードの傾きも大幅に減少しました(RMS傾斜は、1台のロボットでの8.04°から、10台のロボットでの1.21°へと低下)。
- ペイロード質量: ポリシーは、学習時の質量範囲(0.5–1.5 kg)を大幅に超える最大50 kgのペイロードに対してゼロショットで汎化しました。チームサイズを増やすことで、安定性を維持しながらより重い荷重を持ち上げることが可能になりました。
- オブジェクトの幾何学形状: フレームワークは、再学習なしに未知の幾何形状(金属製のキャビネット、冷蔵庫、木材の丸太、ベッド、コンクリート板)に汎化しました。ピックアップの成功率はすべてのオブジェクトで高かったものの、「ベッド」(重く、薄い把持領域を持つ)が最も困難であり、decMHTの成功率は44.1%であった単一ロボット学習のアブレーションと比較して85.2%でした。
比較分析
- 単一ロボット学習との比較 (decMHT(1)): 単一ロボットで学習されたポリシーは、同等のピックアップ率を達成しましたが、搬送中の追従誤差、ドロップ率、およびペイロードの傾斜が高くなりました。これは、アタッチメントの抽象化が持ち上げのメカニズムを捉えている一方で、安定した搬送に必要な結合ダイナミクスを学習するには、マルチロボットのファインチューニングが必要であることを示しています。
- 中央集権型および特化型ベースラインとの比較: decMHTは、分散型かつモデルフリーのアプローチを用いているにもかかわらず、中央集権的なベースライン(結合状態に基づいて学習されたもの)や、オブジェクトごとに再学習された特化型ベースラインと同等の性能を示しました。
- 輸送コスト (CoT): エネルギー効率(CoT)は、1台から2台のロボットへと急激に増加しましたが、チームが大きくなるにつれて横ばいとなりました。decMHTは、すべてのマルチロボットチームにおいて、単一ロボットのアブレーションよりも低いCoTを維持しました。
ハンドオーバー能力
システムは、静的、動的(移動中のオブジェクト)、およびクロスレベル(異なる高度)の構成における、ロボット間のハンドオーバーを正常に実証しました。decMHTは、特に、受け取る側のロボットがオブジェクトが動いている間に接触を確立しなければならない動的なシナリオにおいて、単一ロボットのアブレーションを上回りました。
Sim-to-Real 転送
本アプローチは、2台の実際の Digit V3 ヒューマノイドを用いて検証されました。アタッチメント・フレームのポーズを推定するために外部センサーを使用することで、ロボットはモードフラグを切り替えるだけで、ポリシーの変更や実世界でのファインチューニングなしに、単一ロボットのピックアップ、マルチロボットの協調搬送、およびハンドオーバーを正常に実行しました。
意義と主張
本論文は、ロボットにとって現実的なシミュレーションにおいて、変動するチームサイズに対して汎化し、実際のヒューマノイドハードウェアにデプロイ可能な、学習された分散型マルチヒューマノイドの移動・操作フレームワークを初めて実証したものであると主張しています。
著者らは、アタッチメントに基づく抽象化が、協調に必要な本質的な構造を捉えており、単一ロボットのタスクで学習されたポリシーが協調的な設定へ非自明に転送できることを強調しています。しかし同時に、協調ダイナミクスを学習して搬送の安定性と効率を向上させるためには、明示的なマルチロボット学習が有益であることも述べています。
本研究は、共通のオブジェクト中心制御インターフェースが、複雑なグローバルプランニングや直接的なロボット間通信を必要とせずに、多様な操作モード(ピックアップ、搬送、ハンドオーバー)を統合し、大規模なチームへとスケールできることを示しており、現在の協調的ヒューマノイド・ロボティクスにおける重要なギャップを埋めるものです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。
毎週最高の computer science 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。