ロボットの手を使って、壊れやすく柔らかいクッキーを拾おうとしている場面を想像してみてください。もしロボットが単に指を「正しい」形に動かすだけなら、クッキーを押しつぶしてしまったり、滑った瞬間に落としてしまったりするかもしれません。これを上手に行うには、ロボットは指がどこにあるかだけでなく、どれくらいの強さで握っているかという「感覚」を理解する必要があります。
この論文は、全く異なる形状のロボットハンドであっても、それらに「感覚」と「把握」を教えるための新しい手法を紹介しています。以下に、簡単な比喩を用いて解説します。
1. 問題点:異なる手、異なる「言語」
ロボットの手を、異なる種類の楽器だと考えてみてください。あるものはピアノ(多くの鍵盤)、別のものはギター(少ない弦)、そして第三のものはドラムセットです。
- 従来の方法: 以前の手法は、これらの楽器に同じ「音符」(指の位置)を奏でるように教えようとしていました。しかし、ピアノ奏者が鍵盤を強く押しすぎると音が大きくなり、ギタリストが弦を強く押しすぎると弦が切れてしまいます。従来の方法は「力(どれほど強く押しているか)」を翻訳できず、「位置(指をどこに置いているか)」のみを翻訳していました。
- 結果: ピアノで訓練されたロボットハンドは、その「タッチ(触れ方)」を新しい楽器に合わせて調整する方法を知らなかったため、ギターに簡単に切り替えることができませんでした。
2. 解決策:ユニバーサルな「力の翻訳機」
著者らは、**ユニバーサル・フォース・ポジション・インターフェース(Universal Force-Position Interface)**を作成しました。これは、二つの言語を同時に話す翻訳機のようです。
- 「どこへ」の言語(動き): 彼らは、人間の手の形状に基づいた共有の「潜在コード(圧縮されたデジタル設計図)」を使用しています。これにより、サイズや形に関係なく、すべてのロボットハンドに「どこへ」動くべきかを伝えます。
- 「どれくらいの強さで」の言語(力): これが最大の革新です。彼らは、各ロボットハンド特有の混乱を招く信号(例えば「モーターの負荷」など)を取り込み、それを**物理的なトルク(ニュートンメートル)**へと翻訳します。
- 比喩: すべてのロボットハンドに異なるタイプのスピードメーターが付いていると想像してください。著者らは、すべてのスピードメーターの数値を「時速」に変換するコンバーターを作成しました。これにより、巨大なスピードメーターを持つロボットも、小さなスピードメーターを持つロボットも、どちらも自分が正確にどのくらいの速度で移動しているかを理解できるようになりました。
- また、物体が指のどの位置に触れているか、そして重さがどのように分散されているかを示す地図のような「ロード・ディスクリプター(荷重記述子)」も作成しました。
3. 脳:MARC(「目隠し」学習者)
彼らは、**MARC(Mask-Aware Reactive Compliant)**と呼ばれる新しいAIポリシーを訓練しました。
- 訓練のトリック: 訓練中、彼らは時々ロボットのカメラに「目隠し(視覚マスキング)」をかけます。これにより、ロボットは視覚に頼るのをやめ、何をするべきかを判断するために「触覚(校正された力データ)」を使うことを学ぶよう強制されます。
- 結果: ロボットは、自分の手が視界を遮って物体がはっきり見えない場合でも、指の圧力センサーを信頼して、十分に強く握っているか、あるいは落としそうかを判断すべきであることを学びます。
4. 実行:ハイブリッド・チーム
このシステムは、一つの脳ですべてを行うわけではありません。チームアプローチを採用しています。
- 学習者(MARC): 物体に手を伸ばし、掴むという難しい部分を担当します。これには「目隠し」訓練を用い、安全かつ優しく動作するようにしています。
- 筋肉(モデルベース・コントローラー): 物体を掴んだ後は、より単純な数学ベースのコントローラーが引き継ぎ、ロボットが動いている間、物体を安定して保持します。もしロボットが何かにぶつかった場合、このコントールラーは損傷を防ぐために、ちょうど良い具合にグリップを緩め、その後再び締め直します。
- 受け渡し: 人間に物体を手渡す際、システムはタイマーに基づいて手を開くのではなく、力センサーを使用して、まさにいつ手を離すべきかを判断します。
5. 結果:一つの脳、多くの手
チームは、非常に異なる3種類のロボットハンド(5本の指を持つもの、指が少ないもの、関節構造が異なるもの)でテストを行いました。
- 魔法のような効果: 彼らは一つのハンドセットでシステムを訓練し、その後、一度も見せたことのない新しいハンド構成でテストを行いました。
- 成果: システムは驚くほど上手く機能しました。力を「ユニバーサルな言語」へと翻訳することで、ロボットは20関節の手から学んだスキルを、ゼロから学び直すことなく15関節の手へと転移することができたのです。
- 成功率: 滑りやすい卵やカップの積み重ねを拾うといった困難なタスクにおいて、指の位置のみを見る従来の方法と比較して、この新しい「力の翻訳機」を使用した場合は成功率が大幅に向上しました(約44%から71%へ)。
まとめ
要約すると、この論文はこう述べています。**「ロボットにどこへ動くべきかだけでなく、どれくらいの強さで握るべきかを教え、その感覚をどんなロボットハンドでも理解できるユニバーサルな言語へと翻訳せよ」**ということです。これにより、ロボットはたとえ訓練時とは全く異なるタイプの手を使っていても、デリケートなもの、滑りやすいもの、あるいは柔らかいものを安全に扱うことができるようになります。
技術要約:単なる動きではなく、接触を転送する
問題提起
器用な操作(dexterous manipulation)には、指の動きを予測するだけでなく、滑り、変形、および自己遮蔽(self-occlusion)に対処するための、接触力の能動的な制御が必要である。既存のクロスエンボディメント・ポリシーは、リターゲティングされたポーズや潜在アクション空間を通じて運動意図を統一することには成功しているが、「接触フィードバック」の転送には失敗している。力フィードバックは、ハンド固有のセンシングやアクチュエーション(例:生の努力信号や触覚プロキシ)に紐付けられたままであり、異なる構造を持つロボットハンド間で負荷を比較することを不可能にしている。その結果、あるハンドで学習されたポリシーは、視覚的な手がかりが遮蔽された場合や、精密な力制御が必要な場合に、別のハンドへと汎化することができない。
手法
1. 統一された力・位置インターフェース
本研究の核心的な貢献は、運動意図と接触負荷を分離し、両者を物理的に比較可能な単位で表現する、転送可能なインターフェースである。
- 共有された運動意図: ハンドポーズは、共有された MANO-pose 潜在変数 (ψ∈R15) で表現される。この低次元ベクトルは、人間のグローブデータから一度学習され、指先の位置と指の形状を最適化するハンド固有のリターゲティングマップ (Rh) を介して、任意の特定のハンドの関節構成 (q(h)) へとマッピングされる。
- 校正された接触チャネル: 生の努力信号を使用する代わりに、システム同定を行い、ハンド固有の努力プロキシを 物理的な関節トルク (τ(h) [N·m]) へとマッピングする。これらのトルクから、システムは以下を導出する:
- 指先力 (ft): 並進ヤコビアンの最小二乗逆行列を介して計算される。
- 空間トルク記述子 (γt): 指に沿った接触位置、関節にわたる負荷の分布、および力の横方向のシェアを符号化する、3つのスカラー (c,ρ,ℓ) からなるコンパクトなセット。
これにより、ポリシーは、ハンドの形態に関わらず、統一された座標系において「手がどこへ動くべきか」および「物体にどのように負荷がかかっているか」を観察することができる。
2. MARC: マスク認識型反応的コンプライアント・ポリシー
著者らは、Diffusion Transformer (DiT) アーキテクチャに基づくフローマッチング・ポリシーである MARC を導入している。
- 入力: ポリシーは、エンドエフェクタのポーズ、指先の位置、校正された力 (ft)、空間トルク記述子 (γt)、および共有ポーズ潜在変数 (ψt) を含む統一された状態タプル st に条件付けられる。
- 構造化された視覚マスキング: 学習中、視覚トークン(パッチまたはカメラストリーム全体)が学習されたマスク埋め込みによってランダムに置き換えられる。これにより、視覚的な証拠が欠落または信頼できない場合(例:自己遮蔽時)に、ポリシーが力データを無視するように学習するのではなく、力と固有受容感覚に依存するように強制される。
- 学習目的: ポリシーは、ガウスノイズ源をターゲットのアクションチャンクへと輸送する速度ベクトルを予測し、フローマッチング損失を最小化する。
3. ハイブリッド実行パイプライン
本システムは、長期的なタスクに対して単一のエンドツーエンド・ポリシーに依存するのではない。代わりに、学習されたプリミティブをモデルベースのコントローラと組み合わせる:
- リーチ・アンド・リフト (Reach-and-Lift): MARCによって実行され、把持と初期のリフトにおける接触に敏感なフェーズを処理する。
- 輸送 (Transport): ハイブリッド力・位置コントローラを用いる 定常把持レギュレータ によって管理される。これは最小限の安定したグリップを維持し、輸送中に物体への負荷が生じた場合には、校正されたトルクフィードバックに基づいてグリップを自動的に強化する。
- ハンドオーバー (Handover): 外力による力(wrenches)に比例して、アームを譲り、手を開くエンドエフェクタ・アドミッタンス・コントローラによって制御される。
- コントローラ・ロジック: 低レベルのコントローラは指令されたポーズを追従するが、校正されたトルクに基づいた「片側退避(one-sided retreat)」補正を適用する。接触トルクが目標値を超えた場合、コントローラは関節を開く。そうでなければ、ポーズ指令に従う。これにより、ハンドを物体の中に深く押し込むことなく、コンプライアンスを確保する。
主な貢献
- 転送可能な接触表現: ハンド固有の努力信号を、校正された関節トルク、指先力、およびコンパクトな負荷記述子に変換する手法であり、異なる構造を持つデクスタラス・ハンド間での接触フィードバックの物理的な比較を可能にする。
- 統一された力・位置インターフェース: 共有されたハンドポーズの意図と校正された接触フィードバックを組み合わせたフレームワークであり、異種エンボディメント間でのコンプライアントな制御転送を可能にする。
- MARC ポリシーとパイプライン: 視覚、固有受容感覚、および校正された接触に学習された、マスク認識型フローマッチング・ポリシーであり、タスク固有の再学習なしに、長期的な操作(リーチ、輸送、ハンドオーバー)のためのモデルベースのプリミティブと統合されている。
実験結果
システムは、構造的に異なる3つのハンド(Wuji, Wuji12, Inspire)を備えたUnitree G1 ヒューマノイドを用いて、剛体および柔軟/変形物体(例:卵、ブリオッシュ・バンズ、積み重ねられたカップ)を含む10のタスクで評価された。
- 性能向上: MARCは、すべてのハンドとタスクにおいて、平均リーチ・アンド・リフト成功率を 0.44 (ベースライン sDiT) から 0.71 へと向上させた。
- 具体的な改善:
- Inspire: 0.54 → 0.84
- Wuji: 0.48 → 0.79
- Wuji12: 0.29 → 0.51
- クリティカルなケース: 最も顕著な利得は、滑りやすく遮蔽されやすい「マーカー(Marker)」タスクで観察され、成功率はInspireとWujiにおいてそれぞれ 0.2/0.1 から 1.0/0.9 へと跳ね上がった。
- アブレーション: 校正された接触チャネルを取り除くと、剛体オブジェクトに対する性能がベースライン(0.48)まで低下し、この利得がアーキテクチャやマスキングによるものではなく、力チャネルによって駆動されていることが確認された。
- ゼロショット汎化: ポリシーは、再学習なしに未知の Wuji15 構成(15自由度)へと正常に転送され、イン・ディストリビューションのWujiの結果から0.1以内の成功率を達成した。
意義と主張
本論文は、接触がハンド固有のプロキシとしてではなく、物理単位(トルクと力)で表現されるとき、接触自体が転送可能であると主張している。運動意図と接触負荷を共通のインターフェースに統一することで、本システムは、構造的に異なるハンド間での器用な操作スキルの転送を可能にする。著者らは、このアプローチにより、遮蔽や物体の変形によって視覚的フィードバックが不十分なシナリオにおいても、安定したコンプライアントな相互作用が可能になることを強調している。本研究は、校正された接触を用いて学習された単一のポリシーが、タスク固有のモデル訓練やファインチューニングを必要とせずに、ヘテロジニアスなハードウェアを駆動できることを示している。
毎週最高の computer science 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。登録