ロボットが、まるで子供が親の靴紐の結び方を真似して学ぶように、私たちの動作を見て家事のやり方を学べる世界を想像してみてください。これは「ロボット学習」と呼ばれる分野の核心であり、特に「模倣学習」として知られる手法です。ロボットに教えるには、まずタスクのやり方を見せる必要があります。これは「テレオペレーション(遠隔操作)」と呼ばれるプロセスで行われます。ビデオゲームで、コントローラーの代わりに自分の体の動きを使って、巨大なロボットアームを操るキャラクターを操作しているようなものです。しかし、大きな問題があります。これらの「コントローラー」のほとんどは、特注の鎧のようなものです。特定のロボット、特定の仕事のために作られており、もし別のロボットに少し異なるタスクを教えようとすれば、多くの場合、ゼロから新しい鎧を作り直さなければなりません。これにより、時間がかかり、コストがかかり、学んだことを共有するのが難しくなります。科学者たちは、制御システムをレゴブロックのように柔軟にし、毎回機械全体を再構築することなく、パーツを簡単に交換してロボットに新しい技を教えられる方法を探しています。
そこで登場したのが、スタンフォード大学の研究者による、ロボットの教師にとって究極の「スイスアーミーナイフ」となることを目指した賢い発明、「ModPack」です。あらゆるロボットに対して個別のコントローラーを作る代わりに、チームはシステム全体の脳であり電源となる、単一のウェアラブルなバックパックを作成しました。このバックパックを、ユニバーサルアダプタープラグだと考えてください。一度バックパックを手に入れれば、必要な作業に応じて異なる「モジュール」を装着できます。部屋の中を移動するロボットを動かす必要があるなら、歩行を追跡するスマートフォンを取り付けます。両手で物を掴む必要があるなら、自分自身の動きを模倣する一対のロボことです。角の向こう側を見る必要があるなら、ロボットがあなたの目を通して周囲を見ることができるハイテクヘッドセットを接続します。魔法のような点は、これらすべてのパーツがバックパックを通じて互いに通信し、設計を完全にやり直すことなく、異なるロボットやタスクに適応できる統一されたシステムを作り上げていることです。
研究者たちは、このアイデアを検証するために、ModPackを使用して、2つの非常に異なるロボットに現実世界の雑用を教えました。一つの実験では、布を拾い上げ、バスケットを見つけ、その中に布を落とすようにロボットを教えました。ロボットがバスケットを見つけるのを助けるために、「能動的知覚(アクティブ・パーセプション)」モジュールを使用しました。これは、人間が何か隠れたものを見つけるために頭を傾けるように、人間がロボットのヘッドカメラを使って周囲を見渡せるようにするものです。別のテストでは、別のロボットに箱を持ち上げ、棚に置くように教えました。このために、「触覚フィードバック」モジュールを使用しました。これは力覚フィードバックジョイスティックのようなもので、ロボットが箱に強く触れすぎたとき、操作者に軽い押し戻しの感覚を与えることで、適切な圧力を加える方法を学ぶことができます。
結果は、このモジュール方式がうまく機能することを示唆しています。研究者がModPackによって収集されたデータを使用して、ロボットのポリシー(タスクを行うためのロボットの「脳」)を訓練したところ、ロボットは驚くほどその仕事を上手に行いました。布のタスクでは、ヘッドカメラを使用して周囲を見渡したロボットは25回の試行のうち22回成功しましたが、手元だけを見ていたロボットはほとんどの試行で失敗しました。箱のタスクでは、自身の動きの力を感じ取ることができた(触覚フィードバックを使用した)ロボットは20回中12回成功し、カメラのみを使用したバージョンよりも優れた結果を出しました。著者らは、視覚と触覚といった異なる種類の情報を組み合わせることが、ロボットの学習を速め、ミスを減らすのに役立つことを発見しました。
しかし、このシステムはまだ完璧ではありません。著者らは、ロボットアームのモーターには限界があることを指摘しています。つまり、ロボットが力を加えようとしながら同時に力を感じ取ろうとすると、モーターが苦戦する可能性があるということです。また、バックパックは、コンピュータやモーターを長時間動かすためにかなり大きなバッテリーを必要とするため、着用するには少し重くなります。こうした小さな障害はあるものの、チームは3Dプリントされたパーツやソフトウェアを含む設計全体を無料で公開しました。これにより、他の研究者も独自のバージョンを構築し、異なるパーツを交換し、ゼロから始めることなく新しいスキルを教える手助けができるようになります。硬直化した「一律の解決策」という問題を、柔軟な「プラグアンドプレイ」の解決策に変えることで、ModPackは、ロボットを教えることがカメラに新しいレンズをカチッとはめることと同じくらい簡単になる未来を提示しています。
テクニカルサマリー:ModPack – 二腕式移動操作のための拡張可能なテレオペレーション・インターフェース
問題提起
既存のロボット・テレオペレーション・システムは、特定のハードウェア構成やタスク領域に特化していることが多く、設計空間が断片化されている。このような専門化は、スケーラビリティと適応性を制限する。例えば、新しい能力(能動的知覚や移動ベースの制御など)を追加する場合、ハードウェアとソフトウェアの両方のパイプラインに対して大幅な再設計が必要となる。さらに、システムの単純さと機能的な能力の間には本質的なトレードオフが存在する。高度な能力を持つシステムは単純なタスクに対して冗長なオーバーヘッドを導入しやすく、一方で単純なシステムは複雑で長期的なタスクに必要な忠実度が不足している。著者らは、多様なプラットフォーム間での柔軟なデータ収集と方策学習を促進するために、コアとなるシステム・インフラストラクチャをタスクやロボット固有の機能から切り離す、統一されたモジュール式フレームワークの必要性を指摘している。
手法
著者らは、自己完結型のウェアラブルな「バックパック」ユニットを中心とした、モジュール式で拡張可能なテレオペレーション・システムであるModPackを提案する。このユニットは、オンボード計算、電力配分、データストレージ、および通信を統合しており、プラグアンドプレイ可能な機能モジュールのための共通基盤として機能する。
コア・アーキテクチャ
- ハードウェア: バックパックは3Dプリント部品で製作されており、トグルラッチによって固定された前面および背面パネルを備えている。内部には、オンボード計算用(ミニPC)、パワーバンク、およびアクセサリ用の取り外し可能なシェルフが収容されている。設計は人間工学の原則に従い、負担を軽減するために重量を胸部付近の垂直方向に分散させている。
- ソフトウェア: 軽量な双方向「ブリッジ」APIが、メッセージキュー・サーバーを使用してバックパックと対象ロボット間の通信を抽象化する。これにより、コア・スタックとエンボディメント(形態)固有の実装がデカップリング(分離)され、同一のシステムで異なるロボットやモジュールのサブセットをサポートすることが可能になる。
拡張可能なモジュール
本システムは、主に以下の3つのプラグアンドプレイ・モジュールをサポートしている。
リーダーアーム(関節レベルの制御):
- システムは、追従ロボットのアームと運動学的に等価な、3Dプリントされたリーダーアーム(6自由度または7自由度のバリアント)を利用し、直接的な関節空間のテレオペレーションを可能にする。
- 重力補償: オペレーターの疲労を軽減するため、システムはOrocos KDLライブラリを用いて重力トルクベクトル(τg)を計算し、リーダーモーターに適用する。これは関節空間のダンピングによって増強され、安定性のためにカスケード指数移動平均(EMA)フィルタによってフィルタリングされる。
- 触覚フィードバック: 力/トルク(F/T)センサを備えたロボット(例:RB-Y1m)の場合、システムはエンドエフェクタのレンチをヤコビアンの転置を用いて関節トルクにマッピングする。このフィードバックは、重力補償トルクに重畳される。電流予算戦略により、透明性(transparency)を維持しながら、モーターの安全性と寿命を確保する。
移動ベース制御:
- バックパックに装着されたiPhoneが、修正されたWebXRセッションを介してオペレーターのSE(2)ポーズを追跡する。
- システムは、オペレーターの身体運動をバックパック搭載センサーから分離するエゴセントリック・マッピング手順を実装している。オペレーターの真の回転中心を復元するために逐次的なオフセットを適用することで、ロボットのベース移動が、ローカルフレーム内におけるオペレーターの変位に対応するようにしている。
能動的知覚:
- Apple Vision Proが、オペレーターの頭部ポーズをロボットのネックコマンドとしてストリーミングする。
- デカップリング: ナビゲーションと知覚を同時に行う際の冗長なコマンドを防ぐため、システムは現在の移動ベースのポーズ(Tbase)を補償する。目標とする頭部ポーズは、ローカルなロボットベースフレーム内で表現される(Tneck=Tbase−1Ttarget)。これにより、オペレーターが意図した残差的なネック動作のみを抽出する。
方策学習
著者らは、ModPackを用いて収集されたデモンストレーションを使用して、TransformerベースのDiffusion Policyモデルを訓練している。入力には、ヘッドカメラおよびリストカメラからのRGB-DおよびRGB観測、およびオプションとして関節トルクデータが含まれる。視覚的特徴はCLIPプリトレーニング済みのViTを使用してエンコードされ、トルクデータは逐次的なCausalConvレイヤーを介して処理される。
実験結果
著者らは、ModPackを2つの異なるロボットプラットフォーム(ARX5アームを備えたカスタマイズされた移動ロボット、およびRB-Y1mロボット)で評価した。
タスク1:能動的知覚を用いた布の配置
- セットアップ: ロボットが布を掴み、左右どちらかのバスケットに向かって移動する。
- 知見: ヘッドカメラのみを使用した方策が最も高い成功率(25試行中22回)を達成し、リストカメラのみ(3/25)や全カメラ使用(20/25)を上回った。著者らは、ヘッドカメラがバスケットのローカリゼーションに必要な広範なエゴセントリックな視界と深度コンテキストを提供している一方で、リストカメラは布の変形やポーズの変化による分布外(out-of-distribution)の観測に苦しんでいるためであると仮定している。
タスク2:触覚フィードバックを用いたボックス転送
- セットアップ: ロボットがキャビネットから箱を持ち上げ、空いている棚(上段または下段)に置く。
- 知見: 全カメラの視覚情報と関節トルク情報の両方に条件付けられた方策("All Cam + Torque")が、ヘッドカメラのみの方策(12/20)や視覚のみの方策(11/20 および 6/20)と比較して、最も高い成功率(12/20)を達成した。
- 分析: アテンションの可視化により、トルク条件付きの方策はタスクに関連する領域(例:箱の端)に強く注意を向け、接触がクリティカルなフェーズにおいてトルクトークンへの依存度が高まることが示された。著者らは、投影された関節トルクが、把持のタイミングや深さに関する粗いアライメント信号を提供し、視覚のみの方策でよく見られる不適切な把持ポーズを緩和していると示唆している。
主な貢献
- ModPackシステム: 関節レベルの制御、移動ベースのトラッキング、および能動的知覚のためのプラグアンドプレイ・モジュールをサポートする、ウェアラブルなバックパックを中心とした、統一された拡張可能なテレオペレーション・インターフェース。
- デカップリングされた制御アーキテクチャ: オペレーターの動きを、アーム操作、ベース移動、および能動的知覚の各コンポーネントのコマンドへと分離する手法。これにより、同時制御における曖昧さを解消する。
- 高忠実度ウェアラブル触覚: 重力補償を備えた電動リーダーアームを用いた、関節レベルの触覚フィードバックのウェアラブルな実装。これは、フィードバックの忠実度と携帯性のバランスを実現している。
- オープンソース・フレームワーク: 著者らは、将来の研究を支援するために、ハードウェア設計、ソフトウェア・スタック、および方策学習フレームワークの完全な公開を約束している。
意義と主張
本論文は、ModPackが柔軟で再利用可能なフレームワークを提供することで、システムの単純さと機能的能力の間のトレードオフに対処することを主張している。2つの異なるロボットプラットフォームを用いた、実際の二腕式移動操作タスクにおける展開の成功を通じて、著者らはModPackを実用的なインターフェースとして検証している。本システムは、触覚フィードバックや能動的知覚のようなマルチモーダルな入力を組み込む際に、堅牢な方策の学習をサポートする高品質なデモンストレーションの収集を可能にする。著者らは、ModPackを、硬直化したタスク固有のテレオペレーション設計によって生じるスケーラビリティのボトルネックに対する解決策として位置づけ、タスクやロボットのエンボディメントを超えて汎用化可能な、統一された制御システムへの道筋を提示している。
毎週最高の computer science 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。登録