世界を移動するロボットは、しばしば根本的なジレンマに直面します。それは、自重を支え、障害物を押し通すのに十分な強さを持たなければならない一方で、足元の地面が変化した際に適応できる柔軟性も備えていなければならないということです。硬い金属フレームで作られた従来のロボットは、地形が凹凸に富んでいたり、岩が多く、あるいは物が散乱していたりする場合、立ち往生したり転倒したりすることがよくあります。これとは異なるアプローチとして、硬い棒を柔軟なケーブルのネットワークでつなぎ合わせた構造を用いるものがあります。これらの「テンセグリティ」ロボットは軽量で非常に耐久性が高く、もし転んでも壊れるのではなく、跳ね返ります。しかし、それらを制御することは極めて困難です。その動きは、ケーブルの張力と棒が地面に接する方法との複雑な相互作用に依存しているため、それらがどのように転がったり転倒したりするかを正確に予測することは、不完全なデータを用いて天気を予測しようとするようなものです。ロボットは自分自身の完全な形状や、接地している地面の正確な角度を把握できないことが多く、コンピュータが安全な経路を計画することを難しくしています。
ラトガース大学とイェール大学の研究者たちは、急なスロープ、狭い通路、低い位置にある障害物を含む複雑な環境において、これらの跳ねるロボットを誘導する新しい方法を開発しました。ロボットの動きを記述するための完璧な数学的公式に頼る代わりに、彼らはコンピュータモデルに経験から学ぶことを教えました。このモデルは、システムの異なる部分が互いにどのように接続しているかを理解することに長けている「グラフニューラルネットワーク」と呼ばれる一種の人工知能を使用しています。この場合、システムとはロボット自身と、ロボットがぶつかる可能性のある壁や地面のことです。研究者たちは、この学習システムに、ロボットが表面(それが平らな床であれ、傾斜したスロープであれ、あるいはロボット自身の他の部位であれ)に触れたことを「感じる」ことができる特別な機能を加えました。この接触を感知する能力は極めて重要です。なぜなら、ロボットが前進するためには、壁に寄りかかったり、障壁の下を通り抜けたりする必要があるからです。
この学習モデルを実用化するために、チームは絶え間なく高速で計画を立てる制御システムを作成しました。ロボットが、次の数秒間にどのように動くかについて、何千通りもの異なる方法を頭の中で想像するために、一瞬だけ停止すると想像してみてください。システムはそれぞれの可能性をシミュレーションし、どの経路が衝突せずに目標に到達できるかを確認します。そして、最善の選択肢を選んで実行し、すぐに次の動きの計画を開始します。モデル予測制御として知られるこのプロセスにより、ロボットはリアルタイムで変化に対応できます。しかし、研究者たちは、ロボットが自力で効果的に曲がることに苦労することを発見しました。これを解決するために、彼らはスマートな計画システムと、単純なプログラム済みの旋回動作を組み合わせました。ロボットが方向を変える必要があるときは、これらの信頼できる旋回動作を使用して正しい方向を向き、それからスマートなプランナーに経路のナビゲーションを任せるのです。
チームは、現実世界の物理法則を模倣した高精度なコンピュータシミュレーションを用いて、このアプローチのテストを行いました。彼らは、壁のある単純な平坦なコースから、急な傾斜や狭いスペースを含む困難な3次元障害物コースに至るまで、5つの異なる課題を設定しました。最も難しいテストでは、ロボットはこれまで見たことのない環境をナビゲートしなければならず、そこにはこれまでのすべての課題が組み合わされていました。結果として、新しい学習システムとハイブリッドな旋回戦略を用いたロボットは、古い手法よりもはるかに高い成功率を示しました。他のアプローチがスロープを登れなかったり、狭い通路で立ち往生したりした一方で、新しいシステムは、未知の環境においても、大部分の試行において目標に到達することに成功しました。ロボットはデータを収集するにつれて改善され、テストを繰り返すごとに、より速く、より正確になっていきました。
この研究は、ロボットに周囲の世界との触れ合い方を教え、学習された知能と単純で信頼できる動きを組み合わせることで、現実世界の乱雑で予測不可能な地形をナビゲートできる機械を作れることを示唆しています。研究者たちは、この手法がシミュレーションにおいて有効であることを実証しており、将来の物理的なロボットへのテストへの道を開きました。現在のシステムは平坦な表面に限定されており、完全に構造化されていない環境を扱うにはさらなる開発が必要ですが、このアプローチの成功は、災害現場での探索、瓦礫の中での生存者捜索、あるいは他の惑星の険しい風景を横断するロボットへの有望な道筋を示しています。
技術要約:接触を考慮したグラフニューラルダイナミクスモデルによるテンセグリティロボットのモデル予測制御
問題提起
剛体ストラットと柔軟なケーブルで構成されるテンセグリティロボットは、軽量で柔軟な移動能力を備えており、非定型な地形に適している。しかし、その制御は複雑で接触の多いダイナミクスと部分的な観測性に阻まれている。従来の制御手法は、幾何学的プランニングやモーションプリミティブに依存することでシステムダイナミクスを回避する傾向がある一方、シミュレーションから転移された強化学習ポリシーは、移動能力に限界を示すことが多い。さらに、グラフニューラルネットワーク(GNN)に基づく既存の学習済みダイナミクスモデルは、水平な地面との接触を想定しており、非水平な平面地形、環境障害物、または自己衝突を考慮できていない。本研究は、正確な接触相互作用のモデリングが不可欠な複雑な環境において、テンセグリティロボットの堅牢なクローズドループ・ナビゲーションを実現するという課題に取り組むものである。
手法
提案されるフレームワークは、学習されたGNNダイナミクスモデルと、反復的なデータ収集ループ内で動作するモデル予測パス積分(MPPI)コントローラを統合したものである。
接触を考慮したGNNダイナミクスモデル:
- 本アプローチの核となるのは、先行研究のGNNベースのダイナミクスモデルの拡張である。著者らは、PyTorchで実装された微分可能な接触検出モジュールを導入している。
- このモジュールは、ロボットのエンドキャップと非水平な平面表面(例:スロープ、壁)との間の相互作用、およびロボットの円筒状ロッド間の自己衝突を表す接触特徴量を生成する。
- これらの相互作用は、グラフ内のノード特徴量(符号付き距離)およびエッジ特徴量(相対速度、表面法線、距離)としてエンコードされる。これにより、モデルは複雑な接触制約を持つ環境下での部分的な観測の下で、状態変化(ロッドの速度およびケーブルの自然長)を予測することが可能となる。
ハイブリッドMPPIコントローラ:
- コントローラは、内部予測モデルとして学習されたGNNを利用し、サンプリングベースの最適制御を実行する。
- 3本棒テンセグリティロボットにおいて効果的な旋回行動のサンプリングが困難であること(長いホライゾンと多数のサンプルを必要とする)に対処するため、ハイブリッド戦略を採用している。
- システムは、局所的なコスト勾配に対するロボットの向きを評価する。向きが目標方向に対して閾値 α 以内に整列している場合はMPPIコントローラを実行する。向きがずれている場合は、MPPI制御を再開する前にロボットを再配向させるため、人間が設計した旋回モーションプリミティブ(時計回りまたは反時計回り)に切り替える。
- コスト関数は、グリッド上に構築された障害物を考慮したウェーブフロント・ヒューリスティックを利用する。これにより、障害物のある密集した環境において、ユークリッド距離指標の欠点を回避し、目標からの障害物考慮済み距離推定を伝播させる。
反復的データ収集ループ:
- システムは、MPPIコントローラがタスクを実行して新しい軌道データを生成するクローズドループで動作する。
- このデータは、GNNダイナミクスモデルを再学習するための訓練セットに追加され、これによってコントローラの予測精度と性能が次回のイテレーションにおいて向上する。プロセスは、人間が設計したプリミティブからのデータから始まり、連続的な学習サイクルを通じて進化する。
主な貢献
- 拡張されたGNNダイナミクスモデル: 非水平な平面地形、環境障害物、および自己衝突を扱うための微分可能な接触検出を組み込んだ学習済みモデルであり、従来の平坦な地面の仮定を超えた拡張を実現した。
- 反復的MPCフレームワーク: 学習されたGNN上でMPPIを用いることで、ダイナミクスモデルと制御性能の両方を同時に改善する反復ループを促進するMPCフレームワーク。
- ハイブリッド制御戦略: 純粋なMPPIによる旋回操作のサンプリング効率の問題を克服し、機動性を高めるために、MPPIと旋回モーションプリミティブを組み合わせた解決策。
- 包括的な評価: 傾斜、狭い通路、低クリアランス構造、および複合3D障害物コースを含む、5つの多様なナビゲーションタスクにおけるMuJoCoでの実験的検証。
結果
実験は、平坦な障害物コース、5°の傾斜、狭いコーナー/通路、低クリアランス構造、および複合3D障害物コース(後者は未知のテスト環境として機能)の5つのナビゲーションシナリオで実施された。
- モデルの精度: 接触を考慮したGNNモデルは、重心位置およびロッドの向きの予測において、ベースラインとなるGNN(平坦な地面を想定)を一貫して上回った。予測誤差は、コントローラによって生成されたデータとともにデータセットが増大するにつれ、学習イテレーションを通じて減少した。
- ナビゲーション性能:
- 平坦な障害物コース: ハイブリッドMPPIは第1イテレーションから100%の成功率を達成し、MPPI単体(旋回に苦戦した)を上回り、A*再プランニングのベースラインと同等の性能を示した。
- 傾斜: A*ベースラインは向きのダイナミクスのドリフトにより完全に失敗した。MPPI単体は限定的な成功(33%)に留まったが、ハイブリッドMPPIは第1イテレーションから100%の成功を達成した。
- 狭い通路および低クリアランス: これらのタスクは意図的な障害物との接触を必要とし、A*ベースラインはこれを計画できなかった。ハイブリッドMPPIはMPPI単体を大幅に上回り、より高い成功率と高速な収束を実現した。
- 3D障害物コース(未知): ハイブリッドMPPI戦略は強い汎化性能を示し、最終イテレーションにおいて、MPPI単体の35%に対し、84%の成功率を達成した。
- アブレーション研究: 距離に基づく接触ノード特徴量が、接触エッジのみよりも予測精度に大きな影響を与えたことが示され、明示的な近接情報の重要性が浮き彫りになった。
意義と主張
本論文は、接触を考慮した学習済みダイナミクスとサンプリングベースのモデル予測制御の組み合わせが、従来の幾何学的プランニングや純粋な強化学習が失敗する、複雑で接触の多い環境における堅牢なテンセグリティ・ナビゲーションを可能にすると主張している。著者らは、部分的な観測性と複雑な接触物理学を扱う能力を洗練させる上で、反復的なデータ収集ループが極めて重要であることを強調している。
本研究の現在の範囲については、アプローチが現在平面的な表面表現に限定されていること、および旋回プリミティブが手作業で設計されたものであることを認め、控えめな姿勢をとっている。著者らは、将来の研究として、完全な非定型地形へのモデルの拡張、データからの直接的な旋回プリミティブの学習、および物理的な3本棒テンセグリティロボット上での反復的改善ループの実証を挙げている。
毎週最高の computer science 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。登録