← 最新の論文
💻 computer science

SWIM: Vision-Language-Grounded Soft Whole-Body Interactive Manipulation

SWIMは、拡散ベースのVLAポリシーと視覚的ソフト自己受容感覚を統合することで、固有のコンプライアンスを活用した堅牢な物理的実行を実現する実行可能な駆動シーケンスを生成し、ソフト連続体ロボットが複雑な全身インタラクティブ操作を行うことを可能にする、ビジョン・ランゲージ・グラウンデッド・フレームワークである。

原著者: Tingcong Liu, Aye Phyu Phyu Aung, Junjie Xiong, Siyi Ma, Bo An, Ke Wu, Senthilnath Jayavelu

公開日 2026-09-16
📖 1 分で読めます☕ さくっと読める

原著者: Tingcong Liu, Aye Phyu Phyu Aung, Junjie Xiong, Siyi Ma, Bo An, Ke Wu, Senthilnath Jayavelu

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ロボット工学の世界には、硬い金属フレームで作られた機械と、柔らかく柔軟な素材で作られた機械との間に明確な境界線が存在します。自動車工場の腕のように見られる硬いロボットは、正確にプログラミングされた確実性を持って動きますが、狭い隙間に潜り込んだり、デリケートで不規則な物体を押しつぶさずに扱ったりすることには苦労します。対照的に、ソフトロボットは、生き物の組織のように曲がったり、伸びたり、ねじれたりできる柔軟な素材で作られています。この柔軟性により、物体に巻き付いたり、周囲に合わせて形状を適応させたりすることができ、狭い空間での作業や人間との安全な相互作用における潜在的な解決策を提供します。しかし、この柔軟性こそが新たな問題を生み出します。無数に変形しうる身体を制御することは非常に困難なのです。人間が「あれを拾って」という単純な命令を与えたとき、硬いロボットは手に至る単一の経路を計算できます。しかし、体全体が形を変えることができるソフトロボットは、同じ目標を達成するために、自身の全形態をどのように歪ませるべきかを考えなければなりません。これは、対象物だけでなく、ロボット自身の複雑な幾図形(ジオメトリ)をリアルタイムで理解する必要がある作業です。

研究者たちは最近、この特定の課題を解決するために、SWIMと呼ばれる新しいシステムを開発しました。これは、言語と視覚的なシーンを理解して全身操作を行うようソフトロボットを学習させるものです。チームは、筋肉が骨を引く仕組みに似た、ケーブルによって駆動される螺旋状のロボットに焦点を当てました。これにより、ロボットは体を丸めたり、手を伸ばしたり、物体に巻き付いたりすることができます。彼らが取り組んだ核心的な困難は、従来のメソッドがしばしば腕の先端だけに焦点を当てて制御しようとし、体の他の部分の複雑な形状を無視していたことでした。このアプローチは失敗しました。なぜなら、先端の位置だけでは、ロボットの他の部分がどのように曲がっているか、あるいは世界とどのように接しているかを完全には記述できないからです。これを修正するために、研究者たちは、ロボットの全身の形状、視覚的なシーン、そして音声による指示を同時に見る学習システムを作成しました。彼らは、ロボットが目標(例えば、物体を箱にしまう、ターゲットに手を伸ばす、あるいは掴むなど)を達成するためのケーブルの動きのシーケンスを予測することを学ぶために、シミュレーション環境の中で、ロボットが何千回も練習できる環境でシステムを訓練しました。

彼らの手法における主要な革新は、「ビジュアル・ソフト・プロプリオセプション(視覚的ソフト固有受容)」と呼ぶテクニックです。簡単に言えば、これはロボットがカメラ画像から自身の体の形状を「見る」ことを意味し、ケーブルの張力に関する内部知識を補完するものです。訓練中、システムは現在の腱長ベクトルを固有受容入力として使用して自身の構成を理解すると同時に、シミュレーション内ではロボットの体のいくつかの点における正確な座標も見せられていました。コンピュータモデルにこれらの点がどこにあるかを予測させることで、システムはロボットの幾何学的形状のメンタルマップを保持することを学習しました。これにより、特定の物体に到達するためには、何かをしまうときとは異なる方法で胴体部分を曲げる必要があるといった理解が可能になりました。さらに、目標への単一の完璧な経路を予測しようとするのではなく、システムは成功する可能性のある動きの範囲を予測することを学習しました。これは極めて重要です。なぜなら、ソフトな体を持つ場合、物体に巻き付く方法は多く存在する可能性があり、システムは固定された計画に固執するのではなく、有効な選択肢のいずれかを選べる柔軟性を持つ必要があるからです。

研究者たちはこのアプローチを2つの方法でテストしました。第一にコンピュータシミュレーションにおいて、そして第二に実際の物理的なロボットにおいてです。シミュレーションにおいて、システムは驚異的な成功を収め、梱包タスクを100%、ターゲットへの到達を96%、物体の把握を88%の割合で完了しました。これらの結果は、体の形状への意識や柔軟な予測モデルを使用しなかった他の手法よりも大幅に優れたものでした。しかし、真の試練は、彼らがシステムを実世界へと移行させたときに訪れました。物理的なマシン上でロボットの脳を直接実行し、カメラやモーターにリアルタイムで接続した際、パフォーマンスが急激に低下しました。ロボットは物体の把握において75%の試行で失敗しましたが、これは主に、処理のわずかな遅延とシミュレーションと現実の差異によって、ロボットが古い情報に基づいて行動してしまったことが原因でした。

これを克服するために、研究者たちは巧妙なデプロイメント戦略を導入しました。ロボットが動いている間にリアルタイムで考え、反応させるのではなく、まず仮想シミュレーションの中で動作のシーケンス全体を計画させるのです。ロボットは現実の世界を見て、そのシーンのデジタルツインを作成し、その後、頭の中でタスクを実行して、コマンドの完全なリストを生成します。この完全なシーケンスが準備できたら、ロボットは再び見たり考えたりすることなく、それを実行します。ロボットの体は自然に柔らかく柔軟であるため、コンピュータによる絶え間ない修正を必要とすることなく、小さな衝突や接触の変動を自律的に処理することができます。この「計画してから実行する」方法を用いたとき、物理的なロボットの成功率は、梱包で100%、到達で80%、把握で75%へと急上昇しました。これは、自身の形状に対する深い理解と、その自然な物理的柔軟性を活用する戦略を組み合わせることで、ソフトロボットが単純な言語によって導かれ、以前は手の届かなかった複雑な全身タスクを実行できることを証明しました。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →