← 最新の論文
💻 computer science

SeededGrasp: Language-Guided Grasping in Complex Scenes with Multiple Embodiments

SeededGraspは、視覚言語モデルを用いて軽量な把握生成器のためのシード点を予測することで、高レベルの意味的推論と低レベルの幾何学的実行を分離するデータ効率的なフレームワークであり、高価なエンドツーエンドの学習を行うことなく、複雑なシーンにおける堅牢でマルチエンボディメントな把握を可能にする。

原著者: Yang Xu, Gurpreet Singh Mukker, Raymond Wang, Jasper Gerigk, Maria Attarian, Igor Gilitschenski

公開日 2026-07-23
📖 1 分で読めます☕ さくっと読める

原著者: Yang Xu, Gurpreet Singh Mukker, Raymond Wang, Jasper Gerigk, Maria Attarian, Igor Gilitschenski

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 ✨ これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ロボットが散らかった寝室の床からおもちゃを拾おうとしている場面を想像してみてください。人間にとって、これは簡単なことです。おもちゃが見え、その持ち手がどこにあるかを知っており、それを掴むだけです。しかし、ロボットにとって世界は、形や影が入り混じった混乱した塊です。ロボットは、2つの非常に異なることを同時に理解する必要があります。「大きな全体像」(目標は何ですか?「赤いカップの持ち手を掴め」)と、「細かな詳細」(ランプを倒さないように、指を正確にどこに触れさせるべきか?)です。これが**ロボット・グラスピング(把持)**の課題です。長い間、ロボットは「非常に賢いが不器用(何をすべきかは分かっているが、物に触れる物理学を理解できない)」か、あるいは「物理学には非常に長けているが愚か(何でも掴めるが、言葉による指示なしには、どこをどう掴むべきか教えられない限り動けない)」のどちらかでした。科学者たちは、「バスケットの持ち手を掴んで」という単純な文章を聞いて、散らかった部屋の中でも、さまざまなタイプのロボットハンドを使って、完璧な掴み方を自ら考え出せるロボットを構築しようと試みてきました。

ここで、賢い2人組のチーム、すなわち「脳」と「手」のように機能する新しい手法、SeededGraspが登場します。一つの巨大で超複雑なロボットの脳にすべてを一度に教えようとする(それは、犬に微積分を教えながら同時に取ってこいも教えるようなものです)代わりに、研究者たちは仕事を分割しました。まず、強力な**視覚言語モデル(VLM)**を使用します。これは、読み書きができ、かつ物を見ることができる超スマートなAIだと考えてください。このAIは、散らかったシーンと指示を観察します。このAIは指の正確な位置を計算しようとするのではなく、掴み始めるべき対象物上の単一の「シードポイント(種となる点)」、いわばデジタルな画鋲のようなものを指し示します。それは、人間が「ここを掴んで」と言いながら指を差すようなものです。

この「シードポイント」が植えられたら、次は軽量な第2のモデルが引き継ぎます。このモデルは、その単一の点に基づいてロボットの指をどのように動かすかを正確に知っている、熟練したメカニックのような存在です。言語理解という重労働は最初のAIが行い、幾何学という重労働は2番目のモデルが行うため、彼らは非常に効率的に連携できます。研究者たちは、シミュレーション上の散らかった部屋の中で、3種類の異なるロボットハンド(標準的な2本指のグリッパー、3本指のグリッパー、そして多くの関節を持つ非常に器用なハンド)を用いてテストを行いました。その結果、この「シードポイント」のアプローチは驚くほど効果的であり、シミュレーションにおいて72%の成功率を達成したことが分かりました。さらに印象的なことに、実世界のロボットを用いて現実の世界で試したところ、78%の確率で成功しました。

この論文は、いくつかの一般的な考え方に異議を唱えています。一つの巨大なモデルにゼロからすべてを学習させることは、コストがかかりすぎ、膨大なデータを必要とすると指摘しています。また、単にVLMを使用して把持ポーズ全体を直接推測させると、AIが3D幾何学によって混乱してしまうため、間違いが生じやすいことも示しています。代わりに、「シードポイント」が完璧な架け橋となり、スマートなAIに言語を、専門化されたモデルに物理学を処理させるのです。これが機能することを証明するために、チームは既存のデータに頼るだけでなく、システムを訓練するために、610の散らかったシーンにわたる256万個の把持という、全く新しい大規模なデータセットを作成しました。結果は非常に有望ですが、著者らは、これはシミュレーションおよび特定のセットアップを用いた実世界での試行によるものであり、ロボットの腕が障害物にぶつかることなく「シード」が指し示すあらゆる場所に到達できるようにするためには、まだやるべきことがあると述べています。しかし今のところ、SeededGraspは、ロボットに「指差し」の助けを借りて、聞き、見て、掴む方法を教える、楽しく効果的な方法を示しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →