← 最新の論文
💻 computer science

FUSE: Active Functional Affordance Grounding through Adaptive Semantic-Geometric Evidence Acquisition

本論文は、不確実性駆動型の探索戦略と学習された償却プランナーを通じて意味的・幾何学的証拠を適応的に獲得することにより、身体化エージェントが機能に基づいて物体を効率的に特定し空間的にグラウンディングすることを可能にする、能動的な機能アフォーダンス・グラウンディングのための新しいフレームワークであるFUSEを提案し、これをHabitatベースの新しいベンチマークによって検証する。

原著者: Zhou Chen, Sathyanarayanan N. Aakur

公開日 2026-08-14
📖 1 分で読めます☕ さくっと読める

原著者: Zhou Chen, Sathyanarayanan N. Aakur

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、目の前の状況を想像してください。あなたはロボットです。人間のボスから「こぼれたスープをすくい上げるものを見つけて」という唯一の指示を受けて、散らかったキッチンへと歩いて入っていきます。ここで、あなたは覗き穴を通して、部屋のほんのわずかな一部しか見ることができません。あなたは、光る赤いボール、青い箱、あるいは奇妙な形の岩を目にするかもしれません。もし、そのわずかな断片に基づいて推測してしまうと、あなたはボールをボウルだと思い込んで掴んでしまい、無残に失敗するかもしれません。これは、「エンボディド・エージェント(身体化されたエージェント)」、つまり現実世界に存在し、それと相互作用しなければならないロボットが直面している日常的な苦闘です。長い間、科学者たちはロボットに、物体を認識させる(例えば「あれはコップだ」と認識させる)方法や、単一の静止画からそれをどう持つべきかを推測する方法を教えてきました。しかし、現実の世界は混沌としています。物体は隠され、光は変化し、時にはその「コップ」に本当に取っ手がついているのか、それともただの塗られた岩なのかを確認するために、頭を動かして見る必要があることもあります。研究者たちが問いかけている大きな疑問は、ロボットがいかにして「自分はまだ十分に知らない」ということを理解し、エネルギーや時間を無駄にすることなく、パズルを解くために次にどこを見るべきかを正確に判断できるようにするか、ということです。

この論文は、ロボットがこの「どこを見るべきか?」というゲームをプレイするための新しい方法、「能動的機能アフォーダンス・グラウンディング(Active Functional Affordance Grounding)」を紹介しています。単に写真を見つめて推測するのではなく、ロボットは周囲を動き回り、物の後ろを覗き込み、正しい道具を見つけたという確信が持てるまで手がかりを集めるよう促されます。オーバーン大学のジョウ・チェン(Zhou Chen)氏とサティアナラヤナン・N・アークル(Sathyanarayanan N. Aakur)氏は、この問題を解決するためにFUSE(Functional Understanding through Semantic–Geometric Exploration:意味的・幾何学的探索による機能的理解)と呼ばれる新しいシステムを提案しています。FUSEを、謎を解くために2つの異なる「脳」を使うロボット探偵だと考えてください。最初の脳は「素早い推測者(アモルタイズド・プランナー)」であり、シーンを素早く見て、「スプーンはあそこにあるはずだ!」と判断します。2番目の脳は「ゆっくりとした慎重な調査員(明示的探索)」であり、実際に部屋の詳細な3Dマップを作成して、素早い推測者の予想が正しいかどうかを検証します。

FUSEの魔法は、どちらの脳を使うべきかを判断できるところにあります。もし素早い推測者が非常に自信を持っているなら、ロボットはそのままの計画に従い、時間とバッテリーを節約します。しかし、もし素早い推測者が混乱していたり、シーンが奇妙に見えたりする場合、F費は「ゆっくりとした慎重なモード」に切り替えます。ロボットは(3D Gaussian Splattingと呼ばれるものを用いて)部屋の3Dモデルを構築し、物体の形状や位置について、自分がどれだけ「知らない」かを正確に測定します。そして、最も多くの新しい情報を得られる場所へとカメラを移動させます。論文では、この「適応型」のアプローチが勝者であることを示しています。テストにおいて、FUSEは72%の確率で正しい物体を見つけ出しました。これは、ランダムに推測した場合(56%)や、高度な言語モデルを使用して探索をガイドした場合(65%)よりも優れた結果です。また、FUSEは「ゆっくりとした慎重な」手法よりも速度の面でも優れており、必要のない時に3Dマップを構築して時間を無駄にすることがなかったため、1.33倍速く動作しました。

研究者たちはまた、異なる「知識源」、つまり「すくい上げる道具」がどのような見た目であるかをロボットに伝えるための異なる方法を用いて、FUSEをテストしました。彼らは、専門のロボットモデル、Llamaのような大規模言語モデル、あるいは答えを事前に知っている完璧な「オラクル(神託)」など、どの「脳」が候補リストを提供したとしても、FUSEがうまく機能することを発見しました。しかし、彼らは一つの厳しい限界も見出しました。もしロボットの候補リストが完全に間違っている場合(例えば、岩をスプーンだと思っている場合)、いくら周囲を見回しても正しい物体を見つけることはできません。ロボットは、探している物体が実際にその候補リストに含まれている場合にのみ、その物体をグラウンディング(接地・特定)できるのです。

結局のところ、FUSEは、ロボットにとって世界を理解する最善の方法は、単に「より多く見る」ことではなく、「より賢く見る」ことであることを示唆しています。素早い直感と、証拠に基づいた慎重な検証を組み合わせることで、ロボットは推測をやめて「知る」ことができ、視界が遮られていたりシーンが混乱していたりしても、正しい道具を見つけ出すことができるのです。これは単なる理論的な勝利ではありません。著者たちは、この手法を用いることで、ロボットが仕事を正しく遂行しながらも、思考や移動に費やす時間を大幅に削減できることを示しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →