← 最新の論文
🤖 AI

When Seeing Is Not Enough: Benchmarking Interactive Visual Grounding in LVLMs

本論文は、大規模視覚言語モデル(LVLM)におけるインタラクティブなビジュアルグラウンディングのためのベンチマークを導入し、現在のモデルが人間のベースラインを大幅に下回っていること、初期の説明が提供されていない場合に能動的な情報探索に苦戦すること、そして信頼度と正確性の間のキャリブレーションが不十分であることを明らかにしている。

原著者: Zhengxiang Wang, Owen Rambow

公開日 2026-08-26
📖 1 分で読めます☕ さくっと読める

原著者: Zhengxiang Wang, Owen Rambow

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

人工知能の世界には、「ビジュアル・グラウンディング(視覚的接地)」と呼ばれる特定のスキルがあります。それは、コンピュータが写真を見て、人間が話している特定の対象物を正確に指し示す能力のことです。もしあなたが「赤いボールを探して」と言えば、システムは多くのボールの中からその特定のボールを見つけ出さなければなりません。長年、科学者たちは、コンピュータに完璧で詳細な説明を与え、それと一致するものを見つけさせることで、このスキルをテストしてきました。これは、誰かに完全な地図を手渡し、隠された宝を見つけさせるようなものです。コンピュータはこの一歩のタスクにおいては非常に習熟しており、指示が明確で完全であれば、人間のパフォーマンスに匹かに及ぶか、あるいはそれを上回ることがよくあります。

しかし、現実の世界はこれほど単純ではありません。人間同士が会話するとき、説明はしばしば曖昧であったり、不完全であったり、あるいは間違っていたりします。私たちは完全な地図を手渡すのではなく、代わりに、理解を共に構築していきます。「それは左側にありますか?」とか「持ち手はありますか?」といった質問をして、欠けているピースを埋めていくのです。本論文では、人工知能に対して同じことを求めたときに何が起こるかを探ります。つまり、画像を見て、情報が足りないことに気づき、そして正しい質問をして対象物を特定できるかどうかです。研究者たちは、これらのスマートなコンピュータシステムが、現実の会話の持つ、あいまいで双方向的な性質を扱えるのか、それとも指示が銀の皿に乗せて提供されない限り失敗してしまうのかを知りたかったのです。

研究チームは、このインタラクティブな能力をテストするために、制御された実験を設定しました。彼らは、ターゲットとなる物体を知っている「ディレクター(指示役)」と、それを見つけなければならない「マッチャー(照合役)」という2つの役割を持つゲームを作成しました。ゲームには、犬、バスケット、そしてタングラムと呼ばれる抽象的な図形の4種類の異なる視覚的世界を使用しました。ゲームの中で、マッチャーは多くの候補品があるグリッドを見ますが、ディレクターは正しいターゲットのみを見ています。研究者たちは、マッチャーが情報をどのように扱うかを調べるために、4つの異なる条件下でテストを行いました。第1の条件では、マッチャーに完全で完璧な説明が与えられ、会話なしで物体を見つける必要がありました。第2では、完全な説明が与えられましたが、自分の作業を確認するためのフォローアップの質問をすることが許可されました。第3では、非常に漠然とした「それはバスケットです」といった手がかりから始まり、どのバスケットかを特定するために質問をしなければなりませんでした。最後の最も困難な条件では、マッチャーには説明が一切与えられず、ゼロから「はい・いいえ」で答えられる質問を行い、頭の中にターゲットのイメージを構築しなければなりませんでした。

彼らは、このゲームを8つの異なる大規模ビジョン言語モデル(画像を認識し、テキストを読み取ることができる最も高度なタイプの人工知能)を用いて実行しました。結果は明白であり、かついくぶん驚くべきものでした。モデルは完璧な説明を与えられた場合でさえ、人間のプレイヤーのパフォーマンスに匹敵することに苦労しました。しかし、タスクが対話を必要とするようになると、その差はより大きく広がりました。モデルがターゲットを見つけるために質問をしなければならないとき、そのパフォーマンスは著しく低下しました。特に、ゼロから情報を集めて自ら会話を導かなければならない最も難しいタスクにおいて、彼らは特に不十分でした。彼らは質問をすることはできましたが、しばえるしい質問をしたり、受け取った回答を効果的に使って選択肢を絞り込んだりすることができませんでした。

研究はまた、モデルが自分の回答に対してどの程度自信を持っているかについても調査しました。研究者たちは、モデルがしばしば過剰に自信を持っていることを発見しました。実際には間違っているときでも、正しい物体を見つけたという高い確信度を報告するのです。この自己認識の欠如は、モデルがターゲットを見つけるために質問を行う必要があるときに最も顕著に現れました。彼らは、十分な情報がないにもかかわらず、十分であると思い込んでいるようでした。興味深いことに、モデルは説明を洗練させるためのフォローアップの質問をすることが許可された場合には、改善を示す能力を多少は見せましたが、その助けは限定的でした。誰かに間違いを指摘されれば修正することはできましたが、間違いを避けるために必要な情報を自発的に求めることは得意ではありませんでした。

これらの発見が確かなものであることを確認するため、研究者たちはいくつかの追跡テストを実施しました。説明が人間によるものかコンピュータによるものかによって結果が変わるか、モデルが回答する前により深く思考するように強制した場合、あるいは同じパートナーと何度もゲームを行う場合、結果が変わるかをチェックしました。あらゆるケースにおいて、パターンは同じでした。モデルはコンピュータ生成の説明を受けたほうがパフォーマンスが向上しましたが、それでもタスクのインタラクティブな部分には苦戦しました。また、ゲームを数回プレイした後に少しずつ上達することは分かりましたが、人間のパフォーマンスに追いつくことはありませんでした。会話をゼロから始め、共通の理解を構築するという難しさは、依然として大きな障壁であり続けました。一つの追跡研究では、モデルを顔の画像でテストしましたが、メインのゲームは犬、バスケット、タングラムに焦点を当てていました。

研究者たちは、これらの人工知能システムは、明確な説明を画像に一致させることには優れているものの、現実世界の人間同士のコミュニケーションにはまだ準備ができていないと結論付けました。彼らは、情報が不足していることを認識し、それを得るための正しい質問をする能力に欠けています。また、自分の回答に対してどの程度確信を持つべきかを判断することも苦手です。このことは、ロボットやAIアシスタントが真に人間と共に働くためには、単に見る方法だけでなく、話し方、助けを求める方法、そして自分が答えを知らないということに気づく方法を学ぶ必要があることを示唆しています。それらができるようになるまで、彼らは指示が完璧であるタスクに限定され続け、複雑でインタラクティブな人間特有の参照という課題は、未解決のまま残されることになるでしょう。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →