Investigating Relational Reasoning in VLMs
本論文は、合成幾何学データセットとQwen3-VL-4Bモデルを用いて、視覚言語モデルが真に視覚的関係を理解しているのか、それとも言語的なショートカットに依存しているのかを調査し、現在のVLMが真の視覚的推論と主に言語的手がかりに根ざした戦略の両方を組み合わせていることを明らかにしている。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
現代の人工知能の展望において、新しい世代のコンピュータが、視覚と発話を同時に学習しました。ビジョン・ランゲージ・モデル(視覚言語モデル)として知られるこれらのシステムは、写真を注視してその内容を説明したり、目に見えるものに関する質問に答えたり、さらには画像に基づいたパズルを解いたりすることができます。人間の観察者にとって、それらは人間が場面を一瞥して物体同士がどのように関連しているかを即座に把握するのと同様に、視覚的な世界に対する真の理解を備えているかのように見えます。しかし、根本的な疑問が未解決のまま残されています。これらの機械は、物体間の空間的な関係やつながりを真に理解しているのか、それとも単に言語的なトリックや統計的な推測に依存した巧妙なパターン・マッチングを行っているだけなのでしょうか。この不確実性は重要です。なぜなら、もしこれらのシステムがショートカットを通じて理解を模倣しているだけであれば、訓練データと一致しない状況に直面した際に予測不可能な失敗を招き、重要なアプリケーションにおいてエラーを引き起こす可能性があるからです。
ある研究チームは、現実世界の複雑さを取り除き、それを制御された合成環境に置き換えることで、これらのモデルの内部構造を明らかにしようと試みました。彼らは、円、正方形、三角形といった基本的な幾材が特定のパターンで配置された、数千枚の単純な画像からなるカスタムデータセットを作成しました。これらの図形には異なる色とサイズが割り当てられ、場合によっては、それらを明示的に結ぶために矢印が描かれていましたが、他のケースでは、相対的な位置関係によってのみ接続が暗示されていました。研究者たちは、現代のビジョン・ランゲージ・モデルに対して、図形の数を特定したり、特定の色彩を認識したり、2つの物体の間の矢印の方向を判断したりといった一連の精密な質問を投げかけました。モデルの回答を合成画像の既知の事実と比較することで、彼らはその機械がどの程度正確にパフォーマンスを発揮しているかを正確に測定することができました。
結果は、モデルが得意とするものと苦戦するものとの間の、鮮明な隔たりを明らかにしました。図形の総数を数えたり、緑色の正方形が存在するかどうかを特定したりといった単純な認識に関する質問に対しては、モデルは96パーセントを超える、ほぼ完璧に近い精度で回答しました。それは、画像の具体的な要素をしっかりと把握しているように見えました。しかし、明示的な視覚的手がかりなしに、関係性を理解する必要がある質問になると、モデルのパフォーマンスは大幅に低下しました。例えば、矢印が描かれていない場合にどの物体が接続されているかを特定したり、レイアウトのみに基づいてある図形の別の図形に対する位置関係を記述したりする場合、モデルの精度は約60パーセント以下にまで落ち込みました。興味深いことに、描かれた矢印の方向を尋ねるなど、クエリが明示的な視覚的マーカーを提供している場合には、モデルは92パーセントを超える高い精度を維持していました。このことは、機械がシーンの cohérent なメンタルマップを構築しているのではなく、質問で使用される特定の単語や、提供された明示的な視覚的マーカーに大きく依存していることを示唆していました。
モデルが本当に関係性を「見ている」のか、それとも単に言語に基づいて推測しているだけなのかを判断するために、研究者たちは画像を改変するという厳格なテストを実施しました。彼らは、特定の要素(単一の図形や矢印など)をデジタル的に削除した元の画像の修正版を作成し、同じ質問を再度投げかけました。もしモデルが視覚的な証拠に基づいて真に推論しているのであれば、画像の主要な部分を取り除くことで、その精度は急落するはずでした。いくつかのケースでは、まさにその通りになりました。図形の数を数えたり、矢印の方向に従ったりする質問において、関連する視覚的要素を取り除くと、パフォーマンスが25パーセント近く低下しました。これは、これらのタスクにおいて、モデルが確かに画像を見ているものの、シーンが変化した際に脆弱となる内部バイアスと視覚データを混合させていることを示していました。
さらに驚くべきことに、研究者たちは、視覚的要素を取り除くことでモデルのパフォーマンスが向上した、あるいは変化しなかった種類の質問があることを見出しました。図形の相対的な位置や、矢印のない接続の存在について尋ねた際、視覚的な証拠が遮蔽されているときの方が、モデルはより良い回答を出しました。この直感に反する結果は、論文の中で「驚くべきことであり、視覚的推論に直接矛盾する」と記されていますが、これはモデルがこれらの問題を解決するために視覚データを全く使用していなかったことを強く示唆しています。その代わりに、モデルは質問の構成方法に基づいて、学習データから得た統計的なパターンに頼り、画像に何があるかではなく、言語的な手がかりに基づいて答えを推測していたのです。機械は空間について推論していたのではなく、言語的な手がかりに基づいた可能性の高い応答を暗唱していたのでした。
研究者たちは、モデルの処理レイヤーの内部を覗き込み、情報が初期の画像入力から最終的な回答へとどのように流れるかを追跡しました。彼らは、モデルの初期レイヤーが、特定の色の存在や形状のような単純な詳細を特定することに非常に優れていることを発見しました。情報がシステムを深く進むにつれて、モデルはカウントや粗い関係性の特定に長けてなっていきました。しかし、より深いレイヤーは、矢印の正確な方向や、明示的なマーカーがない状態でのアイテムの空間配置といった、複雑で抽象的な関係を、一貫してエンコードすることには失敗しました。本研究は、これらの強力なシステムは多くの視覚的タスクにおいて高いスコアを達成できるものの、その理解は、明示的に観察可能なものに厳格に限定されていると結論付けています。それらは真の視覚的理解を示しておらず、純粋な視覚的知覚と、言語的なショートカットを組み合わせたハイブリッド戦略に依存しています。この発見は、現在の人工知能における決定的な限界を浮き彫りにしており、真の視覚的理解には、単にピクセルと単語を処理すること以上のもの、すなわち、これらのモデルがまだ到達していない、より深く強固な形式の推論が必要であることを示唆しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。