← 最新の論文
💻 computer science

Where To Look? : Causal Tracing of Vision Encoders in VLM

本論文は、因果トレーシング(causal tracing)を用いることで、視覚言語モデルがターゲット領域外の視覚トークンに依存したり、構造を理解するために外観の手がかりを利用したりしていることを明らかにし、それらのモデルの高い記述性能と、視覚情報の実際の空間的な局在化や構造的推論との間にある根本的な乖離を露呈させている。

原著者: Naren Kumar S, Tirth Bhatt, Mayank Singh

公開日 2026-08-12
📖 1 分で読めます☕ さくっと読める

原著者: Naren Kumar S, Tirth Bhatt, Mayank Singh

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

探偵のジレンマ:AIの「目」は実際にどのように見ているのか?

あなたがロボットに世界を理解させる方法を教えているところだと想像してください。あなたはロボットにカメラと脳を与え、犬の写真を説明するように頼みます。長年、科学者たちは、これらの「視覚言語モデル(VLM)」が驚くべき正確さでこれを実行できることに感銘を受けてきました。しかし、一つの執拗な疑問が残っています。「彼らは実際にどのようにそれを行っているのか?」ということです。彼らは本当に私たちと同じように犬を「見ている」のでしょうか、それとも単に、隠された小さな手がかりに基づいて推測しているだけなのでしょうか?

これに答えるため、研究者たちは**因果的トレーシング(causal tracing)**と呼ばれる手法を用います。これは、探偵の「もしも(what-if)」のシナリオのようなものです。もし、ロボットの脳から特定の情報を取り出し、別の情報に入れ替えたとしたら、答えは変わるでしょうか?もし答えが劇的に変わるなら、その情報は「因果的に重要」であったと言えます。通常、私たちは、ロボットが犬について話しているなら、その脳の最も重要な部分はまさに犬を見ているはずだと想定します。しかし、もしロボットが実際には草や空や影に注意を向けており、単にそこに犬がいると「推測」しているだけだとしたらどうでしょう?この論文はこの謎に切り込み、AIの最も重要な部分が、実際に正しい場所を見ているのかどうかを問い直します。


どこを見るべきか? AIによる偉大なるミスディレクション

この研究において、LINGOリサーチグループの研究者たちは、世界で最も賢いAIモデルを使って「間違い探し」をするゲームを行うことに決めました。彼らが知りたかったのは、**「AIが画像に関する質問に答えるとき、実質的な役割を担っている脳の部分は、実際に問題の対象物を実際に注視しているのか?」**ということです。

これを知るために、彼らは**アクティベーション・パッチング(activation patching)**という巧妙なトリックを用いました。AIの脳を、何千ものワーカー(「トークン」と呼ばれます)がベルトコンベアでメモを回している巨大な工場だと想像してください。

  1. クリーンな実行(The Clean Run): 彼らはAIに鮮明な写真と、「青いシャツを着た女性はどこにいますか?」といった質問を見せます。AIは、その画像がどれほど理解されているかを示すスコアを出します。
  2. 破損した実行(The Corrupted Run): 彼らは同じ写真を取り出し、大量のノイズ(テレビの砂嵐のようなもの)を加えて、AIを混乱させ、スコアを低下させます。
  3. パッチを当てた実行(The Patched Run): これが魔法のステップです。彼らは「混乱した」ノイズ混じりの写真を使用しますが、そこに元の写真から来たたった一つの「クリーンなメモ」を工場のラインにこっそり紛れ込ませます。もし、AIが突然答えを思い出し、スコアが再び上昇したなら、その特定のメモこそが「ヒーロー」のトークンだったのです。

研究者たちは次に、シンプルな問いを投げかけました。**「そのヒーロー・トークンは、青いシャツを着た女性がいる部分から来たものだろうか?」これを測定するために、彼らはIoU(Intersection over Union)**という数学的ツールを使用しました。これは、「そのメモが実際の女性とどれくらい重なっているか?」を尋ねるための、少し凝った言い方です。

衝撃の発見:AIは正しい場所「以外」のあらゆるところを見ている

結果は、まるで親友が数字を見ずに天井を見つめながら数学の問題を解いていることを知らされた時のようでした。

チームは、古典的なCLIPモデルから、DeepSeek-VL、Qwen-2.5、LLaVAといった巨大で現代的な巨人まで、あらゆるものをテストしました。彼らは、最も「因果的な」トークン(ヒーロー)が、ターゲットとなるオブジェクトの真上に集まっていることを期待していました。しかし、実際に見つかったのは、弱く、ほとんど存在しないレベルの相関関係でした。

  • 数字は嘘をつかない: CLIPモデルにおいて、「重要であること」と「正しい場所にいること」の相関関係は、わずか 0.062 でした。これは実質的にゼロです。
  • パターンは続く: より大きく、より賢いモデルであっても、数値は低いままでした。DeepSeek-VLでは、ある種のノイズに対して 0.0531 ± 0.0334、別のノイズに対して 0.0520 ± 0.0041 でした。Qwen-2.5では、0.0912 ± 0.0422 でした。
  • 「ゼロ重複」の驚き: ある特定の例では、答えに多大な影響を与えたトークン(因果スコア 0.718)が、ターゲットとなるオブジェクトとほとんど重なっていませんでした(IoUはわずか 0.049)。それはまるで、AIが被写体ではなく、背景を見てパズルを解いているかのようでした。

著者らは、これらのモデルは視覚情報を「利用する」ことには非常に長けているが、必ずしもその情報の「特定の場所」に根ざしている(グラウンディングしている)わけではないと示唆しています。彼らは、特定のオブジェクトにズームインするのではなく、空の色、床の質感、あるいはシーン全体の雰囲気といった、「分散した」手がかりのネットワークに依存している可能性があります。

大きければ大きいほど良いのか?

あなたはこう思うかもしれません。「もしかしたら、古い小さなモデルは単に下手だっただけで、新しいスーパーAIならこれを解決しているのではないか?」と。研究者たちはこれも確認しました。彼らは2023年から最新の2025年リリースのモデルまでを調査しました。

結論は? いいえ。 パターンは変わりませんでした。最も高度で、複雑な質問に答え、指示を完璧にこなせるモデルであっても、依然としてこの断絶を示しています。著者らは、モデルがテストで高いスコアを獲得したからといって、それがより優れた「空間マップ」を構築したことを意味するわけではないと指摘しています。強いパフォーマンスが得られることは、必ずしもAIが正しい場所を見ていることを意味しません。それは単に、見つけられるあらゆる手がかりを使って、正しい答えを「推測」するのが非常に上手いということを意味しているのです。

「紐」テスト:彼らは形を理解しているのか?

さらに深く掘り下げるため、チームは別の問いを投げかけました。「もしオブジェクトの『見た目』を取り除き、その『形』だけを残した場合、AIはそれでも理解できるのか?」彼らは、幾何学的な構造(形と接続)は維持したまま、外観だけを変更する「紐(ストリング)」を用いたタスクを使用しました。

彼らは、モデルが構造を理解するために**視覚的な手がかりを搾取している(exploit)**ことを発見しました。外観に基づいた手がかりが取り除かれると、モデルは構造の理解を維持することに苦戦しました。これは、AIが外観とは独立した深い構造的な方法で「形」を見ているのではなく、接続を理解するために表面的な外観の手がかりに大きく依存していることを示唆しています。それらのトリックがなくなると、AIは迷子になってしまうのです。

これが未来に意味すること

論文は、明確かつ、少し不安をかき立てるメッセージで締めくくられています。**「『見る』ことと『推論する』ことの間には、隔たりがある」**ということです。

モデルは壊れているわけではありません。ただ、私たちが予想していなかった方法で動いているだけなのです。彼らは、容疑者の顔を一度も見ることなく、「容疑者はいつも赤い帽子を被っている」という点に気づくことで犯罪を解決する探偵のようなものです。「因果的な」脳の部分が仕事をしていますが、必ずしもターゲットを見ているわけではありません。

著者らは現在、これがすべての現代的なAIに共通する普遍的なルールなのか、それとも今回テストしたモデル特有の癖なのかを確認するために、さらに多くのモデルや異なる種類のカメラアーキテクチャを調査することを計画しています。今のところ、AIが画像を完璧に記述できるからといって、私たちが考えているような方法でオブジェクトを「見ている」と想定すべきではない、というのが彼らの示唆するところです。AIは写真全体を見ているかもしれませんが、私たちが重要視している特定の場所を見逃しているのかもしれません。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →