← 最新の論文
🤖 machine learning

Transcoders Trace Visual Grounding and Hallucinations in Vision-Language Models

本論文は、ビジョン・ランゲージモデルを解釈するためにトランスコーダーを用いた機能中心のフレームワークを導入し、このアプローチがスパース・オートエンコーダーよりも安定した視覚的グラウンディングをもたらすこと、および機械的グラフ分析を通じてハルシネーションの予測を可能にすることを示す。

原著者: Dimitrios Damianos, Leon Voukoutis, Georgios Skyrianos, Vassilis Katsouros, Georgios Paraskevopoulos

公開日 2026-05-25
📖 1 分で読めます☕ さくっと読める

原著者: Dimitrios Damianos, Leon Voukoutis, Georgios Skyrianos, Vassilis Katsouros, Georgios Paraskevopoulos

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ビジョン・ランゲージモデル(VLM)を、非常に才能があるがやや謎めいた通訳者と想像してみてください。この通訳者は画像を見て、それについての物語を書き出します。それがうまく機能することは分かっていますが、画像のどの部分に基づいてどの言葉を選ぶのか、その決定プロセスはよく分かりません。まるでマジシャンが帽子からウサギを取り出すのを見ているようなものです。結果は目に見えますが、帽子の中で行われている手品はブラックボックスです。

この論文は、その帽子を開けて手品を説明しようとするものです。以下に、彼らが行ったことをシンプルなアナロジーを用いて解説します。

1. 問題:「静止写真」対「映画」

これらのモデルを理解するための従来の方法は、ある一瞬の時点で通訳者の脳を撮影した「静止写真」のようなものでした。彼らは「スパース・オートエンコーダ(SAE)」と呼ばれるツールを用いて、特定の層においてモデルが何を考えているかを見ていました。

しかし著者らは、このアプローチには欠陥があると主張します。なぜなら、通訳者はただじっとしているのではなく、絶えず「作業」を行っているからです。視覚入力を受け取り、それを能動的にテキストへと変換しています。静止画ではその動きを見逃してしまいます。

解決策: 彼らは「トランスコーダ」と呼ばれる新しいツールを使用しました。

  • アナロジー: SAE がガレージに駐車された車の写真だとすれば、トランスコーダはエンジンが稼働している様子を映した動画です。それは単に車の部品を見るのではなく、エンジンが燃料を運動へと「変化」させる過程を観察します。それは単なる「状態」(データがどのように見えるか)ではなく、「機能」(行われている作業)に焦点を当てます。

2. 実験:「視覚的グラウンディング」の発見

研究者たちは、この新しい「エンジン動画」ツールが、モデルが画像と特定の単語をどのように結びつけているかをよりよく説明できるかどうかを確認したいと考えました。

  • テスト: 彼らはモデルに画像の説明を求めました。その後、彼らのツールを用いて、特定の単語(例えば「犬」という言葉)にとって画像のどの部分が最も重要かを推測しました。
  • 「アブレーション」(消しゴムテスト): 彼らの推測が正しいかどうかを確認するため、彼らは重要だと考えた画像の部分をデジタル消しゴムで削除(アブレーション)しました。
    • 結果: トランスコーダによって特定された部分を消去すると、モデルは非常に混乱し、「犬」という言葉を正しく書き出すのをやめました。一方、古い SAE 手法によって特定された部分を消去しても、モデルはほとんど気づきませんでした。
    • 比喩: これは、ケーキをチョコレート味にする成分が何かを推測しようとするようなものです。トランスコーダが特定した成分を取り除くと、ケーキはチョコレート味がしなくなります。一方、古い手法が特定した成分を取り除いても、ケーキは相変わらず美味しいままです。トランスコーダは「本物のチョコレート」を見つけたのです。

3. 「偽のグラウンディング」チェック

トランスコーダが単にランダムに推測していたり、混乱していたりしないことを確認するため、彼らは「偽の視覚的グラウンディング」と呼ばれるトリックテストを行いました。

  • 設定: 彼らはモデルに数学の問題(「20 + 30 は何か?」など)や一般教養の問題(「フランスの首都は何か?」など)を出しましたが、同時に猫のランダムな画像を見せました。答えは猫とは何の関係もありません。
  • 結果: トランスコーダは猫の画像を正しく無視しました。猫と答えを結びつけようとしませんでした。一方、古い手法は、存在しない結びつきを無理やり作ろうとすることがありました。
  • 教訓: トランスコーダは、画像が単なる気晴らしであり、答えとは無関係であることを認識するほど賢明です。

4. 「ハルシネーション」探偵

最後に、研究者たちはモデルが「ハルシネーション」を起こす時、つまり画像に存在しない事実を自信を持って作り出す時を調査しました。

  • 調査: 彼らはモデルの内部思考プロセスを「道路地図」や「回路基板」のように扱いました。そして、情報画像から最終的な単語へと至る経路を追跡しました。
  • 発見: 彼らは、モデルが真実を語るときと嘘(ハルシネーション)をつくときでは、「道路地図」の姿が異なることを発見しました。
    • 違い: ハルシネーションは、より短く、より混雑し、より集中した経路を通っているように見えました。真実は多くのランドマークをチェックする長い風景豊かなルートを取るのに対し、嘘は周囲を無視してトンネルを通る近道を取るようなものです。
  • 予測: 彼らは、これらの道路地図の形状だけを眺める単純な「嘘発見器」(ロジスティック分類器)を構築しました。テキストを読んだり画像を見たりすることなく、この検出器はモデルがハルシネーションを起こしているかどうかを約 68% の精度で推測できました(これはランダムな推測よりも著しく優れています)。

まとめ

要約すると、この論文は次のように述べています:

  1. 静止画を見るのをやめ、映画を見よう。 モデルが情報を「保持」しているものを見るのではなく、「処理」する様子を見るために「トランスコーダ」を使用する方が優れています。
  2. 正しい結びつきを見つける。 この手法は、書き出される言葉にとって実際に重要な画像のどの部分を特定するかを正しく行います。
  3. 嘘には異なる形状がある。 出力を読まなくても、答えを計算する内部の「配線」の形状を見るだけで、モデルが嘘をついているかどうかを判断できます。

著者らは、この「機能中心」のアプローチが、これらの AI モデルが実際にどのように機能しているかを、より明確で信頼性の高い地図として提供すると結論付けています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →