← 最新の論文
🧬 biology

The Illusion-Illusion: Vision Language Models See Illusions Where There Are None

この論文は、現在の視覚言語モデルが「錯覚の錯覚」に陥っており、非錯覚の画像(実際に曲がった線や大きさの異なる円など)を錯覚であると誤って認識しており、それによって視覚的推論における根本的な処理エラーを露呈していることを明らかにしている。

原著者: Tomer Ullman

公開日 2026-07-21
📖 1 分で読めます☕ さくっと読める

原著者: Tomer Ullman

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 ⚕️ これは査読を受けていないプレプリントのAI生成解説です。医学的助言ではありません。この内容に基づいて健康上の判断をしないでください。 免責事項の全文を読む

テクニカル・サマリー:イリュージョン・イリュージョン(錯覚の錯覚):視覚言語モデルは存在しない錯覚を見ている

問題提起
知覚的な錯覚(イリュージョン)は、現実と外見の間のギャップを明らかにし、それによって根底にある精神的処理メカニズムを解明する認知科学の診断ツールとして機能する。これまでの研究では、人工システムが人間と同じ古典的な錯覚に陥るかどうかを調査してきたが、本論文は、古典的な錯覚をテストすることは現在の視覚言語モデル(VLM)を診断するには不十分であると論じている。著者は、より示唆に富む診断ツールは「イリュージョン・イリュージョン(錯覚の錯覚)」、すなわち、錯覚的な視覚的特徴を備えているものの、実際の知覚的な仕掛け(トリック)を欠いている画像であると主張している。これらのケースでは、視覚的な現実は外見と一致している(例:線が実際に異なる長さである、アヒルが純粋にアヒルであるなど)。しかし、それらは有名な錯覚の隣人(近縁の存在)でもある。核心となる問題は、現在のVLMが、これらの「イリュージョン・イリュージョン」を錯覚として誤認し、それによって、真の知覚的な異常と単純な視覚的事実を区別できないという失敗を露呈しているかどうかである。

手法
本研究では、多様な知覚現象(例:ミュラー・リヤー錯視、エビングハウス錯視、カニッツァの三角形、チェッカーシャドウ)をカバーする10種類の代表的な視覚的錯覚を用いた比較評価フレームワークを採用した。各古典的錯覚に対して、著者は3種類の刺激を作成した:

  1. 錯覚(The Illusion): 知覚的なエラーを引き起こすように設計された元の画像。
  2. イリュージョン・イリュージョン(The Illusion-Illusion): 「仕掛け」が取り除かれ、視覚的特性が文字通りであるように修正されたバージョン(例:線の長さが実際に異なる矢印、純粋なアキルの画像)。
  3. コントロール(The Control): 基本的な能力を確認するために設計された簡略化されたバージョン(例:単一の三角形の識別)。

評価では、8つの現在のVLM(GPT-4o、Claude 3、Gemini Pro Vision、miniGPT、Qwen-VL、InstructBLIP、BLIP2、LLaVA-1.5)をテストした。モデルには画像と、錯覚の対象をターゲットにした特定のプロンプト(例:「青い線と赤い線のどちらが長いですか?」)が提示された。二次的な条件として、プロンプトの前に「次の視覚的錯覚において(In the following visual illusion)」というフレーズを付加し、コンテキストの影響をテストした。

パフォーマンスは、人間のような反応との一致に基づき、バイナリ(0または1)でスコア化された。古典的な錯覚の場合、スコア1は錯覚的な知覚を報告するか、あるいは錯覚を認めることを示した。イリュージョン・イリュージョンおよびコントロールの場合、スコア1は人間がするように文字通りの真実を報告することを示した。著者は、このスコアリングはモデルの性能を過大評価する傾向にある、寛容なものであると注記している。

主な結果
結果は、人間の知覚と現在のVLMの能力との間の著しい乖離を示している:

  • イリュージョン・イリュージョンにおける失敗: GPT-4o、Claude 3、Gemini Proといった主要なモデルは、古典的な錯覚を認識または報告することには成功するが、イリュージョン・イリュージョンを錯覚として誤分類することが頻繁にある。例えば、線が実際に異なる長さである場合、これらのモデルはしばしば、それらが同じ長さである(錯覚を模倣する)と主張したり、それらが錯覚であると説明したりする。
  • 文脈による脆弱性: プロンプトが画像を「視覚的錯覚」として明示的にラベル付けした場合、トップ3のモデルのパフォーマンスは、イリュージョン・イリュージョンおよびコントロールにおいて著しく低下した。彼らは圧倒的に、これらの非錯覚的な画像を錯覚として報告しており、これは彼らの応答が視覚的な証拠よりもテキストのプロンプトに強くバイアスされていることを示唆している。
  • コントロールの失敗: コントロールが能力の基準として機能するという仮説に反して、GPT-4o、Gemini Pro、Claude 3などのモデルは、単純なコントロール画像(例:単一の三角形)を錯覚として報告することが頻繁にあった。これは、これらのモデルにとって「錯覚」という概念が、特定の知覚的な判断ではなく、単に錯覚の「カテゴリー」に似た画像に対して広く適用されていることを示唆している。
  • モデルの挙動: トップモデルの挙動は、仮説的な「モデルB」(錯覚は認識するがイリュージョン・イリュージョンは認識しないモデル)とは一致しない。代わりに、彼らは「フラット」なパフォーマンス、あるいは錯覚が存在しない場所に錯覚を幻覚(ハルシネーション)させる傾向に近いパターンを示しており、特に「錯覚」という言葉によってプライミングされた場合に顕著であった。

主な貢献
本論文は、人工システムのための新しい診断ツールとして「イリュージョン・イリュージョン」という概念を導入している。著者は、標準的な錯覚の使用法を逆転させることで、現在のVLMが特定の失敗モードに苦しんでいることを示している。すなわち、彼らは錯覚の「パターン」を、それが錯覚を必要としない画像に対しても適用してしまうのである。この研究は、錯覚の認識能力が、単なる視覚的データの処理ではなく、視覚的特徴を訓練コーパス内の「錯覚」という概念に関連付ける低レベルの類似性マッチングに依存していることを示しており、これがより深い処理エラーの指標であることを明らかにしている。

意義と主張
著者は、これらの失敗は単なる癖ではなく、現在のVLMにおけるより広範な処理エラーの指標であると主張している。論文は、モデルがイリュージョン・イリュージョンで失敗する場合、それはシステムが「通常の」入力を熟考して認識していないことを意味すると示唆している。代わりに、モデルは訓練データとの低レベルの類似性マッチングに依存しており、画像の視覚的特徴を、人間の生物学的な知覚失敗を模倣するのではなく、訓練コーパスに見られる「錯覚」という概念に関連付けている可能性が高い。

本研究の意義は、モデルが錯覚を特定できる能力が、人間のような知覚的理解を備えているという仮定に異議を唱える点にある。著者は、錯覚に騙されることは人間の特性であるが、「イリュージョン・イリュージョン」(トリックが存在しない場合)に騙されることは、視覚データそのものではなく、錯覚という「概念」に騙されているシステムの兆候であると論じている。結論として、これらの失敗は、現在のシステムが、問題の「外見」と入力の「実態」を区別する堅牢性をまだ備えていないことを示唆しており、この限界は視覚を超えて他のモダリティや領域にも及ぶものである。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →