✨ 要約🔬 技術概要
人工知能の世界には、マルチモーダル大規模言語モデルとして知られる、増えつつある一連のシステムが存在します。これらは画像を見ることができ、テキストを読むことができ、その2つの感覚を組み合わせて世界についての質問に答えることができるデジタルな精神です。これらは写真の内容を説明したり、画像に基づいたパズルを解いたりすることにおいて、驚くほど優れた能力を発揮するようになりました。しかし、人間と同様に、これらのシステムも混乱から免れているわけではありません。彼らは、見たもの、より正確には、見たものの「解釈の仕方」によって騙されてしまうことがあります。この混乱の古典的な例は、「ストループ効果」と呼ばれる有名な心理学テストから来ています。このテストでは、例えば「RED(赤)」という単語が青いインクで印刷されている様子を人に示されます。インクの色を答えるよう求められたとき、人間の脳は、青い色に集中する前に自動的に「RED」という単語を読んでしまうため、しばしばつまずいてしまいます。脳は、単語の意味を無視して、視覚的な色だけに集中するために、懸命に働かなければなりません。長年、科学者たちは、これらの高度なコンピュータモデルが、画像を見たときに同様の種類の精神的なミス(グリッチ)に苦しむのではないかと考えてきました。
中国の北華理工大学の研究チームは、機械のために特別に設計された新しい実験を用いて、この疑問を検証することにしました。彼らは「What Color Is the Text(テキストの色は何色か)」というベンチマークを作成しました。これは、コンピュータに対して単純かつ欺瞞的な画像を提示するものです。質問を別のテキストボックスで行うのではなく、質問自体を画像の中に直接書き込みました。例えば、黒いインクで「What color is the text?(テキストの色は何色ですか?)」と書かれた白い正方形を想像してください。その同じ画像の中に、別の単語、例えば「BLUE(青)」という言葉がありますが、この単語は赤いインクで印刷されています。コンピュータは、「BLUE」という単語に使われているインクの色を特定するように求められます。ここでの課題は、コンピュータが「BLUE」という単語の意味を無視して、インクは実際には「赤」であると報告しなければならない点です。この設定により、マシンは、テキストが言っていることと、目が目にしていることのどちらかを選択することを強制されます。
研究者が、オープンソースのプロジェクトから強力な商用システムに至るまで、16種類の異なる人工知能モデルに対してこのテストを実施したところ、結果は衝撃的なものでした。機械は成功するよりも失敗する回数の方がはるかに多かったのです。実際、質問が画像の中に埋め込まれている場合、モデルは頻繁に実際のインクの色を無視し、単にテキストの中に書かれている色で答えてしまいました。例えば、もし「GREEN(緑)」という単語が紫色のインクで書かれていた場合、モデルは自信を持って「緑」と答えてしまいました。これは、質問が画像内のテキストではなく、別のテキストボックスで行われた場合には、モデルが正しく色を識別できていたにもかかわらず起こりました。研究によれば、機械が視覚的な現実よりも単語の意味に気を取られてしまうという、この特定の種類のエラーは、試行の大部分において発生しました。いくつかのケースでは、モデルによるエラーの半分以上が、テキストを色よりも優先してしまうという、この特定の混乱によるものでした。
研究者たちは、これが単にモデルが一般的な色の命名に不向きであるケースではないことを確認したいと考えました。これを確認するために、彼らは、質問が別途行われた場合にはモデルが正しく色を命名することに成功していた画像グループを調査しました。モデルが色の名前を知っていたとしても、質問が画像に埋め込まれていると、彼らは罠に陥りました。これは、問題が語彙の不足や単純な色の識別能力の欠如ではなく、テキストを読む能力が視覚的な詳細を見る能力を圧倒してしまうという、より深い問題であることを証明しました。また、研究では、テキストを読み取りにくくした場合に何が起こるかもテストしました。画像を上下逆さまにしたり、単語の一部を黒いブロックで覆ったりすると、モデルのミスは減少しました。このことは、混乱の原因が、単語の意味を明確に読み取るというマシンの能力にあることを示唆しています。テキストが乱されたり隠されたりすると、マシンは視覚的な色に依存するようになり、そのパフォーマンスは向上します。
これらの発見にもかかわらず、研究者たちは、単にマシンに注意を払うよう指示するだけでは、この問題は簡単に解決できないと指摘しました。彼らはモデルに対して、仕掛けについて警告する特別な指示を与えてみましたが、それによってモデルがテキストに騙される回数は減少したものの、実際に正しい色を見る能力が大幅に向上したわけではありませんでした。モデルは単に、別の種類のミスをし始めただけでした。研究は、現在の人工知能システムには根本的な弱点がある、と結論付けています。すなわち、視覚情報とテキストが衝突する場合、テキストが勝ってしまうということです。これは、これらのモデルが人間と同じように世界を「見ている」のではなく、学習した言語のパターンに強く影響されていることを示唆しています。これらのシステムが、道路標識を読んだり、複雑な環境の中で物体を識別したりといった実世界の状況に導入される際、視覚よりもテキストを信頼するというこの傾向は、信頼性の低い決定につながる可能性があります。この研究は、これらのマシンが真に堅牢になるためには、一方の感覚が他方を完全に支配してしまうのではなく、読んだことと見たことのバランスを取る方法を学ぶ必要があるという、明確な警告として機能しています。
テクニカル・サマリー:テキストの色は何色か? 画像埋め込みプロンプトによって誘発されるハルシネーションのベンチマーク
1. 問題定義
マルチモーダル大規模言語モデル(MLLM)は、視覚的知覚と言語的推論を整合させる上で顕著な能力を示している。しかし、その信頼性は、出力が視覚的な現実から逸脱するハルシネーションによって頻繁に損なわれる。既存の研究は主に、これらの失敗をクロスモーダルな不整合 (外部のテキストプロンプトと視覚的内容との間の衝突)に帰しているが、本論文はより潜在的な課題であるイントラモーダル(単一様式内)のセマンティック干渉 を特定している。
対処すべき核心的な問題は、「埋め込まれたストループ(Embedded Stroop)」効果である。すなわち、クエリ自体が視覚入力の中に直接レンダリングされている場合に何が起こるのか、という問題である。この統一された様式において、意味的内容(クエリのテキスト)と視覚的属性(インクの色)はピクセル空間内に共存する。本論文は、現在のMLLMが、実際の視覚的な色を知覚することよりも、埋め込まれたテキストの意味的内容を読み取ることを優先してしまう可能性があり、その結果、標準的な分離型評価プロトコルでは露呈できない系統的なハルシネーションを引き起こすと仮説を立てている。
2. 手法:WCITベンチマーク
この干渉を分離・測定するために、著者らはWhat-Color-Is-the-Text (WCIT) ベンチマークを導入する。
データセットの構築
カラーパレット: 特殊なリポジトリから厳選された59種類の微細な色が選定された。
フィルタリング: 知覚的な識別性を確保するため、Δ E 00 \Delta E_{00} Δ E 00 (CIEDE2000) に基づくパイプラインを用いて、低コントラストの色、黒に近い色調、および複合的な名称を除外した。
刺激生成: サンプルは白背景で構成され、以下の3つの要素を含む:
埋め込まれたクエリ: 「What color is the text?(テキストの色は何色ですか?)」という指示が黒色でレンダリングされている。
ターゲット刺激: 色を表す単語(例:「RED」)が、矛盾する物理的な色(例:青色のインク)でレンダリングされている。
バリアント(変種): 本ベンチマークには、効果の堅牢性をテストするために、以下の3つの主要な条件が含まれている:
標準ストループ (コントロール): クエリはテキストプロンプトとして提供され、画像には矛盾する刺激のみが含まれる。
埋め込まれたストループ (プライマリ): クエリが刺激と共に画像内に視覚的に埋め込まれている。
敵対的バリアント: セマンティックな判読性を妨げることでハルシネーションが軽減されるかをテストするため、反転 (テキストを空間的に反転させたもの)およびマスク (テキストを遮蔽したもの)のバージョンを含む。
コントロールグループ: 視覚的認識とセマンティック干渉を分離するため、矛盾する色の単語を意味的に中立な語彙に置き換えたもの。
評価フレームワーク
著者らは、一般的な知覚の失敗と、特定のセマンティック・キャプチャ(意味による捕捉)を区別するために、3方向の誤差分解 を提案している:
正確度 (Acc): 視覚的な色を正しく特定している。
ストループ・ハルシネーション率 (SHR): 視覚的な色ではなく、セマンティックなテキストの色(単語の意味)を誤って回答している。
その他のエラー率 (OER): 視覚的なターゲットでもセマンティックなターゲットでもない色を予測している(一般的な命名の失敗)。
さらに、ランダムな推測とストループ・ハルシネーションを区別するために、誤答のうち、具体的にストループ・ハルシネーションである割合を測定するストループ干渉比 (SIR) を導入している。
実験設定
モデル: プロプライエタリなシステム(例:GPT-5, GPT-4o, Gemini 2.5/3)およびオープンソースのアーキテクチャ(例:Qwen3-VL, InternVL, DeepSeek-VL, Gemma-3)を含む16のMLLMを評価した。
指標: 評価には、置換テスト(5,000回のシャッフル)と、モデルが標準設定において正解したサンプルに限定した条件付き分析を用いた。
3. 主な結果
評価の結果、プロプライエタリおよびオープンソースの両方のモデルにおいて、広範な脆弱性が明らかになった:
高いハルシネーション率: 埋め込まれたストループ条件下では、モデルは大幅なSHRの上昇を示す。例えば、Gemma-3-12Bは**78.5%のSHRに達し、Qianfan-VL-8Bは 83.5%**に達した。対照的に、標準ストループ設定(テキストプロンプト)ではSHRは非常に低く(多くの場合15%未満)、ハルシネーションが質問のセマンティックな内容ではなく、視覚的な埋め込みによって引き起こされていることが確認された。
セマンティック・キャプチャの支配性: 3方向の分解によれば、多くのモデルにおいて、エラーはランダムではない。SIR は、64のモデル難易度条件のうち56において、チャンス・ベースライン(1.7%)を大幅に上回っている(FDR補正後)。一部のモデル(例:Kimi-VL-A3B)では、ほぼすべてのエラー(SIR ≈ \approx ≈ 91%)がストループ・ハルシネーションであった。
条件付き分析: 標準設定においてモデルが色を正しく特定できたサンプルに限定して分析を行っても、統合された条件付きSHR は51.9% (95% CI: [35.4%, 66.8%])と高いままであった。これは、この効果が単なる色の命名能力の欠如によるものではなく、視覚的知覚と矛盾する場合にセマンティック処理を抑制できないという特定の失敗であることを裏付けている。
粗粒度な知覚: 59の微細な色を11の基本色ファミリーにマッピングした際、モデルは粗い色の知覚(精度38.4%)は維持したが、依然として相当なSHR(21.6%)を示した。これは、語彙のミスマッチを取り除いても、セマンティック・キャプチャが持続することを示している。
攪乱による緩和: セマンティックな判読性を攪乱することで、ハルシネーションは大幅に減少する。埋め込まれたテキストを反転 させたりマスク したりする(例:25%の遮蔽)と、正確度の回復とSHRの減少が顕著に見られた。これは、この効果がセマンティックなテキストの判読性に依存していることを示唆している。
4. 主な貢献
WCITベンチマーク: クエリを視覚入力に直接埋め込むことで、視覚的属性とセマンティック的内容の優先順位付けに関する、統一様式での評価を可能にする制御された診断ツール。
誤差分解フレームワーク: 置換テストと条件付き分析を通じて検証された、正しい知覚、ストループ特有のセマンティック・キャプチャ、および一般的な命名失敗を分離する新しい手法。
条件付き検証: ストループ効果が、標準設定で良好なパフォーマンスを示すモデルにおいても高い条件付きSHRを示すことから、それが単なる色の命名能力の低さによるアーティファクトではなく、真の干渉現象であることを実証した。
広範な評価: 16のモデルに対する体系的なテストにより、敵対的な摂動(反転/マスク)がハルシネーションを抑制できること、および敵対的を意識したプロンプティングがSHRを最大91%削減できること(ただし、これは主に視覚的正確さを向上させるのではなく、エラーをOERへと再分配するものである)を明らかにした。
5. 意義と主張
本論文は、現在のMLLMは、衝突が視覚的な様式内部にある場合、ストループ効果を真に克服できていないと主張している。これらの知見は、**「視覚化されたテキスト」**が視覚的知覚を上書きする超刺激として機能するという、テキストへの執着的な盲信 を示唆している。
イントラモーダルな失敗: 本研究は、ハルシネーションが主にクロスモーダルなものであるという従来の観点に異を唱えている。知覚の失敗は、厳密に視覚的な様式内の衝突から発生し得ることを示している。
安全性への影響: 埋め込まれたストループ干渉への感受性は、潜在的な安全上の懸念を浮き彫りにしている。矛盾するテキスト情報(例:誤解を招く道路標識や矛盾するラベル)を含む現実世界のシナリオにおいて、MLLMはテキストを視覚的証拠よりも優先することで、信頼できない判断を下す可能性がある。
限界: 著者らは、本ベンチマークが合成画像と英語テキストを使用していることを控えめに述べている。また、59種類の微細なカラーパレットが語彙のミスマッチを導入していることも認めているが、粗粒度な分析によってそれを緩和しようと試みている。さらに、プロンプトベースの介入によってセマンティック・キャプチャを減少させることはできるものの、根本的な視覚的知覚の課題を完全に解決するものではないことも強調している。
結論として、WCITは、視覚的属性と埋め込まれたセマンティック的内容を分離する能力におけるMLLMの根本的なギャップを明らかにする、的を絞ったストレス・テストを提供しており、より堅牢なマルチモーダル・アライメントに向けた将来の研究を促している。
毎週最高の computer science 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。 登録 ×