← 最新の論文
💻 computer science

What Color Is the Text? A Benchmark for Hallucination Induced by Image-Embedded Prompt

本論文は、「Embedded Stroop」ベンチマークおよび「What-Color-Is-the-Text」(WCIT)データセットを導入することで、マルチモーダル大規模言語モデルが、画像内に埋め込まれたテキストの視覚的な色ではなく、そのテキストの意味内容に基づいて誤った回答をしてしまう「ストループ・ハルシネーション(Stroop hallucinations)」に頻繁に陥ることを示し、意味的な判読性が視覚的な色の知覚を上書きしてしまう現象を明らかにしている。

原著者: Jinkun Zhao, Lei Huang, Haixin Ge, Wenjun Wu

公開日 2026-08-24
📖 1 分で読めます☕ さくっと読める

原著者: Jinkun Zhao, Lei Huang, Haixin Ge, Wenjun Wu

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

人工知能の世界には、マルチモーダル大規模言語モデルとして知られる、増えつつある一連のシステムが存在します。これらは画像を見ることができ、テキストを読むことができ、その2つの感覚を組み合わせて世界についての質問に答えることができるデジタルな精神です。これらは写真の内容を説明したり、画像に基づいたパズルを解いたりすることにおいて、驚くほど優れた能力を発揮するようになりました。しかし、人間と同様に、これらのシステムも混乱から免れているわけではありません。彼らは、見たもの、より正確には、見たものの「解釈の仕方」によって騙されてしまうことがあります。この混乱の古典的な例は、「ストループ効果」と呼ばれる有名な心理学テストから来ています。このテストでは、例えば「RED(赤)」という単語が青いインクで印刷されている様子を人に示されます。インクの色を答えるよう求められたとき、人間の脳は、青い色に集中する前に自動的に「RED」という単語を読んでしまうため、しばしばつまずいてしまいます。脳は、単語の意味を無視して、視覚的な色だけに集中するために、懸命に働かなければなりません。長年、科学者たちは、これらの高度なコンピュータモデルが、画像を見たときに同様の種類の精神的なミス(グリッチ)に苦しむのではないかと考えてきました。

中国の北華理工大学の研究チームは、機械のために特別に設計された新しい実験を用いて、この疑問を検証することにしました。彼らは「What Color Is the Text(テキストの色は何色か)」というベンチマークを作成しました。これは、コンピュータに対して単純かつ欺瞞的な画像を提示するものです。質問を別のテキストボックスで行うのではなく、質問自体を画像の中に直接書き込みました。例えば、黒いインクで「What color is the text?(テキストの色は何色ですか?)」と書かれた白い正方形を想像してください。その同じ画像の中に、別の単語、例えば「BLUE(青)」という言葉がありますが、この単語は赤いインクで印刷されています。コンピュータは、「BLUE」という単語に使われているインクの色を特定するように求められます。ここでの課題は、コンピュータが「BLUE」という単語の意味を無視して、インクは実際には「赤」であると報告しなければならない点です。この設定により、マシンは、テキストが言っていることと、目が目にしていることのどちらかを選択することを強制されます。

研究者が、オープンソースのプロジェクトから強力な商用システムに至るまで、16種類の異なる人工知能モデルに対してこのテストを実施したところ、結果は衝撃的なものでした。機械は成功するよりも失敗する回数の方がはるかに多かったのです。実際、質問が画像の中に埋め込まれている場合、モデルは頻繁に実際のインクの色を無視し、単にテキストの中に書かれている色で答えてしまいました。例えば、もし「GREEN(緑)」という単語が紫色のインクで書かれていた場合、モデルは自信を持って「緑」と答えてしまいました。これは、質問が画像内のテキストではなく、別のテキストボックスで行われた場合には、モデルが正しく色を識別できていたにもかかわらず起こりました。研究によれば、機械が視覚的な現実よりも単語の意味に気を取られてしまうという、この特定の種類のエラーは、試行の大部分において発生しました。いくつかのケースでは、モデルによるエラーの半分以上が、テキストを色よりも優先してしまうという、この特定の混乱によるものでした。

研究者たちは、これが単にモデルが一般的な色の命名に不向きであるケースではないことを確認したいと考えました。これを確認するために、彼らは、質問が別途行われた場合にはモデルが正しく色を命名することに成功していた画像グループを調査しました。モデルが色の名前を知っていたとしても、質問が画像に埋め込まれていると、彼らは罠に陥りました。これは、問題が語彙の不足や単純な色の識別能力の欠如ではなく、テキストを読む能力が視覚的な詳細を見る能力を圧倒してしまうという、より深い問題であることを証明しました。また、研究では、テキストを読み取りにくくした場合に何が起こるかもテストしました。画像を上下逆さまにしたり、単語の一部を黒いブロックで覆ったりすると、モデルのミスは減少しました。このことは、混乱の原因が、単語の意味を明確に読み取るというマシンの能力にあることを示唆しています。テキストが乱されたり隠されたりすると、マシンは視覚的な色に依存するようになり、そのパフォーマンスは向上します。

これらの発見にもかかわらず、研究者たちは、単にマシンに注意を払うよう指示するだけでは、この問題は簡単に解決できないと指摘しました。彼らはモデルに対して、仕掛けについて警告する特別な指示を与えてみましたが、それによってモデルがテキストに騙される回数は減少したものの、実際に正しい色を見る能力が大幅に向上したわけではありませんでした。モデルは単に、別の種類のミスをし始めただけでした。研究は、現在の人工知能システムには根本的な弱点がある、と結論付けています。すなわち、視覚情報とテキストが衝突する場合、テキストが勝ってしまうということです。これは、これらのモデルが人間と同じように世界を「見ている」のではなく、学習した言語のパターンに強く影響されていることを示唆しています。これらのシステムが、道路標識を読んだり、複雑な環境の中で物体を識別したりといった実世界の状況に導入される際、視覚よりもテキストを信頼するというこの傾向は、信頼性の低い決定につながる可能性があります。この研究は、これらのマシンが真に堅牢になるためには、一方の感覚が他方を完全に支配してしまうのではなく、読んだことと見たことのバランスを取る方法を学ぶ必要があるという、明確な警告として機能しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →