← 最新の論文
💬 NLP

When Irrelevant Text Matters: Affine Margin Shifts in Multimodal Large Language Models

本論文は、マルチモーダル大規模言語モデルにおけるタスクに無関係なテキストが、決定マージンに予測可能なアフィン変換を誘発することによって二値的な視覚的判断を系統的に偏らせることを明らかにしており、この影響を、非構造的なノイズではなく推定可能な幾何学的歪みとして特徴付けている。

原著者: Yinfeng Wang, Zhiyuan Yao, Zheren Fu, Lei Zhang, Zhendong Mao

公開日 2026-08-21
📖 1 分で読めます☕ さくっと読める

原著者: Yinfeng Wang, Zhiyuan Yao, Zheren Fu, Lei Zhang, Zhendong Mao

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

現代の人工知能の展望において、視覚と聴覚を同時に扱うことができる新世代のシステムが登場しました。これらのマルチモーダルモデルは、画像を見てそれに関する質問に答えたり、場面を詳細に描写したりするように訓練されています。これらは、物体の特定、画像内のテキストの読み取り、複雑な状況の推論が可能な強力なツールです。しかし、これらのシステムは真空状態で動作しているわけではありません。現実世界のアプリケーションでは、画像とともに追加の情報、例えばユーザーの過去のメッセージ、検索された記事、あるいはデータベースのエントリなどが入力されることがよくあります。この追加のテキストは、モデルが画像をより良く理解するのを助けるためのものです。しかし、その追加テキストが画像とは全く関係のないものだった場合、一体何が起こるのでしょうか?モデルはノイズを無視するのでしょうか、それとも混乱してしまうのでしょうか?この問いは、視覚的な場面と無関係な言葉の間で注意が分散されているときに、これらの知的なシステムがいかに情報を処理するかという最近の調査の中核に位置しています。

研究者たちは、制御された実験を用いて、まさにこのシナリオをテストすることに乗り出しました。彼らは、写真の中の犬がハードルを飛び越えているかどうかを問うような、一連の画像と質問を用意しました。次に、各質問に対して2つのバージョンの入力を作成しました。最初のバージョンでは、モデルには画像と質問のみが見えます。2番目のバージョンでは、同じ画像と質問に加え、プロンプトの中に全く無関係なテキストのブロックが挿入されました。このテキストは、本や記事から抜き出されたランダムな文章であり、例えばフランスへ旅行する人物についての物語のような、犬やハードルとは何のつながりもないものでした。研究者たちは、このランダムなノイズがモデルの考えを変えてしまうかどうかを確認したいと考えました。

結果は驚くべきものでした。無関係なテキストが追加されたとき、モデルは単にそれを無視するだけではありませんでした。むしろ、彼らは一貫して回答を変更したのです。さらに重要なことに、彼らはランダムな方法で考えを変えたわけではありませんでした。モデルは、「はい」の状況が画像に明確に示されている場合でも、「いいえ」と答える傾向が著しく高まったのです。例えば、モデルが犬がジャンプしていることに確信を持っていたとしても、無関係なテキストが加わることで、しばしば躊躇が生じ、答えを反転させて「犬はジャンプしていない」と答えてしまうことがありました。この変化は、異なる種類の画像や異なるモデルにわたって発生しており、これはランダムな不具合ではなく、系統的な欠陥であることを示唆しています。モデルは単に精度がわずかに低下したのではなく、自分が目にしている視覚的証拠を疑ってしまうという、特定のタイプの誤りへと押しやられていたのです。

なぜこのようなことが起こるのかを理解するために、研究者たちは単なる最終的な回答よりもさらに深く調査しました。彼らは、モデルが決定を下す前に生成する内部的な信頼度スコアを検証しました。その結果、モデルの情報処理における非常に具体的なパターンが見つかりました。モデルが画像単体を見たとき、彼らは回答に対して一定の信頼度を持っていました。しかし、無関係なテキストが追加されると、その信頼度は消失したり混沌としたりするのではなく、予測可能な数学的な方法で変化したのです。新しい信頼度レベルは、元の信頼度の歪んだバージョンであり、圧縮され、特定の方向へと押しやられていました。それはまるで、余分なテキストがフィルターとして機能し、モデルの確信度を絞り込み、視覚的証拠に対してスケールを傾けてしまったかのようでした。

この発見により、モデルが単に余計な言葉に混乱しているだけ、あるいはテキストがランダムな静止ノイズとして作用しているだけであるという考えは否定されました。もしそれがランダムなノイズであれば、エラーは散発的で予測不能なものになったはずです。しかし、エラーは厳格なルールに従っていました。研究者たちは、このルールを「一貫したシフト(移動)」であると説明しました。つまり、テキストの存在によってモデルの内部判断が引き伸ばされ、移動させられるというものです。彼らは、このシフトを測定し、さらには予測できることさえ発見しました。このシフトのパターンを理解することで、彼らは、無関係なテキストによって引き起こされるダメージを部分的に取り消し、モデルが画像で見ているものを信頼する能力を回復させる、シンプルな補正手法を作り出すことができました。

また、この研究は、テキストがどのように提示されるかも重要であることを明らかにしました。無関係なテキストが、あたかも画像に関連しているかのように枠付けされている場合、歪みはさらに強まりました。モデルは、ランダムな言葉を「手がかり」として扱い、それらを画像の理解に適合させようとしているようで、それがさらなる混乱を招きました。このことは、モデルが単なる受動的な情報の受け手ではなく、与えられたすべての情報を理解しようと能動的に動いていることを示唆しています。彼らは、視覚的なタスクにとって関連のある情報と、単なる背景ノイズとの区別をつけることに苦慮しているのです。

これらの知見は、人工知能がどのように情報を扱うかという点について、新たな視点を提供しています。余分なテキストを加えることは、単に音量を上げるだけでなく、モデルの思考の形そのものを変えてしまうことが分かりました。モデルは与えられたコンテキストに対して敏感であり、その敏感さが、自分自身の目を疑わせる結果を招くことがあります。研究者たちは、この効果を測定し、部分的に修正できることを示しましたが、根本的な問題は依然として残っています。すなわち、これらのシステムは、無関係なものを無視できるほど堅牢ではないということです。これらの技術が、絶えずデータのストリームを受け取り続ける、より複雑な現実世界のシステムに統合されていく中で、ノイズに対してどのように反応するかを理解することは極めて重要です。この研究は、こうしたバイアスを特定するための明確な診断ツールを提供するとともに、周囲の世界がどれほど注意をそらすものであっても、画像に集中できるシステムを構築するための基礎となるものです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →