← 最新の論文
💻 computer science

Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models

本論文は、マルチモーダル大規模言語モデルが粗粒度な視覚的証拠を正常にエンコードする一方で、それへの依存度と言語的事前知識との間の制御を信頼性高く行うことには苦慮していることを明らかにしており、この限界は教師あり微調整および活性化ステアリングを通じて軽減が可能である。

原著者: Jiaang Li, Chengzu Li, Zhaochong An, Yifei Yuan, Xi Liu, Serge Belongie, Vésteinn Snæbjarnarson

公開日 2026-07-30
📖 1 分で読めます☕ さくっと読める

原著者: Jiaang Li, Chengzu Li, Zhaochong An, Yifei Yuan, Xi Liu, Serge Belongie, Vésteinn Snæbjarnarson

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、ほぼすべての本を読み、何百万時間もの映画を観てきた、超知能を持つロボットと話していると想像してください。このロボットは「マルチモーダル大規模言語モデル(MLLM)」です。それは、自身の学習データ、つまり「事前知識」から世界のあらゆる事を知っている天才的な司書のような存在です。しかし、このロボットには「目」もあります。画像を見ることができ、見たものと自分が知っていることを組み合わせることができます。科学者たちがずっと問い続けてきた大きな疑問は、もしロボットが自分の知識と矛盾する画像(例えば、足が5本ある馬の画像)を見たとき、それは「足が5本あることを見ることができない」から失敗するのか、それとも「足があることは見えているが、それを無視することに決めている」から失敗するのか、という点です。この論文は、この謎を解明するために、ロボットの脳を探偵小説のように扱い、どこで破綻が起きているのか(「感覚(視覚)」によるものか、それとも「意思決定(見たものの活用)」によるものか)を突き止めようとしています。

Jiaang Li氏率いる研究チームは、巧妙な二部構成の調査を用いて、このパズルを解こうと試みました。まず、ロボットが実際に画像の中の「奇妙なもの」を「見ている」のかどうかを知りたいと考えました。これをテストするために、彼らは単にロボットに質問をするだけでなく、ロボットの内部的な脳信号から画像を再構築しようと試みました。その結果、たとえロボットが間違った答えを出したとしても、奇妙な画像(足が5本ある馬など)の「設計図」は、その最終的な思考の中に明確に残っていることが分かりました。それはまるで、ロボットの目は完璧に機能しているのに、脳が目を閉じることを選択しているかのようでした。これにより、ロボットが単に細部に対して盲目であるという説は否定されました。

次に、チームは「WhatIfVis」という新しいゲームを作成し、ロボットが「目」を信じるか「記憶」を信じるかを、どの程度切り替えられるかをテストしました。彼らは、自然界のルールを破る画像(例えば、赤いスイカ)をロボットに見せ、「画像だけを見ること」と「画像を無視して知っていることを使うこと」の2通りの方法で質問に答えるよう求めました。その結果、追加のトレーニングなしでは、ロボットの気分は不安定であることが分かりました。ある時は、画像を無視して教科書通りの答え(例:スイカが赤くても、緑色であると言う)を出しました。またある時は、画像に囚われすぎて、それを無視せよという指示に従うことができませんでした。ロボットが壊れているわけではなく、単にいつ見て、いつ考えるかを決めるための信頼できる「スイッチ」を持っていないだけだったのです。

しかし、朗報は、研究者たちがそのスイッチを見つけたことです。たった一種のトリッキーな画像を使って、ロボットに少し練習(教師あり微調整と呼ばれます)をさせることで、ロボットは注意力を制御する方法を学びました。さらに優れたことに、彼らはロボットの脳内にある特定の「つまみ」、つまり単一の数学的な方向を見つけ出しました。これは、言葉による指示を必要とせずに、ロボットのフォーカスをオンにしたりオフにしたりできるものです。このつまみを回すと、ロボットは、画像を見ること、あるいは画像を無視すること、どちらのルールに従う場合でも、はるかに上手に行動できるようになりました。

この研究では、ロボットが画像と文章をどのように扱うかの比較も行われました。ルールを破る文章に従わせることは、画像に従わせるよりもはるかに簡単であることが分かりました。それは、ロボットは見るよりも聞く方が得意であると言えます。この差は、ロボットがより賢く、より大規模になるにつれて拡大しており、これはモデルが成長するにつれて、見たものを無視することに対してより頑固になる可能性を示唆しています。

結局のところ、この論文は、私たちが研究するような大きく明白な事柄(色、大きさ、動物の足の数など)について、これらのAIモデルは「見ることができない」ために失敗しているのではないと示唆しています。彼らは、いつ目を信じ、いつ記憶を信じるかを決定する一貫した方法を学んでいないために失敗しているのです。しかし、研究者たちがこの振る舞いを制御する特定の「つまみ」を見つけたということは、将来的にこれを修正できる可能性があることを意味しています。つまり、世界が教科書通りではないときでも、デジタルな脳がより柔軟で信頼できるものになるよう教えることができるのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →