あなたの脳が超高度な劇場であると想像してみてください。あなたが写真を見るたびに、後方の座席にある特定のスポットライトが点灯し、ステージ上の俳優たちを照らし出します。科学者たちは長い間、何がそのスポットライトを点灯させるのか、その正確な引き金を探求してきました。長年、彼らはその答えは「ピクセル」、つまり色や形、エッジといった生の視覚的詳細にあると考えてきました。彼らは、私たちの脳がこれらの視覚的な手がかりをどのように処理するかを模倣しようとする、デジタルな目の役割を果たすコンピュータプログラムを作り上げました。しかし最近、事態を一変させる奇妙な発見がありました。なんと、写真を言葉で説明するだけで、その言葉が写真そのものとほぼ同等に脳の反応を予測できることが分かったのです!これは、「意味」というものが、私たちの脳にとって画像そのものと同じくらい重要であることを示唆しています。しかし、ここで大きな疑問が生じます。その説明を「どのように」書くかが重要なのでしょうか?短くぶつ切りな文章でも、長く流れるような物語と同じくらい優れているのでしょうか?そして、人間が書いたのか、それともロボットが書いたのかによっても変わるのでしょうか?
この論文は、その謎に深く切り込みます。研究者たちは探偵のように振る舞い、人間の脳活動と最もよく一致する記述の「レシピ」を見つけるために、さまざまな記述方法をテストしました。彼らは多くの自然な風景を取り上げ、5つの異なるAIロボット(ビジョン・ランゲージ・モデルと呼ばれます)にそれらの説明を書かせました。これらのロボットには異なる個性がありました。あるものは短く単純な文章を書き、あるものは長く詳細な段落を書きました。また、彼らは本物の人間が書いた記述についてもテストを行いました。その後、これらすべての記述を5つの異なる「翻訳機」コンピュータ(言語モデル)に投入し、言葉を数学的なコードへと変換しました。最後に、それらのコードを、実際に写真を見た人々の脳スキャン結果と比較しました。
結果は、ちょっとしたどんでん返しでした。第一に、ロボットが書いた記述は、人間が書いたものよりも、脳の活動を予測する上でしばしば「優れて」いました。人間による記述は少し短すぎ、かつ少し「ノイズが多い」(ラジオの静電気のような状態)のに対し、ロボットはより滑らかで流暢な文章を書いていたのです。第二に、「翻訳機」となるコンピュータの種類が極めて重要でした。最も優れた結果が得られたのは、単に次の単語を予測するのではなく、文全体の「意味」を理解するために特別に設計された種類の翻訳機でした。これらの「意味に焦点を当てた」翻訳機は、私たちの脳が視覚情報を整理する方法と完璧に一致するコードを作成しました。
研究者たちは、この「魔法」がどこで起きているのかを、これらの「翻訳機」コンピュータの内部まで調べてみました。その結果、最も脳と一致するコードは、コンピュータの処理の最初の方でも最後の方でもなく、コンピュータが文の文法と基本的な意味を理解し終えた直後の「中間層」から生まれていることが分かりました。興味深いことに、顔や体を認識する脳領域は、この「中間層」の意味を好む傾向があり、一方で場所を認識する領域は、「深い層」の意味をより好むことが分かりました。
結局のところ、この研究は、私たちが世界をどのように見ているかを理解するためには、単に写真を見るだけでなく、それをどのように記述するかを見るべきであることを示唆しています。最高の記述とは、単なる物体のリストではなく、流暢で詳細な物語であり、それらはその物語の意味を真に理解するコンピュータによって処理されるときに最も効果を発揮します。これは科学者に強力な新しいツールを与えてくれます。もし適切な種類の記述を書くことができれば、彼らは写真そのものを見ることなく、世界に対して私たちの脳がどのように反応するかを予測できるのです。
問題の背景
近年の研究により、大規模言語モデル(LLM)によって表現された画像記述(キャプション)が、ヒトの高次視覚領域における神経応答を予測できることが示されており、これは視覚的知覚が厳密に視覚的な特徴のみに依存しているという概念に疑問を投げかけている。しかし、この脳予測性を駆動している具体的な要因は依然として不明である。そのパフォーマンスが、キャプションのセマンティックな内容によるものなのか、テキストの流暢さや詳細さによるものなのか、あるいは、埋め込みを生成するために使用される特定の言語モデルのアーキテクチャによるものなのかは定まっていない。さらに、従来の研究はMS COCOデータセットの人間によるアノテーション付きキャプションにのみ依拠しており、これらはクラウドワーカーによって提供されることが多く、短文であるため、言語的表現の質を制限している可能性がある。本研究は、キャプションの内容の変化(異なる視覚言語モデルによって生成されたもの)と、それらを埋め込むために使用される言語モデルの変化が、脳予測性と行動的整合性にどのように影響するかを体系的に調査することを目的とする。
手法
著者らは、8名の参加者が906枚の自然画像(MS COCOデータセット)を注視している際の高解像度fMRI応答を含むNatural Scenes Dataset(NSD)を利用した。なお、fMRIスキャン中に参加者に画像の説明が提示されることはなかった。
- キャプション生成: 906枚の各画像に対して、著者らは5つのオープンソースの視覚言語モデル(VLM)であるLLaVA OneVision、Phi-4、Pixtral、Qwen2.5-VL、およびMolmoを用いて複数のキャプションを生成した。これらは、オリジナルの人間によるMS COCOアノテーション付きキャプションと比較された。生成されたキャプションは、長さ、流暢さ(パープレキシティで測定)、視覚性(Lancaster Sensorimotor Normsに基づく)、および語彙密度において系統的に変化させた。
- 埋め込み生成: 言語的表現に視覚情報が「混入」することを防ぐため、各キャプションを5つの異なるテキスト専用言語モデル(LM)を用いて埋め込んだ。使用したLMは以下の通りである:
- 初期のマスク言語モデル(BERT)。
- 2つの自己回帰モデル(GPT-2、Llama3.1)。
- セマンティックなタスクに微調整された最新の2つのテキスト埋め込みモデル(Qwen3 Embedding、KaLM Embedding)。
これらのモデルのすべての層から埋め込みを抽出した。
- 評価指標:
- 脳エンコーディング: 顔選択的、身体選択的、および場所選択的な3つの機能局在領域(ROI)における神経活動を予測するために、ボクセル単位の正則化線形回帰(リッジ回帰)を訓練した。パフォーマンスは、予測された活動と観察された活動の間のピアソン相関係数によって測定された。
- 脳アライメント: 表象類似度解析(RSA)を用い、キャプションの埋め込みから導出された表象非類似行列(RDM)と、神経活動から導出されたRDMとの間のスペアマン相関を算出した。
- 行動的アライメント: RSAを適用し、キャプションの埋め込みと、同じNSD参加者から収集された人間の画像類似性判断との比較を行った。
- 固有次元: 著者らは、モデルの層間における情報の圧縮を分析するために、Generalised Ratios Intrinsic Dimension Estimator(GRIDE)を使用した。
主な結果
- 機械生成 vs 人間によるアノテーション: 機械生成されたキャプションは神経活動を顕著に予測し、しばしば従来の研究で使用されていた人間によるMS COCOキャプションを上回る性能を示した。具体的には、Qwen2.5-VL、Pixtral、およびMolmoによって生成されたキャプションが最も高い予測性を示した。著者らは、MS COCOキャプションのパフォーマンスが低い理由の一部として、その流暢さの低さと簡潔さを挙げており、複数のMS COCOキャプションを平均化することで、単一の機械生成キャプションと同等の性能に向上することに言及している。
- 言語モデルの影響: テキスト埋め込みモデル(Qwen3およびKaLM)は、脳予測性と行動的アライメントの両方において、自己回帰型LM(GPT-2、Llama3)およびBERTを一貫して上回った。これは、セマンティックな表現のために明示的に微調整されたモデルが、主に次トークン予測のために訓練されたモデルよりも、脳に関連する情報をより効果的に捉えていることを示唆している。
- 層別解析: 脳予測性と行動的アライメントはともに、高い固有次元のフェーズの直後にある中間層の深さでピークに達した。この高次元フェーズは、抽象的な構文および意味構造の出現を示すものと理論化されている。
- ROIにおける解離: 層レベルのアライメントにおいて「二重解離」が観察された。顔および身体選択的ROIとのアライメントは中間層でピークに達し、後の層で減少したが、場所選択的ROIとのアライメントは深い層で劇的に増加した。これは、これら異なる視覚領域の類似性パターンをモデル化するために、異なる言語情報が必要であることを示唆している。
- 行動的優位性: キャプションの埋め込み(特に機械生成されたキャプションを用いたテキスト埋め込みモデルによるもの)は、最先端の視覚モデル(ResNet-50およびViT)から抽出された画像特徴よりも、人間の画像類似性判断に対して高いアライメントを達成した。
意義と主張
本論文は、画像のキャプションの内容と、それを表現するために使用される特定の言語モデルの両方が、脳および行動モデリングの性能を決定する重要な要因であることを確立すると主張している。著者らは、キャプションの埋め込みが高精度に神経活動や人間の類似性判断を予測できる有用なツールであることを示している。
決定的なことに、本研究は、言語的表現の脳予測性が単なる視覚情報のリーク(漏洩)による副産物ではなく、テキストのセマンティックな特性によって駆動されていることを示唆している。テキスト埋め込みモデルが自己回帰モデルよりも優れた性能を示すという発見は、文章レベルの意味を表現する能力が視覚的知覚をモデル化する上で極めて重要であることを示している。さらに、固有次元の分析は、抽象的な言語構造の出現(固有次元のピークによって示される)が、表現が人間の脳活動に対して最も予測的になる特定のフェーズであることを裏付けている。最後に、本研究はNSDの類似性判断に関する初の分析を提供し、言語的表現が視覚的特徴よりも優れた精度で人間の知覚された類似性をモデル化できることを明らかにし、言語と視覚的知覚の深い相互作用を浮き彫りにしている。
毎週最高の computer science 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。登録