あなたの脳を、巨大で活気あふれる図書館だと想像してみてください。長い間、科学者たちはこの図書館の「視覚部門」は、単に個々の物体を保管するための巨大なファイリングキャビネットのようなものだと考えてきました。もしあなたが犬や車や木を見たら、特定の棚が点灯して「おい、ここに犬がいるぞ!」と告げるようなものです。しかし、もし犬が車を追いかけていたり、木が車を遮っていたりしたらどうなるのでしょうか?脳は単にアイテムのリストをチェックしているだけなのでしょうか、それともそれらがどのように組み合わさっているかという「物語」を実際に読んでいるのでしょうか?この問いは、研究者が私たちの思考や感覚の秘密の言語を解読しようとしている、認知神経科学と呼ばれる分野の中核に位置しています。彼らは、あなたが何かを見ているときに脳のどの部分が「話している」かを可視化できるハイテクカメラのような役割を果たす、fMRI(機能的磁気共鳴画像法)という強力なツールを使用します。大きな謎は、脳の視覚センターが物事の間の「関係性」を理解できるほど賢いのか、それとも単に存在する物体だけに注目するリスト作成者に過ぎないのかという点です。
ある研究チームは、脳を探偵として、言語を虫眼鏡として扱うことで、このコードを解読することに決めました。彼らは、1万枚の自然なシーンを見ている間の8人の被験者の脳スキャンデータを使用しました。脳が「リスト」ではなく「物語」を理解する能力を持っているかどうかをテストするために、彼らは巧妙な実験を行いました。それぞれの画像に対して、AIを用いて、まさに何が起きているかを正確に記述した完全で文法的な文章を作成しました(例:「公園で人が犬を追いかけている」)。次に、その同じ文章を、単語のランダムな集まりへとバラバラにしました(例:「公園、犬、人、追いかけて、いる、を、一」)。どちらのバージョンも全く同じ単語を含んでいますが、最初のものだけが、明確な構造を持つ一貫した物語を伝えていました。
結果は、非常に興味深い事実を明らかにしました。研究者がこれらの記述に基づいて脳が何をしているかを予測しようとした際、バラバラになった「単語の袋」でも脳活動を予測できましたが、完全な構造を持つ文章に比べると、その精度は著しく低いものでした。構造化された文章は、特に顔、場所、身体を認識する責任を持つ高次領域において、脳の活動とより優れた一致を示しました。つまり、脳は単なるリスト作成者ではなく、ストーリーテラーなのです。脳は、パーツがどのように組み合わさるかに深く関心を寄せています。研究者たちは、これをコンピュータモデルを用いてもテストしました。画像と言語の両方を理解するように訓練されたAIモデルは、画像のみを見るモデルよりも、脳活動を推測する精度が高いことがわかりました。これは、言語が(おそらくAIと同様に)脳が視覚的世界を、単なる物体の集まりではなく、意味のあるつながりへと整理するのを助けていることを示唆しています。
これが単に文章が「流暢」であったり、文法的に正しかったりすることによるものではないことを確認するために、チームは二つ目の仕掛けを試みました。元の物語からキーワードを取り出し、それらの単語のみを使用して、AIに「新しい」文法的に正しい文章を書かせました。この新しい文章は文法的には完璧でしたが、元の画像に特有の物語ほど、脳の反応をうまく予測することはできませんでした。これにより、脳は単に整った文章を聞ければ満足するのではなく、実際のシーンに存在するユニークで構造化された関係性を特別に求めていることが証明されました。この研究は、高次の視覚野が、シーンの「構成的構造」、すなわちエージェント(主体)、行動、そして空間がどのように組織されているかという特定の形式に対して敏感であることを示唆しています。犬と人がそこにいると知るだけでは不十分なのです。誰が誰を追いかけているのかを知って初めて、脳は真にそのシーンを「見ている」と言えるのです。
技術的要約
問題と動機
自然なシーンは、単にそこに含まれる物体によって定義されるのではなく、空間的レイアウト、意味的な関連性、社会的相互作用、および動作を含む、それらのエンティティ間の構造化された関係によって定義される。視覚システムは、シーンの意味を解釈するためにこのような構造的情報を迅速に抽出するが、高次視覚野の表現が、この構成的な構造を符号化しているのか、あるいは主に個々のエンティティの共起を反映しているのかについては依然として不明である。先行研究では、言語に整合したビジョンモデルが、ビジョンのみのモデルよりも脳の反応をより良く予測することが確立されているが、この優位性の根拠については議論がある。それは、より豊かな意味ラベルに由来するのか、あるいは構造化された関係的組織を捉える能力に由来するのかという点である。本研究は、構造化されたシーンの組織化に対する感受性と、単なるシーン要素の存在に対する感受性を分離することを目的としている。
手法
著者らは、10,000枚のユニークな自然画像を見た8名の参加者によるNatural Scenes Dataset (NSD) の7T fMRIデータを利用した。研究では、エンコーディング・フレームワーク内で2つの補完的なアプローチを採用した:
言語的操作: 各画像に対して、生成的なビジョン・ランゲージモデル(Qwen 2.5-VL)が記述的なナラティブ(物語的説明)を生成した。著者らは、語彙内容を制御しつつ構造を系統的に操作するために、複数の言語的特徴空間を構築した:
- フル・ナラティブ (Full Narrative): 整合性の取れた、完全な記述。
- バッグ・オブ・ワーズ (Bag-of-Words): ナラティブと同じ単語を使用しているが、順序をランダム化することで、統語的および関係的な構造を崩したもの。
- コンテンツ単語 (Content Words): 名詞、動詞、形容詞をランダムな順序で並べたもの(機能語を除く)。
- 孤立したカテゴリ (Isolated Categories): 名詞、動詞、または形容詞のみで学習されたモデル。
- 再生成された記述 (Regenerated Descriptions): 機能語を元のナラティブから除外し、元のコンテンツ単語のみを使用して言語モデルが文法的な文章を再構成したコントロール実験。これは、ナラティブの優位性が一般的な文法性によるものか、あるいは画像固有の関係的組織によるものかを検証するためのものである。
- テキスト・エンベディングは、CLIP (ViT-L/14) および RoBERTa エンコーダを用いて導出された。
計算モデルの比較: 著者らは、言語に整合したビジョンモデル (SigLIP2) と、自己教師あり学習によるビジョンのみのモデル (DINOv3) との間で、神経学的予測能を比較した。両モデルは同様のアーキテクチャ (Vision Transformer Large) と学習スケールを共有しているが、学習目的(画像・テキスト対照学習損失 vs. 自己教師あり視覚学習)が異なる。
エンコーディングと分析
特徴空間からfMRI反応を予測するために、ボクセル単位のリッジ回帰モデルを適合させた。研究では、分散分割を利用して固有説明分散 (Runique2) を算出した。この指標は、ターゲットとなる特徴セットとベースライン(例:バッグ・オブ・ワーズ)を含む結合モデルから、その特徴セットを除去した際の予測性能の低下を測定することにより、特定の機能セット(例:ナラティブ構造)の寄与を分離した。統計的有意性は、ノンパラメトリックなブートストラップ・リサンプリングとFDR補正を介して評価された。
主な結果
- ナラティブ構造が語彙コントロールを凌駕: フル・ナラティブによる記述は、カテゴリー選択的な領域(EBA, FFA, PPA, OPA, RSC)を含む高次視覚野において、バッグ・オブ・ワーズやコンテンツ単語のコントロールよりも有意に高い精度で皮質反応を予測した。この優位性は初期視覚野では最小であった。
- 構成的構造への特異性: バッグ・オブ・ワーズに対するナラティブの固有説明分散は、機能語や一般的な流暢さに起因するものではなかった。再生成された記述によるコントロールは、コンテンツ単語から再構成された文法的な文章はある程度の分散を捉えたものの、元の画像固有のナラティブの予測能には及ばないことを示した。これは、脳が単なる流暢な文章形式ではなく、シーンの具体的な関係的組織を符号化していることを示している。
- 語彙的寄与: 名詞が最も多くの分散を説明し、次いで動詞、形容詞であった。しかし、複数の語彙クラスを順序なしで組み合わせることで、単一のカテゴリのみの場合よりも多くの情報を捉えることができた。
- 言語に整合したモデルとの収束: SigLIP2(言語に整合したモデル)は、高次のカテゴリー選択的領域においてDINOv3(ビジョンのみのモデル)を上回った。この優位性の空間分布は、バッグ・オブ・ワーズに対するナラティブの優位性の分布と密接に一致していた。ボクセル間において、構造化された記述による固有説明分散と、言語に整合したモデルによる固有説明分散との間に強い正の相関 (r=0.66) が見出された。
- 刺激の駆動要因: 構造化された記述および言語に整合したモデルの両方において、固有の分散を駆動した画像は、構成的構造、意味的関係、および社会的相互作用のスコアが高い画像であった。これらは単に「視覚的に豊かな」画像ではなく、エージェント、物体、および動作の間の複雑で組織化された関係を持つ画像であった。
意義と主張
本論文は、高次視覚野が、単純なエンティティの共起や語彙内容単独を超えた、構造化されたシーン情報を表現していると主張している。知見は、視覚システムがシーンの要素(エージェント、動作、空間的レイアウト)の相関的な組織を、一つのコヒーレントな全体へと符号化していることを示唆している。
さらに、本研究は、言語に整合したビジョンモデルが脳活動を予測する上で優れた性能を示すのは、単に広範な語彙範囲によるアーティファクトではなく、生物学的な視覚系で表現されているものと同様の、構造化された関係的情報を捉える能力を反映していると断じている。「ナラティブの優位性」と「言語に整合したモデルの優位性」の収束は、言語による監督が、人工モデルにおいて生物学的視覚系の構造化された関係的符号化に整合する表現を誘導するのに役立つという見解を支持している。著者らは、自然言語は視覚の代用として機能するのではなく、視覚野によって符号化された関係的情報を分離するための有用なプローブ(探針)として機能すると結論付けている。
毎週最高の neuroscience 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。登録