Parametric neural control differentiates top neural network models of primate visual cortex
本研究は、軸に沿った特徴強調(axis-aligned feature accentuation)を因果的な手法として導入することで、自然画像の応答を予測する精度は類似しているにもかかわらず、主要な深層ニューラルネットワークモデルが霊長類視覚野の発火を制御する能力においては大きく乖離していることを明らかにし、その性能は敵対的堅牢性よりも入力勾配の空間周波数構造によってより良く予測されることを示す。
原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは査読を受けていないプレプリントのAI生成解説です。医学的助言ではありません。この内容に基づいて健康上の判断をしないでください。 免責事項の全文を読む
人間の脳は、世界を理解するための広大で複雑な機械であり、その機械の最前線には、視覚情報の処理に完全に特化した領域である視覚野が存在します。数十年にわたり、科学者たちはこの生物学的な仕組みを模倣するコンピュータプログラムを構築しようと試みてきました。「ディープニューラルネットワーク」として知られるこれらのプログラムは、何百万枚もの写真を用いて学習を行い、物体や顔、風景を認識する能力において、私たち自身のスキルに匹敵するほどの技術を習得します。研究者がこれらのプログラムをテストすると、最も高度なモデルが、自然な画像を見せた際のサルの脳内のニューロンの活動を驚くべき精度で予測することがしばしば判明します。この成功は、ある心地よい仮定へと導きました。もし異なるコンピュータモデルがすべて、これほど見事に脳の活動を予測できるのであれば、それらはすべて、視覚的世界を理解するために同じ内部ロジックを使用しているに違いない、という仮定です。あたかも、脳を理解するための道がついに見出され、これらすべての成功したモデルが、ものの見方における単一の正しい方法へと収束したかのように見えました。
しかし、新たな研究はこの心地よい結論に異を唱え、高い予測精度が、必ずしもモデルが真に脳のロジックを把握していることを意味するわけではないことを示唆しています。5匹のマカク猿を用いた研究チームは、これらのコンピュータモデルが単に正解を推測しているだけなのか、それともニューロンがどのように反応するかを支配する特定の規則を実際に理解しているのかを検証することに乗り出しました。彼らは、単純な画像認識を超えた、より直接的な形式の相互作用を用いることで、モデルを調査するための新しい手法を作り上げました。単にモデルに画像を見せて、正しい脳の反応を予測できるかどうかを確認するのではなく、科学者たちはモデルを使用して、画像に対して特定の制御された変化を生み出すことにしました。彼らは各モデルの内部設定を取り出し、ニューロンの活動を強めたり弱めたりするように画像を微調整するための一連の指示へと変換しました。「軸に沿った特徴強調(axis-aligned feature accentuation)」と呼ばれるこのプロセスにより、彼らは特定の方向に神経反応を押し上げるように設計された、数千ものユニークなテスト画像を生成することができました。
研究チームは、10種類の主要なビジョンモデルからこれら27,500個以上のカスタム刺激を生成し、クローズドループ実験を用いてサルに提示しました。このセットアップにより、研究者は、単純な形状が処理される初期段階から、複雑な物体が認識される高次レベルに至るまで、視覚野の特定の領域を標的にすることが可能となりました。結果は驚くべきものでした。10個のモデルはすべて、標準的な自然写真に対する反応を予測する際には同等の性能を示しましたが、カスタムメイドの刺激を用いてニューロンを制御しようとすると、崩壊してしまったのです。ほとんどのモデルは、予測された通りの神経活動の変化を生み出すことに失敗しました。彼らの視覚世界の内部マップは、推測するには十分であったものの、実際の脳細胞のチューニングとは根本的に乖離していました。モデルは、ニューロンが世界に対してどのように反応するかという精密な詳細を捉えていたのではなく、単に自然な画像に対して機能する統計的なショートカットを見つけていただけであり、それはより詳細な精査の下では破綻してしまったのです。
この失敗の中で、一つ注目すべき例外がありました。「敵対的訓練(adversarial training)」と呼ばれる特定の手法を用いて訓練された2つのモデルは、一貫した優位性を示しました。これらのモデルは、神経活動を制御する能力が高く、その内部パラメータが脳自身のものに近いことを示唆していました。しかし、本研究は、これらの敵対的なトリックに対して堅牢であることが、物語のすべてではないことも明らかにしました。ニューロンを制御する能力は、人工的な攻撃にどれだけ抵抗できるかと強く結びついているわけではありませんでした。むしろ、鍵となるのはもっと根本的な要素、すなわち「入力勾配の空間周波数構造」でした。平たく言えば、これはモデルの決定に影響を与えるピクセルの特定のパターンを指します。最も優れた成果を上げたモデルは、エンコーディング軸に影響を与えるピクセルの分布が、脳が実際に視覚情報を処理する方法と一致していたモデルでした。
この研究は、コンピュータモデルがどの程度脳と一致しているかをテストするための、より厳格な新しい方法を確立しました。受動的な予測から能動的な制御へと移行することで、科学者たちは、標準的なテストにおける高い精度が、モデルによる視覚世界の表現における深い欠陥を隠してしまう可能性があることを証明しました。この知見は、現在のモデルは印象的ではあるものの、その多くはまだ、自然な画像空間の真の生物学的パラメータ化に収束していないことを示唆しています。モデルが、強調された精密な特徴を用いて神経活動を因果的に駆動できるかどうかをテストすることによってのみ、私たちはそのモデルが霊長類の脳と同じように視覚の世界を真に理解しているかどうかを知ることができるのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。