Neural prediction decorrelation reveals that adversarial robustness substantially improves DNN prediction accuracy across the entire human auditory cortex
本研究は、ニューラル予測デコリレーション(NPD)を導入するものであり、これは刺激を合成することで、敵対的頑健性を備えた深層ニューラルネットワークが、自然音のみを用いた場合には検出できない、あらゆる領域におけるヒト聴覚皮質の反応の予測において標準的なモデルを大幅に上回ることを明らかにする手法である。
原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは査読を受けていないプレプリントのAI生成解説です。医学的助言ではありません。この内容に基づいて健康上の判断をしないでください。 免責事項の全文を読む
真っ直ぐで誰もいない高速道路を、車が走り去る音を聞くだけで、そのエンジンがどのように機能しているかを解明しようとしている場面を想像してみてください。エンジンのハミング、タイヤの回転音、そして風の吹き抜ける音は聞こえてくるでしょうが、複雑なギアの変速、燃料の混合、ブレーキの作動といった細部は聞き逃してしまうはずです。なぜなら、その道があまりにも滑らかで予測可能すぎるからです。これは、科学者が人間の脳を理解しようとする際に直面している状況と似ています。数十年にわたり、研究者たちは、私たちの脳が音声や音楽などの音をどのように処理しているかを推測するために、コンピュータモデルを構築してきました。彼らは自然な音を再生し、そのコンピュータの「推測」が実際の脳の電気活動と一致するかどうかを確認することで、これらのモデルをテストします。問題は、非常に異なる構造を持つモデルであっても、自然な音を聞かせると、全く同じ答えを出してしまうように見えることです。それは、2つの異なるGPSアプリがどちらも「メインストリートを左折してください」と指示しているようなものです。どちらのアプリもその特定の旅においては正解であるため、どちらがより賢いのかを判断することができません。
これを解決するために、科学者はモデル同士を「不一致」にさせる方法を見つける必要があります。片方のモデルが「それは犬の鳴き声だ」と言い、もう片方が「それは車のクラクションだ」と言うような音を再生し、同時に人間がそれを聞いている状態を作る必要があるのです。もしそれができれば、どちらのモデルが実際に人間の脳の働きに近いのかを見極めることができます。これが感覚神経科学の核心的な課題です。つまり、既知のものを用いてテストした際に、見た目が同一に見える2つのモデルを、どうやって見分けるのかという問題です。もし区別がつかないのであれば、どちらのモデルが真に脳の秘密を捉えているのか確信を持つことはできず、より優れたモデルを使って新しい音を設計したり、聴覚障害を理解したりすることもできなくなります。
この論文では、状況を一変させるための「ニューラル予測デコリレーション(NPD:Neural Prediction Decorrelation)」という巧妙なトリックを紹介しています。研究者たちは、2種類のディープニューラルネットワーク(DNN)――標準的なものと、「敵対的堅牢性(adversarially robust)」(つまり、奇妙なノイズに騙されにくい性質)を持つように訓練されたもの――を取り上げ、それらが人間の聴覚皮質にどのように反応するかを予測させました。自然な音を用いたとき、両方のモデルは、先ほどのGPSアプリのように、ほぼ同一のパフォーマンスを示しました。モデルによる予測があまりに似通っていたため、脳の方でも両者を区別することができなかったのです。
しかし、科学者たちは特殊なアルゴлоズムを用いて、60種類の全く新しい音を考案しました。これらは単なるランダムなノイズではありません。2つのモデルに全く異なる予測を強制するように、注意深く設計されたものです。科学者がモデルに対して秘密のコードを囁き、モデル同士を論争させるマジックのようなものです。これらの「NPDサウンド」をMRI装置の中で人間に聞かせたところ、結果は劇的でした。自然な音では優れていた標準的なモデルは、突然、ほとんどの予測において的外れとなりました。その予測精度はゼロ近くまで低下したのです。しかし、「敵対的堅牢性」を持つモデルは、単に生き残っただけでなく、これらの奇妙な新しい音を一度も聞いたことがないにもかかわらず、脳の反応を高い精度で予測し続けました。
この論文は、この違いが自然な音だけを使っている間は完全に隠されていたことを示唆しています。堅牢なモデルは、標準的なモデルが見落としていた、より深く柔軟な音の理解方を学習していたのです。それは、標準的なモデルが高速道路の様子を暗記しただけであるのに対し、堅牢なモデルは運転のルールそのものを学んだかのようです。研究者たちはまた、これらの合成音が単に脳を奇妙な方法で混乱させているだけではないことも確認しました。彼らは、脳の反応が自然な音と同じ「マップ」の中に収まっており、音声や流れる水などのカテゴリーとクラスターを形成していることを発見しました。これは、堅牢なモデルが単に運が良かったのではなく、自然で予測不可能な音に対しても通用する、人間の脳が音を扱う方法をより優れた形で記述できていたことを意味します。
本研究は、どのコンピュータモデルが最善であるかを判断するために、自然な刺激だけで十分であるという考えに明確に反論しています。自然な刺激のみに頼ることは、モデルの仕組みにおける巨大な差異を覆い隠してしまう可能性があることを彼らは示しています。また、堅牢なモデルが訓練データに過学習(オーバーフィッティング)していたという可能性についても、それらが一度も見聞きしたことのない新しい合成音に対して完璧に汎化性能を示したことから、否定しています。著者たちは、これらの効果が、これらの音を一度も聞いたことがない新しいグループの人々の複数の聴覚皮質領域において測定されたことを踏まえ、自らの発見に強い自信を持っています。彼らは、この「堅牢性」こそが、将来的に脳の反応を真に制御・予測できるモデルを構築するための鍵となる要素であり、特定の部位を標的とした音のデザインへの扉を開くものであると提言しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。