Predictive perception via simultaneous learning and inference
本論文は、環境状態を事後分布の近似ではなく離散空間に限定することで厳密なベイズフィルタリングを実現し、それによって単純な局所的ヘブ則による遷移ダイナミクスの学習を可能にし、ノイズの多い意思決定タスクにおける期待と驚きの行動的特徴を再現することに成功した、同時学習・推論モデル(SLIM)を紹介するものである。
原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは査読を受けていないプレプリントのAI生成解説です。医学的助言ではありません。この内容に基づいて健康上の判断をしないでください。 免責事項の全文を読む
人間は、決して明晰ではない世界を航海しています。私たちは混雑した部屋での会話を聞き取り、移ろう影の中に顔を認識し、信号が微弱なときでも音楽を理解します。これを行うために、私たちの脳は単に感覚に触れるものを記録しているわけではありません。脳は、受け取るノイズの多いデータと、すでに持っている期待を組み合わせることで、そこに何があるのかを能動的に推測しているのです。この概念はしばしば「ベイズ脳仮説」と呼ばれ、知覚とは絶え間ない推測と検証のプロセスであることを示唆しています。しかし、大きな謎が残っていました。それは、脳がいかにしてこれらの複雑な計算をリアルタイムで行っているのかという点です。自然界は広大で連続的であり、そのような空間におけるあらゆる可能な状態の正確な確率を計算することは、機械にとっても、ましてや生物にとってさえ数学的に不可能です。数十年にわたり、科学者たちは、脳が自身の推測を単純で整った形に押し込めたり、あるいは答えを近似するために数千回のランダムなサンプリングを行ったりすることで、この問題を簡略化していると仮定することで解決を試みてきました。
新しい研究は、こうした複雑なショートカットを必要としない、別の道を提案しています。研究者たちは、脳が自身の推測を単純化するのではなく、脳が推測している対象である「世界」の方を単純化しているのではないかと考えています。彼らは、知覚とはしばしば、連続的な入力を明確に区別された個別の状態へと分類することによって機能していると主張しています。これは、例えば私たちがメロディを、周波数の滑らかなスライドとしてではなく、一連の特定の音符として聞き取る仕組みに似ています。環境を、滑らかで終わりのない流れではなく、離散的なステップの集合として扱うことで、脳は近似を必要とせず、正確で完璧な計算を行うことができるのです。研究者たちはこのアイデアを検証するためにコンピュータモデルを構築し、環境の状態がどのように変化するかというルールを学習しながら、同時に自分がどの状態にいるのかを見極めるシステムが、ノイズの多い状況下で人間の行動を再現できることを示しました。このアプローチは、脳が知覚の達人であるために複雑な統計学の達人である必要はない、ただゲームのルールを知り、プレイしながらそれを更新していればよいだけなのだということを示唆しています。
マーストリヒト大学のマディ・エナン氏らによる研究チームが開発したモデルは、SLIM(Simultaneous Learning and Inference Model:同時学習・推論モデル)と呼ばれています。彼らのアイデアの核心は、複雑さがどこにあるかという視点の転換にあります。従来の理論では、脳は世界の膨大な可能性に苦慮し、計算を成立させるために自身の信念を制限しなければならないと考えられてきました。SLIMはこの構図を逆転させます。SLIMは、世界が有限の数の状態から構成されていると仮定しており、これにより現在の状態を特定するための計算が完全に解けるものになります。ここでの課題は、世界がどのように一つの状態から次の状態へと移行するかを学習することです。このモデルは、推測を行うたびに、遷移に関する内部マップを更新するという単純かつ局所的なルールを用いて学習を行います。モデルは単なる生の感覚データからだけでなく、自らの推論から学ぶことで、環境のルールが変化した際にも適応することができるのです。
この理論が成立するかどうかを確認するため、チームは一連のコンピュータ・シミュレーションを実施しました。彼らは、動きのルールが固定され予測可能な仮想環境と、ランダムで変化する仮想環境を作成しました。そして、感覚が受け取る不完全なデータを模倣して、モデルにノイズの多い信号を入力しました。結果は驚くべきものでした。モデルは、感覚入力が激しく歪んでいる状況であっても、環境の潜在的なパターンを学習することに成功しました。環境が予測可能なパターンから混沌としたものへと突然変化したとき、モデルは迅速に適応し、その内部的な不確実性は新たな現実に合わせて上昇しました。決定的なのは、感覚入力が完全に役に立たなくなった場合でも、学習した期待値のみに頼ることで、モデルは機能し続け、正確な予測を行うことができた点です。これは、外部の世界が沈黙しても、内部モデルを信頼することで、システムが安定した世界観を維持できることを証明しました。
研究者たちはまた、このシンプルな枠組みが、異なる時間スケールを扱う脳の能力を捉えられるかどうかについてもテストしました。現実世界では、ドラムの鼓動のような即時的なパターンもあれば、歌のリズムのようなより長い構造もあります。チームは、短期的遷移を学習する層と長期的パターンを学習する層を持つ、階層的なモデルを構築しました。局所的なルールには従っているがグローバルなルールには違反しているシーケンスを提示したとき、モデルはそれぞれのレベルで明確なエラー信号を生じさせました。これは、人間が局所的な驚きとグローバルな驚きに対してどのように反応するかを反映していました。このことは、学習と推論という同じ基本的なメカニズムが、異なる時間スケールのための別々の専門的なシステムを必要とせずに、複雑で多層的な知覚を説明できることを示唆しています。
シミュレーションを超えて、チームは彼らのモデルを2つの聴覚実験による実際の人間データに適用しました。最初の研究では、参加者は背景ノイズの中に隠された特定のトーンを聞き取りました。先行する音が次にくるトーンについてのヒントを与えることもあれば、与えないこともありました。人間は、予想外のトーンよりも、予想されるトーンをより速く正確に検知することが知られています。参加者の個々のデータに適合させたSLIMモデルは、この行動を完璧に再現しました。モデルは、予想されるトーンに対して高い「ヒット率」を示し、予想外のトーンに対しては反応時間が長くなることを示し、これは研究における人々と同じ挙動でした。また、モデルは「驚き」の尺度を生成しましたが、これは反応時間と相関しており、驚きの感覚とは、内部モデルを更新しようとする脳の試みの直接的な副産物であることを示唆しています。
2番目の実験では、次に何が起こるかのヒントを与えない曖昧なキューを導入することで、複雑さを加えました。これにより、研究者たちは「期待による恩恵」と「驚きによるコスト」を分離することができました。ここでも、モデルは人間のデータと一致しました。参加者は、明確な期待があるときに最もパフォーマンスが高く、期待がないときに低くなり、曖昧なキューがあるときにはその中間となりました。モデルの内部における期待と驚きの計算は、これらの行動の変化を高い精度で追跡しました。データを分析することで、研究者たちは、学習した期待に基づいた「音がどれほど驚きであるか」というモデルの尺度が、個人の検出能力の差を説明できることを見出しました。これは、環境の統計的構造を学習する能力こそが、知覚上の優位性の鍵であるという強力な証拠となりました。
この研究は、脳が世界の不確実性を扱うために、複雑で近似的な手法に頼らなければならないという従来の観点に疑問を投げかけています。代わりに、知覚を世界を離散的な状態へと分類するプロセスとして扱うことで、脳は単純な局所的学習ルールを用いて正確な計算を行えることを示唆しています。このアプローチは、自身の信念に特定の形状を仮定したり、答えを見つけるために数千回のランダムなサンプリングを実行したりすることを必要としません。ただ、状態間の遷移を学習し、それをリアルタイムで更新するだけなのです。このモデルは、管理可能な数の状態を持つ環境で最もよく機能しますが、研究者たちは、この枠組みが、私たちがノイズの多い世界をどのように航海しているかについて、強力で生物学的に妥当な説明を提供すると主張しています。それは、未来を予測する脳の能力が、複雑な数学からではなく、現在のルールを学ぶという単純で継続的なプロセスから生まれていることを示しているのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。