あなたの脳を、常にアップデートされる超スマートなビデオゲーム機だと想像してみてください。ほとんどの場合、このゲームにおける学習は「苦行」です。同じ壁にぶつかり、失敗し、再び挑戦して、少しだけマシな失敗をし、何百回もの試行錯誤を経て、ようやく少しずつ上達していくのです。これは、長い電話番号のリストを暗記するために、定着するまで繰り返すような、通常の学習方法です。しかし時として、動物(そして人間)は「フューショット学習(数回の試行による学習)」というスーパーパワーを見せつけることがあります。これは、新しいゲームのレベルに初めて遭遇したとき、ルールが少し変わっていることに気づき、わずか2、3回の試行だけで勝利の方程式を即座に理解してしまうようなものです。それは、街のすべての通りを丸暗記することと、グリッドシステム(格子状の構造)を完璧に理解しているために、新しい近所でも即座にナビゲートできることの違いのようなものです。科学者たちは長い間、疑問を抱いてきました。脳はどうやってこれを実現しているのか?具体的には、脳の中に、単なる詳細を暗記するのではなく、新しい状況の「構造」を瞬時に把握させてくれる特別な「チートコード」が存在するのだろうか?と。脳の深部、前頭部の奥にある眼窩前頭皮質(OFC)は、情報を整理する達人として知られていますが、その「チートコード」をこの急速な学習に追いつくほど速く更新できるのかどうかは、これまで分かっていませんでした。
この論文は、ラットの脳を深く掘り下げ、彼らがどのようにしてこの精神的な手品を披露しているのかを探ります。研究者たちは、ラットのために「Rat Interactive Foraging Facility (RIFF)」と呼ばれるハイテクで円形の遊び場を用意しました。その中でラットは、特定のフードポートを突き、次に別の特定のポートを突くという、特定のシーケンス(順序)を学習しなければなりませんでした。しかし、ここにひねりがあります。ラットが11回の報酬を得るたびに、ゲームの内容が変わるのです。正しい2つのポートの場所が入れ替わり、ラットは警告なしに、直ちに新しいペアを見つけ出さなければなりませんでした。ラットたちは驚くべき成果を見せました。彼らはただランダムに推測していたのではありません。新しいシーケンスにおいて、わずか2、3回の報酬を得ただけで、彼らはほぼ完璧に遂行しており、瞬きする間に新しいルールを理解していたのです。
彼らがどのようにそれを成し遂げたかを理解するために、科学者たちはラットがプレイしている間、OFCにおける数千のニューロンの電気活動を記録しました。彼らは特定のタイプの「心的表現」を探していました。彼らは、ラットが「どこを突くべきか(行動)」と、「自分が今どのような状態にいるか(例:『最初のポートを探している状態』か、『次のポートを探している状態』か)」を知っていることを分かっていました。しかし、彼らはさらに抽象的な何かを発見しました。ラットの脳は「役割(ロール)」をコーディングしていたのです。これは、演劇の舞台を想像してみてください。俳優(物理的なポート)は毎晩変わりますが、「役柄」(ヒーロー、悪役、脇役など)は変わりません。ラットの脳は単に「ポートAはヒーローである」と記憶していたのではなく、「最初に突くポートは『ステップ1』の役割であり、次に突くポートは『ステップ2』の役割である」ということを学習していたのです。
最もエキサイティングな部分は、それがどれほど速く起こったかです。研究者たちは、ゲームのルールが変わったとき、OFCのニューロンが数日かけてゆっくりと発火率を調整するのではなく、即座に新しいポートを古い役割へと「再マッピング(再割り当て)」していることを発見しました。わずか2、3回の報酬のうちに、ニューロンの活動はシフトし、新しいポートをあたかも古いポートであるかのように扱い、「よし、この新しいポートは今、『ステップ1』の役者だ」と宣言しているかのようでした。このように、役割を新しい行動へと迅速に再割り当てする性質は、脳が試行錯誤の苦行をスキップして、抽象的な「役割」の表現を利用していることを示唆しています。ラットは単に運が良いのではなく、彼らの脳がゲームのパターンを即座に認識し、柔軟な戦略を適用しているのです。この研究は、役割を素早く再割り当てする能力こそが、フューショット学習の背後にある「秘伝のソース」であり、それによって脳がわずかな経験から新しい状況を即座にマスターできることを示唆しています。この研究は、このような神経活動と行動との間に強い結びつきがあることを示していますが、著者らは、この特定の活動が学習を「引き起こす」ことをまだ証明したわけではないと述べています。しかし、そのタイミングは完璧に一致しており、それが脳の急速学習ツールキットの鍵となる要素であることを示唆しています。
技術要約:ラットの脳における予測的な抽象的タスク表現による少ショット学習の支援
問題提起
少ショット学習(少ない経験からルールや戦略を迅速に推論する能力)は、柔軟な認知の典型的な特徴である。眼窩前頭皮質(OFC)がタスク構造の抽象的な表現を符号化していることは確立されているが、これらの表現が、変化するタスクの随伴性に適応するために、少ショット学習の迅速なタイムスケール(数秒から数分)で変化できるかどうかは不明であった。先行研究では通常、数日または数セッションという緩やかなタイムスケールにおける抽象的表現を調査してきた。本研究は、行動的な迅速適応とそれを支える神経メカニズムとの間のギャップに対処するものであり、具体的には、タスク内のアクションの機能(「役割」)のOFCにおける表現が、行動パフォーマンスが向上するのと同様に迅速に再マッピングされ得るのかを調査した。
方法論
本研究では、Rat Interactive Foraging Facility(RIFF:円形のアリーナ内に6つのインタラクション領域(IA)を備えたもの)において、シーケンス学習タスクを行う5匹のメスのスプラーグ・ドーリーラットを利用した。
- タスク設計: タスクは、3つの状態(状態1、状態2、および報酬状態)と6つの可能なアクション(特定のIAへのポーク)を持つマルコフ決定過程(MDP)としてモデル化された。各「シーケンス・ブロック」において、2つの特定のIAが正しいIA(状態1におけるa1、状態 2におけるa2)として指定され、動物を状態間で遷移させ、報酬を受け取るように設定された。
- 随伴性の変化: 11回の報酬の後、明示的なキューなしに正しいIAのシーケンスが変更された。ラットは、報酬を得るために新しいa1とa2を特定する必要があった。タスク構造(状態と遷移)は一定に保たれ、アクションと役割のマッピングのみが変化した。
- 行動分析: ラットは、安定したパフォーマンスレベルに達するまで数ヶ月かけて訓練された。行動指標には、報酬あたりのポーク数、エラーの種類(スワップ型 vs オフシーケンス型)、および探索戦略(非復元抽出を伴うサンプリング vs 復元抽出を伴うサンプリング)が含まれた。
- 神経記録: 3匹のラットのOFCにNeuropixels 1.0プローブを慢性的に植え込んだ。解放された状態で自由に移動するラットの活動を、タスク実行中に記録した。
- データ処理:
- 頭部方向や走行速度などの運動関連の分散を、神経活動から回帰除去した。
- ポーク前の活動を、各ポークの前の2秒間のウィンドウを用いて定量化した。
- ユニットを、アクション(特定のIA)、状態(状態1 vs 状態2)、または役割(アクションの機能:a1、a2、またはターゲット外)に対して選択的であると分類した。
- 線形モデルおよびデコーダーを使用して、固有の既知分散を定量化し、タスク変数を集団活動から予測した。
- 集団の軌跡を分析し、時間依存のダイナミクスに対する学習依存の変化を、神経空間における相対的な変化として追跡した。
主要な結果
行動的な少ショット学習: ラットは迅速な適応を示し、随伴性の変化後、2〜3回の報酬以内にほぼ最適なパフォーマンス(約3回のポーク/報酬)に達した。ラットは、タスクの反復的な構造を利用して、ブロック間で汎化を行った。
- 学習は、即時的な報酬がない場合でも、状態遷移を通じて行われた。状態1から状態2への正しい遷移は、その後の状態2のアクションが誤っていたとしても、アクションを強化するのに十分であった。
- ラットはタスク構造の知識を活用した。もしa1が変化した場合、彼らは以前のa2を継続して行う可能性が低かった。これは、彼らがシーケンス全体の変化の可能性を推論したことを示している。
- 学習後のエラーは構造化されていた。「スワップエラー」(誤った状態に対して正しいアクションを実行すること)は、ランダムなオフシーケンスエラーよりも頻繁に発生した。また、オフシーケンスエラーは正しい物理的位置の近くにクラスター化した。
OFCは抽象的な役割を符号化する:
- OFCユニットの約65%が、少なくとも一つのタスク変数(アクション、状態、または役割)を表現していた。
- 極めて重要なことに、一部のユニットは役割(アクションの抽象的な機能、例:「最初の正しいステップ」対「ターゲット外」)を、物理的なIAのアイデンティティとは独立して符号化した。例えば、あるブロックではa1として機能し、次のブロックではターゲット外として機能するIAは、その新しい役割に対応する明確に異なる神経応答を引き起こした。
- これらの役割表現は、価値のコーディングとは異かり、ほとんどの役割選択的ユニットは、単純な順序的な価値階層(off−target<a1<a2)とは一致しない非単調な応答プロファイルを示した。
役割表現の迅速な再マッピング:
- 役割の神経表現は、行動学習と同じ迅速なタイムスケールで適応した。
- 決定的なポークに先立つ集団の軌跡は、特定の動作に関連する神経状態が、2〜3回の決定的なポーク(報酬)以内に、「ターゲット外」のパターンから正しい「役割」のパターンへとシフトしたことを示した。
- この学習依存の集団活動のシフトは、試行の時間依存的なダイナミクスとはほぼ直交しており、緩やかなドリフトではなく、神経コードの特定の再構成であることを示している。
- 役割に基づいて訓練されたデコーダーは、高い精度でアクションの正しい役割を予測でき、その予測能力はラットが新しいシーケンスを学習するにつれて急速に現れた。
意義と主張
本論文は、このタスクにおける少ショット学習が、OFC内での抽象的な役割のアクションへの迅速な再マッピングによってサポートされていると主張している。
- 柔軟性のメカニズム: 本研究は、OFCが単に報酬履歴に基づいて特定のアクションの価値を逐次的に更新しているのではないことを示唆している。むしろ、OFCはタスク構造(状態と役割)の安定した抽象的表現を維持し、随伴性が変化した際に、特定のアクションをこれらの役割に迅速に再割り当てしている。
- 時間的スケール: 本研究は、OFCにおける抽象的表現が静的であったり形成が遅かったりするものではなく、即時の行動的柔軟性をサポートするために、数秒のタイムスケールで更新され得ることを示している。
- 理論的含意: これらの知見は、学習とは、詳細で経験に基づいた評価から、問題の不変的な構造を捉える圧縮されたカテゴリ的表現(役割)への移行であるという見解を支持している。これにより、新しい事例への効率的な汎化が可能になる。
限界
著者らは、データは相関的であると述べている。すなわち、OFCの役割表現は行動と同期して変化するものの、因果的な必要性は確立されていない(標的を絞った破壊実験が必要である)。さらに、本研究では変数を個別に分析したが、これらは本質的に結合しており、また、記録されたユニットの特定の細胞型や投影先も特定していない。
毎週最高の neuroscience 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。登録