Leveraging unlabelled data for generalizable neural population decoding
本論文は、スパイク・トークナイズ・ニューラルモデルに対して自己教師あり学習によるマスク・オートエンコーディングと教師あり学習を組み合わせた学習フレームワークであるMOJOを紹介し、ラベルなしデータの活用が、ラベル付きデータが限られているシナリオにおいて、デコーディング性能、種やモダリティを越えた汎用性、および解釈可能性を大幅に向上させることを実証している。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
脳内の電気的なささやきを読み取り、麻痺した人々が手足を動かしたり、私たちがどのように意思決定を行っているかを理解したりできる世界を想像してみてください。これは、科学者がニューロンの混沌とした明滅する信号を、コンピュータへの明確なコマンドへと翻訳しようとしている分野、ブレイン・コンピューター・インターフェース(BCI)の領域です。長い間、これを行う最善の方法は、犬に芸を教えるようなものでした。つまり、ある信号を見せ、「腕が左に動いた」といった特定の行動を正確に伝え、その両方を一致させるように学習させる方法です。しかし、この方法には大きな欠陥があります。それは、すべてのレッスンに教師が必要であるということです。現実の世界では、膨大な量の記録された脳データが存在しますが、そこでは「教師」が不在です。つまり、ニューロンのチャタリング(おしゃべり)はあっても、その瞬間に動物が何をしていたかを示すラベルが存在しないのです。これまで、ほとんどの高度な脳解読モデルは、ラベル付きのデータからしか学習できず、膨大な「ラベルなし」の脳の記録は、デコーダーを改善することなく、ただ埃をかぶったまま放置されてきました。
ここで、脳を言語のように扱う新しいアプローチが登場します。大規模言語モデル(物語を書いたり質問に答えたりするもの)が、すべての文章に人間の説明を必要とせずに数十億冊の本を読むことで学習するように、この新しい研究は、脳解読モデルに対して、ラベルなしで神経活動の「文法」を理解させる方法を示唆しています。この論文は、MOJO(Masked autOeroencoder-based JOint training)と呼ばれる手法を紹介しています。これは、解答付きの教科書(ラベル付きデータ)と、解答のない膨大なミステリー小説(ラベルなしデータ)の両方を学ぶ学生のようなものです。ミステリー小説の欠落したページを埋めようとすることで、学生はその物語の根底にある構造を非常に深く理解し、最終的に教科書を使ってテストを受けるときには、満点を取ることができるのです。研究者たちは、これら2つの学習スタイルを組み合わせることで、彼らのモデルがより優れたデコーダーになり、特に開始時のラベル付きの例が非常に少ない場合でも効果的であり、さらに異なる種や種類の脳信号にも機能することを発見しました。
問題点:「ラベル」のボトルネック
新しい言語を学ぼうとしているところを想像してください。あなたは、「apple」という単語が赤い果物を意味するという辞書を持っています。もしこの辞書(ラベル付きデータ)しかなければ、「apple」という単語を学ぶことができます。しかし、流暢になるためには、言葉がどのように組み合わさり、文章がどのように流れ、文脈が単語の意味をどのように変えるのかを理解するために、何千冊もの本、記事、物語(ラベルなしデータ)を読む必要があります。
長年、POYOファミリーのような「スパイク・トークナイズ」モデルとして知られる最も高度な脳解読モデルは、辞書しか持っていない学生のようなものでした。彼らは特定の脳信号を特定の動きに一致させることには非常に長けていましたが、科学者があらゆる瞬間において動物が正確に何をしていたかを注意深く記録したデータからしか学習できませんでした。これは大きな制限です。なぜなら、ラベル付きデータの収集には多大な費用と時間がかかり、特定の実験においては不可能なこともあるからです。一方で、神経科学者はテラバイト単位の「ラベルなし」の脳データを蓄積してきました。これらは、ニューロンの発火を記録してはいるものの、その瞬間に動物が何を考えていたか、あるいは何をしていたかを知らないデータです。これらのモデルは、事実上、この宝の山を無視していました。
解決策:MOJOの「穴埋め」トリック
著者であるXimeng Mao、Nanda H Krishna、およびそのチームは、これを解決するためにMOJOを作成しました。彼らは、言語モデルが本から学ぶように、これらのモデルにラベルなしデータから学習することを教えたいと考えました。
これを行うために、彼らはマスク・オートエンコーディングと呼ばれる巧妙なトリックを使用しました。例えば、「The cat sat on the mat(猫がマットの上に座った)」という文章があるとします。「sat(座った)」という単語を隠した場合、それが何であったか推測できますか?もし猫についての物語を十分に読んでいれば、文脈に基づいて「sat」や「stood(立った)」、あるいは「jumped(跳んだ)」などを推測できるはずです。MOJOは脳信号でこれを行います。ニューロンのスパイクのシーケンス(「文章」)を取り出し、いくつかの信号をランダムに隠し(マスクし)、欠落した信号が何であったかをモデルに予測させます。
ここが魔法の部分です。モデルは、これらの推測を行うために、ニューロンが互いにどのように通信しているかという隠れたルールを学習しなければなりません。モデルは脳の「文法」を学ぶのです。しかし、モデルは単に推測するだけではありません。ラベル付きデータを使用して、行動(腕の動きなど)を予測するという本来の仕事も継続します。これらを同時に行うことが**共同学習(joint training)**と呼ばれます。モデルは、ラベルなしデータから脳の深い構造を学び、それがラベル付きデータの理解をより強固なものにします。
結果:よりスマートに、より速く、より柔軟に
チームは、以下の3つの非常に異なるタイプの脳データでMOJOをテストしました。
- モンキーのリーチング: 画面上のターゲットに向かって手を伸ばすサル。
- マウスの視覚: さまざまな視覚パターンを見ているマウス。
- ヒトの音声: 脳表面の電極から記録された、音節を話す人間。
あらゆるテストにおいて、MOJOはラベル付きデータのみを使用したモデルを上回りました。しかし、最もエキサイティングな部分は、ラベル付きのデータが非常に少なかった時に起こりました。
「Few-Shot(少数の例による学習)」の超能力
通常、モデルに教えるための例が非常に少ない(「few-shot」シナリオ)場合、モデルは苦戦します。しかし、MOJOはここでチャンピオンとなりました。モンキーの実験において、チームはわずか2回のラベル付き試行(キャリブレーション試行)を用いて、モデルに動きを解読させることを試みました。標準的なモデルは無残に失敗しました。しかし、MOJOはラベルなしデータを使用して、脳活動の一般的な「感覚」を理解していました。わずか2回のラベル付き試行を与えただけで、MOлоはフルデータセットで訓練されたモデルのパフォーマンスの60%以上を達成しました。わずか4回のラベル付き試行で、**75%**に達しました。それは、千冊のミステリー小説を読んだ後に、わずか2つの手がかりだけで新しい謎を解けるようになる学生のようでした。
種を超えた、モダリティを超えた汎用性
研究者たちは、MOJOが一方の種から学習し、それを別の種に適用できるかどうかもテストしました。彼らはモンキーのリーチングデータでモデルを事前学習し、その後、マウスの視覚データで微調整(ファインチューニング)を行いました。モデルはその知識を正常に転移させ、学習した脳の「文法」が、異なる動物の脳を理解するのに十分なほど普遍的であることを示しました。
さらに驚くべきことに、彼らはMOJOをヒトの音声データ(ECoG)にも試しました。これは離散的な「スパイク」ではなく、連続的な信号です。MOJOはスパイク用に設計されていましたが、適応して、連続信号用に特別に構築されたモデルと同等の性能を発揮しました。これは、ラベルなしデータから学習するという核心的なアイデアが、異なる種類の脳記録にわたって機能する強力なツールであることを示唆しています。
「隠された」洞察
MOJOの最もクールな副作用の一つは、モデルが明示的に教えられていないにもかかわらず、脳の構造を理解することを学んだことです。研究者たちは、内部の「エンベディング(デジタル指紋)」を見るだけで、どのニューロンが脳のどの部分(例:視覚野か海馬か)に由来するかをモデルに推測させました。モデルは、この分類を訓練されていなかったにもかかわらず、いくつかのタスクで**94%**の確率で正解しました。また、ニューロンの発火率を高い精度で予測することも学習しました。これは、モデルが単に答えを暗記しているのではなく、脳がどのように機能しているかという、豊かで解釈可能なマップを実際に学習していることを意味します。
なぜこれが重要なのか
この論文は、教師あり学習(答え付きの学習)と自己教師あり学習(データ内のパターンからの学習)を組み合わせることで、より柔軟で強力なブレイン・コンピューター・インターフェースを構築できることを示唆しています。私たちはすでに持っている膨大なラベルなしデータを捨てる必要はありません。それらを使って、脳の根本的なルールをモデルに教えることができるのです。
このアプローチは、非常に少ないキャリブレーション時間で、新しいタスクや新しい患者のためのモデルを訓練することを容易にします。また、「ニューロ・ファンデーション・モデル(脳の基盤モデル)」、つまり、麻痺した人々が動くのを助けることから、私たちがどのように意思決定を行うかを理解することまで、多くの異なる仕事に適応できる巨大で汎用的な脳モデルへの扉を開きます。著者らは、これは重要な一歩ではあるものの、モデルが脳の複雑なダイナミクスを学習するにはまだ多くのデータを必要としており、異なる種類の信号を完璧に扱う方法には依然として課題があるとも述べています。しかし、道筋は明確です。脳を解読する未来は、これらのモデルに私たちの心の「ラベルなし」の物語を読ませることにあります。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。