← 最新の論文
🧬 biology

Cross-Subject Modeling for Widefield Calcium Imaging via Atlas-Aligned Spatiotemporal Tokenization

本論文は、アトラスに整合した時空間トークン化と自己教師あり学習による事前学習を活用することで、単一セッションのベースラインを上回る性能を実現し、かつ未知の被験体に対するゼロショットの行動デコーディングおよび脳領域再構成を可能にする、広視野カルシウムイメージングのためのマルチサブジェクト基盤モデルであるWiCATを導入するものである。

原著者: Mohammad Hosseini, Eray Erturk, Saba Hashemi, Maryam M. Shanechi

公開日 2026-07-14
📖 1 分で読めます☕ さくっと読める

原著者: Mohammad Hosseini, Eray Erturk, Saba Hashemi, Maryam M. Shanechi

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 ⚕️ これは査読を受けていないプレプリントのAI生成解説です。医学的助言ではありません。この内容に基づいて健康上の判断をしないでください。 免責事項の全文を読む

あなたの脳を、巨大で賑やかな都市だと想像してみてください。通常、科学者がこの都市の仕組みを研究しようとする際、彼らは一度に一つの近所だけを見たり、あるいは特定の個人の通勤ルートだけを調べたりします。彼らは、その特定の人物、その特定の日、その特定のタスクのための地図を作成します。しかし、もし新しい人が到着するたびに道を覚え直す必要がなく、即座に「すべての人」に対して機能する地図が欲しいとしたらどうでしょう?それが大きな夢であり、これまでは、少し難解なパズルでした。

そこで登場するのが、USCの研究者によって開発された新しい「脳の翻訳機」、WiCATです。WiCATを、個々の観光客の習慣を暗記するのではなく、都市全体の設計図(脳の解剖学的構造)を学んだ超スマートなツアーガイドだと考えてください。

問題点:ノイズが多すぎる、地図が多すぎる

ワイドフィールド・カルシウムイメージングは、脳の表面を飛ぶ高解像度のドローンカメラのようなものです。それは、数百万ものニューロンの活動を一度に捉え、脳の中で起きている動きの巨大で渦巻くビデオを作り出します。しかし、ここに落とし穴があります。これらのビデオは巨大で、乱雑で、「背景ノイズ」に満ちているのです。例えば、脳が単に独り言を言っているようなものや、実行中のタスクとは全く関係のないものに反応しているノブリングのようなノイズです。

この混乱のため、科学者は通常、一つのセッションのデータを捨てて、次のセッションのために最初からやり直さなければなりませんでした。38匹のマウス、378の異なるレコーディングセッション、そして2種類の異なるタスクのデータを組み合わせて、一つの巨大で強力なモデルを構築することは容易ではありませんでした。それは、一冊の本から一文だけを読んで学習し、その後その本を捨てて別の本からやり直すようなものでした。

解決策:「アトラス(地図)」のトリック

研究者たちは、個々のマウスは独特である一方で、彼らの脳の「都市地図」は実は同じ設計図に基づいて構築されていることに気づきました。この問題を解決するために、彼らはすべてのマウスの脳データを、**アレン・ブレイン・アトラス(Allen Brain Atlas)**と呼ばれる標準的な地図に強制的に適合させる方法を編み出しました。

このように考えてみてください。例えば、38人の異なる人々が、それぞれ自分の家の地図を描いているとします。ある人は10x10のグリッドを使い、別の人は20x20を使い、さらに全員がキッチンを少しずつ異なる場所に描いています。WiCATは、これらすべての乱雑な図面を取り込み、単一の完璧に描かれたグリッドへとスナップさせます。突然、マウスAの「キッチン」はマウスBの「キッチン」と正確に一致するようになります。

すべてが整列された後、WiCATは脳のビデオを小さなパズルのピース(トークン)に切り分け、巨大なAIの脳(トランスフォーマー)に投入します。このAIは、欠けているピースがどのような見た目になるかを予測することを学びます。これは、脳のビデオの90%を隠してしまい、その下に隠れているものをAIに推測させるゲームのようなものです。勝つためには、AIは単に以前見たマウスの特定の顔を記憶するのではなく、脳がどのように動き、思考するかという「ルール」を学ばなければなりません。

魔法:ゼロショットの超能力

本当の魔法は、彼らがWiCATを一度も見せたことがないマウスでテストした時に起こります。

以前なら、新しいマウスを古いモデルに見せると、モデルは混乱して失敗していました。しかし、WiCATは違います。トレーニング中に脳の都市の「普遍的なルール」を学んだため、新しいマウスを見ても、即座にその行動を解読し始めることができるのです。

  • ゼロショット行動デコーディング: モデルは新しいマウスを観察し、そのマウスが何をしているか(レバーに手を伸ばしているのか、頭を回しているのかなど)を、驚くほどの精度で推測できます。そのマウス固有の練習データがなくても、可能です。これは、人間の足の設計図を研究しているおかげで、見知らぬ人に会った瞬間にその人の歩き方を理解できるようなものです。
  • 空白を埋める: モデルは、見ることができない部分(マスクされた領域)で何が起きているかを、脳の他の部分の活動を見るだけで推測することさえできます。それは、部屋の中が見えなくても、廊下からの物音を聞くだけで、部屋の中の会話を聞き取れるようなものです。

WiCATが「しない」こと(および排除するもの)

このモデルが「何をしないのか」を知っておくことは重要です。論文ではその点が明確に述べられています。

  • それは解剖学を無視する「万能な魔法の杖」ではありません。 論文は、地図なしで学習しようとするモデルに対して明確に反対しています。もしアトラスに脳を整列させずにモデルを訓練しようとすれば、新しい被験体に対して汎用性を失い、失敗します。「地図」は不可欠なのです。
  • 新しいマウスごとに再学習する必要はありません。 論文では、特定の詳細(各マウスの固有IDなど)を学習しようとするモデルをテストしましたが、それらのモデルは新しいマウスに直面すると失敗しました。WiCATは、システム全体を再学習する必要はなく、共有された「脳の言語」があれば十分であることを証明しています。
  • まだ「完璧な」解決策ではありません。 論文は、結果は強力であるものの、モデルは依然として脳が正しく整列されていることに依存していることを示唆しています。もし地図が歪んでいたり、位置がずれていたりすると、モデルの性能は低下します。堅牢ではありますが、無敵ではありません。

数字(証拠)

研究者たちは単に推測したのではなく、測定しました。

  • 彼らは38の被験体378のセッションのデータでトレーニングを行いました。
  • 未知のマウスに対してテストした際、WiCATはMusallデータセットで0.3274、Kondoデータセットで0.1840という行動デコーディングスコア(R²)を達成しました。
  • これを、従来の「シングルセッション」モデルと比較すると、同じ新しいマウスに対してそれぞれ0.0477および0.0573というスコアでした。これは、非常に大きな飛躍です!
  • さらに優れたことに、モデルにわずかな助け(約16試行、または約100秒のレコーディング)を与えるだけで、モデルは適応してさらに向上し、0.4336および0.2869というスコアに達します。

結論

WiCATは、脳の「基盤モデル」——異なる動物やタスクを横断して、脳活動の一般的な言語を理解する、単一の強力なAI——への大きな一歩です。これは、データを正しく整列させ、AIに特定の詳細ではなく普遍的なパターンを探すように教えれば、新しい被験体に対しても即座に汎用性を持つモデルを構築できることを示唆しています。

この論文は、これがすべてを解決したとか、あらゆるタイプの脳データ(深部脳記録など)に機能すると主張しているわけではありません。しかし、ワイドフィールド・カルシウムイメージングにおいて、これは新しい進むべき道を示しています。すなわち、それぞれの脳をユニークなパズルとして扱うのではなく、それらすべてを繋ぐ共有の設計図をAIに教えるという方法です。そして最も素晴らしい点は、コードが公開されており、誰でもこの「脳の翻訳機」の上に自ら構築を試みることができるということです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →