Cross-Subject Modeling for Widefield Calcium Imaging via Atlas-Aligned Spatiotemporal Tokenization
该论文介绍了 WiCAT,这是一种用于宽场钙成像的多主体基础模型,它利用图谱对齐的时空标记化和自监督预训练,在实现优于单会话基准性能的同时,实现了对未见主体的零样本行为解码和脑区重建。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
想象一下,你的大脑是一座规模宏大、繁忙喧嚣的城市。通常情况下,当科学家想要研究这座城市是如何运作时,他们一次只观察一个街区,或者仅仅研究某一个特定人的通勤路线。他们为那个人、那一天、那项特定的任务绘制一张地图。但如果你想要一张适用于所有人、能瞬间生效、且不需要在每位新来者到达时都重新学习街道布局的地图呢?这就是伟大的梦想,直到现在,它一直是一个谜题。
于是,WiCAT 出现了——这是由南加州大学(USC)研究人员开发的一种全新的“大脑翻译器”。你可以把 WiCAT 想象成一位超级聪明的导游,他研究的是整个城市的蓝图(大脑解剖结构),而不是仅仅死记硬背单个游客的行为习惯。
问题所在:太多噪音,太多地图
宽场钙成像(Widefield calcium imaging)就像是一架在脑表面飞行的超高清无人机相机。它能同时捕捉到数百万个神经元的闪烁活动,创造出一段关于大脑运作的宏大、旋转的视频。但问题在于:这些视频规模巨大、杂乱无章,并且充满了“背景噪音”——比如大脑在自发鸣响,或者对一些与当前任务无关的事物做出反应。
由于这种混乱,科学家们通常不得不丢弃单次实验的数据,并为下一次实验重新开始。他们无法轻易地将来自 38 只小鼠、378 个不同记录会话以及两种不同类型任务的数据结合起来,从而构建一个庞大且强大的模型。这就像是通过只读一本书中的一个句子来学习语言,然后就把这本书扔掉,再从另一本书开始重新学习一样。
解决方案:“图谱”妙招
研究人员意识到,虽然每只小鼠都是独特的,但它们的脑部“城市地图”实际上是基于相同的蓝图构建的。为了解决这个问题,他们发明了一种方法,强制要求每一只小鼠的大脑数据都要适配到同一张标准地图上,即 Allen Brain Atlas(艾伦大脑图谱)。
可以这样理解:想象你有 38 个人在各自画着自己房子的地图。有人使用 10x10 的网格,有人使用 20x20 的网格,而且他们把厨房画在的位置也略有不同。WiCAT 会获取所有这些杂乱的图纸,并将它们精准地对齐到一个单一的、完美的、预先绘制好的网格上。突然之间,小鼠 A 的“厨房”就正好与小鼠 B 的“厨房”重合了。
一旦一切都对齐了,WiCAT 会将大脑视频切割成微小的拼图碎片(token),并将其输入到一个巨大的 AI 大脑(Transformer)中,让它去预测缺失的部分看起来是什么样的。这就像是在玩一个游戏:你遮住了 90% 的大脑视频,然后要求 AI 去猜隐藏在下面的内容是什么。为了赢得游戏,AI 必须学会大脑运动和思考的“规则”,而不仅仅是记住它见过的那些特定小鼠的面孔。
魔力所在:零样本(Zero-Shot)超能力
真正的魔力发生在研究人员将 WiCAT 测试在它从未见过的小鼠身上时。
在过去,如果你向旧模型展示一只新小鼠,模型会感到困惑并失败。但 WiCAT 不同。因为它在训练期间已经学习了大脑城市的“通用规则”,所以它只需看一眼全新的小鼠,就能立即开始解码其行为。
- 零样本行为解码(Zero-Shot Behavior Decoding): 模型可以观察一只新小鼠,并以惊人的准确度猜出它正在做什么(比如伸手拿杠杆或转头),而无需事先使用该特定小鼠的数据进行练习。这就像是遇到一个陌生人,仅仅因为你研究过人类腿部的蓝图,就能瞬间了解他们的走路方式。
- 填补空白: 模型甚至可以根据大脑其他部分的活动,猜出它“看不见”的部分(被遮蔽掉的区域)正在发生什么。这就像是即使你看不见房间里的情况,仅通过听走廊里传来的模糊声音,就能听出房间内的对话。
WiCAT 不是什么(以及它排除了什么)
了解这个模型不具备哪些功能非常重要,因为论文对此阐述得非常明确。
- 它不是一个忽略解剖结构的“一劳永逸”的魔杖。 论文明确反对那些试图在没有地图的情况下进行学习的模型。如果你尝试在不对齐大脑图谱的情况下训练模型,它将无法泛化到新的受试对象。这个“地图”是必不可少的。
- 它不需要为每一只新小鼠进行重新训练。 论文测试了一些试图学习“特定会话细节”(例如每只小鼠的唯一 ID)的模型。那些模型在面对新小鼠时都失败了。WiCAT 证明了你不需要为每只动物重新训练整个系统;共享的“大脑语言”已经足够了。
- 它还不是一个“完美”的解决方案。 论文指出,尽管结果很强,但模型仍然依赖于大脑是否被正确对齐。如果地图发生了扭曲或错位,模型的性能就会下降。它很鲁棒,但并非无懈可击。
数据说话(证据)
研究人员并不只是凭感觉猜测;他们进行了测量。
- 他们利用来自 38 个受试对象、378 个会话的数据进行了训练。
- 在测试未见过的模型时,Wi-CAT 在 Musall 数据集上的行为解码得分(R²)达到了 0.3274,在 Kondo 数据集上达到了 0.1840。
- 相比之下,旧的“单会话”模型在同样的测试中,得分分别仅为 0.0477 和 0.0573。这是一个巨大的飞跃!
- 更棒的是,如果给模型一点点帮助(大约 16 次试验或约 100 秒的记录),它就能进行适应并变得更好,得分分别达到 0.4336 和 0.2869。
核心结论
WiCAT 是迈向“大脑基础模型(Foundation Model)”的重要一步——即一个能够理解不同动物和任务之间通用大脑活动语言的强大 AI。它表明,如果我们能正确对齐数据,并教会 AI 去寻找通用模式而非特定细节,我们就能构建出能够瞬间泛化到新受试对象的模型。
论文并未声称这解决了所有问题,也没有说它适用于所有类型的脑部数据(如深层脑部记录)。但对于宽场钙成像而言,它提出了一个新的方向:停止将每一只大脑视为独特的谜题,开始教 AI 去学习连接它们的共同蓝图。而且最棒的是?代码是开源的,所以任何人都可以尝试在这个“大脑翻译器”的基础上进行构建。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。