← 最新论文
🤖 machine learning

Leveraging unlabelled data for generalizable neural population decoding

该论文介绍了 MOJO,这是一个将自监督掩码自编码与监督学习相结合的脉冲标记神经模型训练框架,证明了利用无标签数据能显著提高解码性能、跨物种及跨模态的泛化能力以及可解释性,尤其是在标注数据有限的情况下。

原作者: Ximeng Mao, Nanda H. Krishna, Avery Hee-Woon Ryoo, Matthew G. Perich, Guillaume Lajoie

发布于 2026-07-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Ximeng Mao, Nanda H. Krishna, Avery Hee-Woon Ryoo, Matthew G. Perich, Guillaume Lajoie

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个我们可以通过阅读大脑电信号的“低语”来帮助瘫痪者移动肢体,或理解我们如何做决定的世界。这就是脑机接口(BCI)的领域——在这个领域中,科学家们试图将神经元混乱、闪烁的信号转化为清晰的计算机指令。长期以来,实现这一目标最好的方法就像教狗学动作:你展示一个信号,告诉它发生了什么特定的行为(比如“手臂向左移动”),然后它就会学习将两者匹配起来。但这种方法有一个巨大的缺陷:它需要一位老师在每一次课程中都在场。在现实世界中,我们拥有海量的记录脑数据的资料,但在这些数据中“老师”是缺失的——我们有神经元的嘈杂声,却没有任何标签说明动物在那个精确时刻正在做什么。直到现在,大多数先进的脑解码模型只能从“有标签”的数据中学习,导致大量的“无标签”大脑记录无法发挥作用,只能在库中积灰,无法帮助改进解码器。

现在出现了一种新方法,它将大脑视为一种语言。正如大型语言模型(如那些编写故事或回答问题的模型)通过阅读数十亿本书籍进行学习,而无需人类解释每一句话一样,这项新研究表明,我们可以教导脑解码模型在没有人类指导的情况下理解神经活动的“语法”。该论文介绍了一种名为 MOJO(基于掩码自编码器的联合训练,Masked autOencoder-based JOint training)的方法。可以把这想象成一名学生,他既学习带有答案的教科书(有标签数据),也研读大量没有答案解析的悬疑小说(无标签数据)。通过尝试填补悬疑小说中缺失的页面,这个学生能如此深刻地理解故事的底层结构,以至于当他最终面对带有教科书的测试时,能够轻松应对。研究人员发现,通过结合这两种学习风格,他们的模型成为了一个更出色的解码器,尤其是在初始的有标签样本非常少的情况下,甚至在处理不同物种和不同类型的脑信号时也表现出色。

问题所在:“标签”瓶颈

想象一下你正在学习一门新语言。你有一本字典,它告诉你“apple”这个词意味着一种红色的水果。如果你只有这本字典(有标签数据),你可以学会“apple”这个词。但如果你想变得流利,你需要阅读成千上万本书籍、文章和故事(无标签数据),以理解单词是如何组合在一起的,句子是如何流动的,以及语境如何改变一个词的含义。

多年来,最先进的脑解码模型(被称为“脉冲标记化”模型,如 POYO 系列)就像是只有字典的学生。它们非常擅长将特定的脑信号与特定的动作进行匹配,但它们只能从科学家仔细记录了动物在每一刻具体行为的数据中学习。这是一个巨大的局限性,因为收集有标签的数据既昂贵又耗时,而且在某些实验中往往是不可能的。与此同时,神经科学家已经收集了数 TB 的“无标签”脑数据——即在不知道动物在那一秒是在思考还是在行动的情况下,记录下的神经元放电情况。这些模型实际上忽略了这一座宝库。

解决方案:MOJO 的“填空”技巧

该论文的作者 Ximeng Mao、Nanda H Krishna 及其团队创造了 MOJO 来解决这个问题。他们希望教导这些模型从无标签数据中学习,就像语言模型从书籍中学习一样。

为了实现这一点,他们使用了一个巧妙的技巧,叫做掩码自编码(masked autoencoding)。想象一下你有一个句子:“猫坐在垫子上。”如果你遮住了“坐”这个词,你能猜到它是什么吗?如果你读过足够多的关于猫的故事,你很可能根据上下文猜出是“坐”、“站”或“跳”。MOJO 对脑信号也做同样的事情。它提取一段神经脉冲序列(即“句子”),随机隐藏(掩码)其中的一些信号,并要求模型预测这些缺失的信号是什么。

这里的奥秘在于:模型必须学习神经元之间如何交流的隐藏规则,才能做出这些猜测。它学习的是大脑的“语法”。但模型不仅仅是在猜测;它还保留了其原始的任务,即利用有标签数据来预测行为(如手臂运动)。它同时进行这两项工作。这被称为联合训练(joint training)。模型通过无标签数据学习大脑的深层结构,这有助于它更好地理解有标签数据。

结果:更聪明、更快、更灵活

团队在三种截然不同的脑数据类型上测试了 MOJO:

  1. 猴子伸手抓取: 猴子在屏幕上抓取目标。
  2. 小鼠视觉: 老鼠观察不同的视觉模式。
  3. 人类语言: 人类说话时的音节,通过放置在脑表面的电极记录(ECoG)。

在每一次测试中,MOJO 的表现都优于仅使用有标签数据的模型。但最令人兴奋的部分是当他们只有极少量的有标签数据时所发生的情况。

“少样本”超能力
通常,如果你只有很少的例子来教导一个模型(“少样本”场景),它会表现得很挣扎。但 MOJO 在这方面是一个冠军。在一次关于猴子的实验中,团队尝试仅使用两个有标签的试验(校准尝试)来教导模型解码动作。标准模型表现得一败涂地。然而,MOJO 利用无标签数据理解了大脑活动的普遍“感觉”。当他们只给它两个有标签的试验时,它的表现达到了完整数据集训练模型的 60% 以上。仅用四个有标签的试验,它就达到了 75%。这就像是一个在读完一千本悬疑小说后,仅凭两个线索就能破解新谜题的学生。

跨物种与跨模态
研究人员还测试了 MOJO 是否能从一种物种的学习迁移到另一种。他们先在猴子伸手抓取数据上对模型进行预训练,然后在小鼠视觉数据上进行微调。模型成功地转移了知识,表明它所学习到的脑部“语法”具有足够的通用性,足以帮助它理解另一种动物的大脑。

更令人惊讶的是,他们将 MOло 应用于人类语言数据(ECoG),这是一种连续信号,而非离散的“脉冲”。尽管 MOJO 是为脉冲设计的,但它适应得很好,表现得与专门为连续信号构建的模型一样出色。这表明,从无标签数据中学习的核心思想是一个强大的工具,可以跨越不同类型的脑部记录发挥作用。

“隐藏”的洞察
MOJO 最酷的副作用之一是,它学会了在没有被明确告知的情况下理解大脑的结构。研究人员要求模型仅仅通过观察其内部的“嵌入”(即数字指纹),来猜测神经元来自大脑的哪个部分(例如视觉皮层还是海马体)。即使模型从未接受过此类分类训练,它在某些任务中的准确率仍达到了 94%。它还学会了高精度地预测神经元的放电率。这意味着模型不仅仅是在死记硬背答案,它实际上学习到了一个丰富且具有解释性的、关于大脑运作方式的地图。

为什么这很重要

论文指出,通过结合监督学习(带答案的学习)和自监督学习(从数据模式中学习),我们可以构建出更加灵活且强大的脑机接口。我们不需要抛弃现有的海量无标签数据;我们可以利用它们来教导模型关于大脑的基本规则。

这种方法使得在只有极少校准时间的情况下,为新任务或新患者训练模型变得更加容易。它还为“神经基础模型(neuro-foundation models)”开启了大门——即那些可以被适配到许多不同工作中的大规模、通用型大脑模型,从帮助瘫痪者移动到理解我们的决策过程。作者指出,虽然这是一个重要的进步,但模型仍然需要大量数据来学习大脑复杂的动力学过程,并且在如何完美处理不同类型的信号方面仍存在挑战。但路径是清晰的:解码大脑的未来在于教导这些模型去阅读我们心灵中那些“无标签”的故事。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →