想象你的大脑是一座庞大而繁忙的城市。当医生想要了解这座城市里正在发生什么时,他们有时会将微小的麦克风(电极)直接放置在街道或建筑物内部。这被称为颅内脑电图(iEEG)。它能提供这座城市活动清晰无比、毫秒级的记录。
然而,存在一个巨大的问题:每座城市看起来都不同。一位患者的麦克风可能位于北侧,另一位则在南侧;一位可能有 10 个麦克风,另一位可能有 100 个。正因如此,构建一个能够聆听并理解任何患者大脑的“通用翻译器”(人工智能)变得极其困难。此前尝试构建这些翻译器的努力,就像试图只用一本特定的教科书来教学生,结果却发现他们无法阅读另一本不同的书。
DIVER-1 应运而生。将 DIVER-1 想象成一位超级聪明、适应性极强的学生,他阅读了所有可用的脑电记录,而不仅仅是某一种特定类型。以下是其工作原理,使用简单的类比说明:
1. 问题:“一刀切”的拼图
以往的人工智能模型就像僵化的乐高套装。如果你试图用一套专为宇宙飞船设计的积木来建造城堡,它就会分崩离析。
- 问题所在:脑电记录差异巨大。有些采用网格状电极,有些则是线状排列。有些记录仅持续一瞬,有些则长达数分钟。
- 旧方法:先前的模型强迫所有数据适应单一、固定的形状,从而丢失了重要细节,或无法连接大脑不同部分之间的关联。
2. 解决方案:“变形”的大脑
DIVER-1 的构建方式截然不同。它不将数据强行塞入盒子,而是根据数据调整自身形态。
- “任意变量”注意力机制:想象一个房间里有一群人,无论他们站在哪里或处于什么时间,每个人都能瞬间与其他人交谈。DIVER-1 对脑电信号就是这样做的。它让每一个“麦克风”在每一时刻都能与其他“麦克风”交流,无需固定地图即可理解它们如何协同工作。
- “自适应”输入:如果你给 DIVER-1 提供 5 个电极的记录,它能工作;如果你给它 50 个,它也能工作。它不在乎布局;它学习的是信号之间的关系,而不仅仅是它们的位置。
3. 训练:“马拉松”与“短跑”
研究人员并没有仅在小型数据集上训练 DIVER-1。他们向它输入了海量数据:来自 37 位不同个体的5,310 小时脑电记录。
- 规模:这大约是先前模型所用数据的54 倍。这就像是从阅读一本漫画书,变成了阅读整个国会图书馆的全部藏书。
- 方法:DIVER-1 并非仅仅聆听原始声音,而是被训练去“填补空白”。研究人员会隐藏部分记录(就像将歌曲静音几秒钟),然后要求人工智能根据歌曲的其余部分猜测缺失的内容。这迫使人工智能学习脑活动的深层结构。
4. 结果:超越专家
团队在两个截然不同的挑战中测试了 DIVER-1:
- “电影观众”测试(Neuroprobe):他们要求人工智能猜测一个人在观看电影时在想什么(例如:“音量是否很大?”“是否在说话?”)。
- 结果:DIVER-1 是首个超越简单标准基线的模型。尽管它是用不同的人进行训练的,但在理解脑电信号方面,它比那些用完全相同的人进行训练的模型表现更好。
- “癫痫发作”测试(MAYO):他们要求人工智能检测癫痫发作(大脑中的突发电风暴)。
- 结果:DIVER-1 在识别这些事件方面表现最佳,超越了所有先前的模型。
5. 重大发现:数据优于规模
最令人惊讶的发现是关于如何构建更强大的人工智能。
- 旧观念:“如果你想要更聪明的人工智能,只需让它变得更大(增加更多参数/脑细胞)。”
- DIVER-1 的发现:“不,先让人工智能阅读更多书籍。”
- 研究人员发现,对于脑数据而言,更多数据和更长的训练时间远比让模型变得巨大重要。
- 类比:想象训练一位厨师。你可以给他们一个巨大而昂贵的厨房(一个巨大的模型),但如果他们只练习一道菜谱一天,他们成不了大师。更好的做法是给他们一个小厨房,但让他们长时间烹饪成千上万种不同的菜肴。DIVER-1 证明了对于脑电信号而言,多样性和重复性比原始规模更重要。
总结
DIVER-1 是一种新型人工智能,无论电极如何排列,它都能聆听任何大脑。通过在庞大且多样的脑电记录库上进行训练,并专注于学习模式而非仅仅记忆位置,它已成为迄今为止解码思维和检测癫痫的最佳工具。关键教训是?在脑人工智能领域,数据的数量与多样性永远胜过模型规模。
技术摘要:DIVER-1
问题陈述
颅内脑电图(iEEG)能够直接记录人类神经活动,时间分辨率达毫秒级,因此在认知解码、脑机接口和精准神经医学领域具有重要价值。然而,开发可复用的 iEEG 基础模型一直受到三大主要瓶颈的阻碍:
- 受限的注意力架构:现有模型通常将电极视为独立个体,或将空间与时间处理分离,无法捕捉直接跨通道和跨时间的交互作用,而这些交互对于建模大脑延迟的跨区域协调至关重要。
- 固定的预训练接口:临床 iEEG 数据在通道数量、解剖覆盖范围、电极类型(SEEG 与 ECoG)以及参考方案方面,在不同患者间存在显著差异。当前模型假设输入窗口和通道布局是固定的,限制了其泛化到多变临床场景或不同时间上下文(例如亚秒级解码与多秒级癫痫发作检测)的能力。
- 预训练规模不足:先前的 iEEG 基础模型(如 BrainBERT、PopT、BaRISTA)是在相对较小的数据集(例如约 40–43 小时的 BrainTreeBank)上训练的,且往往局限于儿童电影观看记录。与临床监测中可用的海量异构数据相比,这限制了预训练的规模和多样性。此外,该领域缺乏受控的、计算感知的缩放定律,以确定性能提升应来自增加数据量、模型参数还是训练时长。
方法论:DIVER-1 架构与训练
作者提出了 DIVER-1,这是一种自监督 iEEG 基础模型,旨在通过新颖的架构和大规模预训练策略解决上述瓶颈。
核心架构组件
- 任意变量电极–时间注意力:与将注意力限制在时间轴或空间轴的标准 Transformer 不同,DIVER-1 对所有电极–时间令牌执行全自注意力。为了在不假设固定导联的情况下实现这一表达力,它通过以下方式将时空结构直接注入注意力机制:
- RoPE(旋转位置编码):编码时间偏移。
- 可学习偏置:区分同通道与跨通道交互,即使在缺乏显式空间元数据的情况下,也能保持通道置换等变性。
- 输入条件编码:为了处理可变的电极布局和参考方案,DIVER-1 利用:
- 时空条件位置嵌入(STCPE):一种基于 MOIRAI 架构的滑动窗口机制,提供局部时空偏置,而不依赖固定的通道顺序或绝对坐标。
- 时空重采样(STR):在预训练期间,模型从 30 秒片段中随机采样通道子集和时间补丁。这迫使模型从可变的输入大小和上下文中学习鲁棒的表示。
- 多域重建(MDRO):模型被训练以重建多个信号域(原始时域、FFT 频率谱和 STFT 时频表示)中的掩蔽补丁,而不仅仅是原始波形。
- 位置与频谱嵌入:模型将通道元数据(3D MNI 坐标、电极类型)和频谱特征(FFT 变换后的补丁)作为输入嵌入。
预训练与缩放研究
- 数据集:DIVER-1 在 5,310 小时 的 iEEG 数据(35.2 万通道小时)上进行了预训练,涵盖 37 名受试者,包含来自多个中心的 ECoG 和 SEEG 记录。这一体量约为先前模型所使用的 BrainTreeBank 语料的 54 倍。
- 模型变体:实例化了两个变体以匹配不同的时间粒度:DIVER-1-0.1s(50 样本补丁)和 DIVER-1-1s(500 样本补丁)。
- 缩放定律分析:作者进行了首次针对自监督 iEEG 预训练的受控、计算感知缩放研究。他们使用 最大更新参数化(µP) 以确保超参数在不同模型宽度间稳定迁移,从而对数据规模、受试者数量、训练时长和模型规模(高达 18.3 亿参数)进行了扫描。
关键结果
下游性能
DIVER-1 在两个保留基准上进行了评估:Neuroprobe(15 项任务的自然主义认知解码)和 MAYO(癫痫发作检测)。
- Neuroprobe:DIVER-1-0.1s 在所有评估的 iEEG 基础模型和监督基线中实现了 最佳平均 AUROC。值得注意的是,它超越了线性频谱图解码器,扭转了此前关于在防泄露评估下预训练 iEEG 模型表现不如简单线性基线的发现。尽管其预训练数据来自外部成人数据,而 Neuroprobe 由儿童数据组成,它仍实现了这一成绩,证明了强大的跨数据集迁移能力。
- MAYO:DIVER-1-1s 在癫痫发作检测中取得了 最高 AUROC,优于 BrainBERT 和 Brant。
- 线性探测:冻结的 DIVER-1-0.1s 模型极具竞争力,在 Neuroprobe 上经常优于其完全微调的对应模型,表明预训练表示本身已具有线性可用性。
缩放定律发现
缩放研究揭示了 iEEG 基础模型处于 数据受限机制:
- 数据与参数:增加独特的数据记录和训练时长比单纯增加参数数量能带来更可靠的性能提升。
- 计算最优分配:
- 当有新数据可用时,最优策略是 首先扩展数据,其次是训练时长,最后是模型参数。
- 当语料库固定时,最优策略是在中小型模型上 训练更长时间(更多轮次),而不是短暂地训练非常大的模型。
- 收益递减:该研究量化了重复数据(RD∗≈9.5 轮次)和过度参数(RN∗≈3.4)的收益递减点,表明最佳收益应通过扩展数据集重复次数来实现,同时保持模型规模适中。
意义与主张
本文主张 DIVER-1 代表了 iEEG 基础建模的重大进步,具体体现在:
- 实现可迁移表示:证明了大规模、异构预训练能够产生可跨受试者、中心和临床任务迁移的表示,克服了以往在狭窄、小规模数据集上训练的模型的局限性。
- 建立新的缩放范式:提供了首个受控证据,表明 iEEG 预训练受数据限制。作者认为,社区应优先扩展独特记录量和训练时长,而非单纯增加模型参数数量,这一发现与语言模型中常见的重参数缩放定律形成对比。
- 架构创新:引入了一种架构,通过任意变量注意力和输入条件位置嵌入,原生处理临床 iEEG 的变异性(可变通道、参考方案和时空上下文),从而无需固定导联即可对时空神经动力学进行鲁棒建模。
作者总结道,iEEG 基础模型的前进路径在于“首先扩展数据,其次延长训练,最后扩展参数”。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。