想象一下,你的大脑是一个繁忙的城市,数以十亿计的微小信使(神经元)正在不断地向彼此大声传递信息。有时,这些信息是关于移动你的手,或者仅仅是想象移动你的手。脑机接口(BCI)就像一个超级先进的对讲机,试图倾听这些低语,并将它们转化为计算机、机器人或视频游戏的指令。对于那些因疾病或受伤而无法移动身体的人来说,这是一件大事,因为它为他们提供了一种与世界交流的新方式。
但问题在于:大脑的信号极其杂乱。这就像试图在成千上万名观众欢呼的体育场里,听清一个人的低语。信号微弱、充满噪声且难以理解。长期以来,科学家们必须手动清理这些噪声,并猜测哪些部分的信号才是重要的,这有点像是在用手从干草堆里寻找一根针。最近,计算机开始使用“深度学习”——一种能够自动学习模式的人工智能——来更好地完成这项工作。然而,即使是这些聪明的计算机,有时也难以捕捉到完整的故事,因为脑电信号会随时间而变化,计算机需要同时理解信号来自哪里以及它在何时发生。
这就是 Athanasios Karagounis 的研究介入的地方。研究人员构建了一种新型的“大脑阅读”机器,它结合了两种强大的人工智能工具:卷积神经网络(CNN)和双向长短期记忆(bi-LSTM)网络。你可以把 CNN 想象成一名超级侦探,它扫描大脑的电图以寻找最重要的位置,就像收音机调频器寻找清晰的电台一样,过滤掉静态噪声。一旦 CNN 找到了好的线索,bi-LSTM 就会扮演起时空旅行侦探的角色。它不仅仅按发生的顺序观察线索,还会同时查看信号的过去和未来,从而理解一个人想象内容的完整故事。
该论文在两组不同的数据上测试了这种新型混合系统:一组来自六名健康人士的私人录音,以及来自其他研究人员的几个公开数据集。目标是观察计算机是否能分辨出人们是在想象移动左手、右手,还是甚至是在移动舌头。结果令人鼓舞。这个新的 CNN&bi-LSTM 团队击败了像线性判别分析(LDA)和支持向量机(SVM)这样旧有的标准方法。在针对私人数据的测试中,新系统的平均正确率约为 85.4%,而旧方法的正确率则在 69% 到 79% 之间徘徊。更有趣的是,即使在训练数据量减少的情况下,该系统依然表现良好,这表明它具有鲁棒性,不需要海量的示例库来学习。
研究人员发现,当系统专注于头部的 40 个特定电极(传感器)而非使用全部 64 个电极时,学习效果最好,这实际上有助于避免对数据“过度思考”。他们还发现,人工智能不仅仅是在死记硬背信号,它开始识别出看起来像波浪的复杂模式,随着它深入挖掘自身“大脑”的层级,它变得越来越精明。虽然相对于现有方法的提升是稳步提升而非爆发式增长,但这项研究表明,将空间滤波(寻找正确的位置)与双向时间建模(理解时间的流动)相结合,是解码我们思想的一种更聪明的方式。论文总结道,这种方法提供了一种统一且可靠的方式,将杂乱的脑电波转化为清晰的指令,有望为那些最需要的人铺平通往更好康复工具的道路。
技术摘要:基于 CNN 与 LSTM 网络的高级脑电图(EEG)解码
问题陈述
运动想象(MI)脑机接口(BCI)通过将想象的运动转化为控制信号,而不要求显性的物理运动,为中风或神经退行性疾病患者提供了一条充满前景的通信途径。然而,由于脑电图(EEG)记录中固有的巨大噪声,以及信号与底层大脑活动之间复杂且弱信息性的关系,实现可靠的运动想象脑电图(MI-EEG)解码仍然具有挑战性。虽然深度学习提供了一种直接从原始信号中学习表征的方法,但其在 MI-EEG 特征学习方面的应用相对有限。此外,仅依赖于单个卷积神经网络(CNN)或循环神经网络(RNN)的传统深度学习流水线通常需要大量的辅助人工进行特征工程、参数优化和模型训练,无法充分捕捉必要的空间和时间依赖性。
方法论
本研究提出了一种混合深度学习架构,该架构集成了卷积神经网络(CNN)与双向长短期记忆(bi-LSTM)网络,旨在解决上述局限性。
- 数据采集与预处理: 该框架使用一个包含 64 个电极的私有数据集(D1)以及三个电极数量不同(32 或 64 个)的公开数据集(D2–D4)进行评估。预处理过程包括将信号参考至顶点电极(Cz)、选择主要的 MI-EEG 电极位置(例如 C3、C4、P3、P4)、应用基于小波的去噪,并在 8–23 Hz 范围内进行带通滤波,以分离 μ 和 β 节律。
- CNN 特征提取: CNN 组件作为空间滤波器,旨在直接从原始 MI-EEG 记录中学习高层空间和时间表征。它采用 8 个卷积核大小为 [36×1] 的空间滤波器,将原始 EEG 通道转换为面向任务的特征表征。该层执行的学习空间滤波类似于带通滤波和能量提取,减少了对人工特征选择的依赖。
- 批归一化(Batch Normalization): 为了提高泛化能力并加速优化,在特征提取后应用了批归一化(BN)。它将输入归一化为均值为零、标准差为一,从而减轻内部协变量偏移。
- 双向 LSTM 建模: 提取的特征由 bi-LSTM 网络处理,以建模时间动态和依赖关系。与仅利用先前输入的标准 LSTM 不同,bi-LSTM 会在正向和反向两个方向处理序列。这使得网络能够结合来自早期和后期观测值的上下文信息,从而捕捉跨越不同时间尺度的互补依赖关系。该网络利用标准的 LSTM 门控(输入门、遗忘门、输出门)和细胞状态来缓解梯度消失问题。
- 训练策略: 模型使用交叉验证进行训练,并采用均方误差(MSE)作为目标函数,选择 MSE 是因为数据中存在静息态间隔。通过使用 LASSO 导出的系数进行监督预训练来初始化权重,这提供了一个与最小二乘回归相关的解,随后再针对时间相关性进行优化。
核心贡献
- 混合架构: 本文引入了一种专门设计的 CNN&bi-LSTM 架构,旨在保留具有信息量的长程时间模式,同时提高基于 MI-EEG 的 BCI 分类性能。
- 端到端学习: 该框架直接从原始 EEG 测量值中学习空间和时间依赖关系。CNN 在无需人工工程的情况下提取特征,而 bi-LSTM 通过建模序列动态来改善时间依赖性的表征。
- 全面评估: 该方法通过一个私有数据集和多个公开数据集进行了广泛评估,展示了在不同受试者群体和实验配置下的性能。
实验结果
将所提出的方法与线性判别分析(LDA)、支持向量机(SVM)、标准 CNN 以及 RNN 进行了对比。
- 私有数据集 (D1): CNN&bi-LSTM 模型在七名受试者中实现了 85.4% 的平均分类准确率。其表现优于 LDA (69.5%)、SVM (73.0%)、CNN (75.9%) 和 RNN (79.5%)。最高的受试者特定准确率达到了 92.5%。
- 公开数据集 (D2–D4): 该混合模型始终优于其他机器学习和循环架构。在 D2、D3 和 D4 上,所提模型的准确率分别达到了 81.80%、87.97% 和 85.32%。这些结果优于单层 LSTM、多层 RNN 和时空 CNN(ST-CNN),表明将卷积特征提取与双向时间建模相结合,比单纯增加网络深度更为有效。
- 鲁棒性: 实验表明,该架构对训练数据规模的缩减具有相对鲁棒性,在使用仅 60% 的可用数据时仍能保持约 89% 的准确率。此外,性能在 40 个电极时达到峰值,这表明过多的通道数可能会导致过拟合。
意义与主张
本文声称,所提出的 CNN&bi-LSTM 架构提供了一种统一机制,将低层 EEG 测量值转化为包含时间及频率相关信息的更高层表征。结果表明,该方法可以有效地强调 MI-EEG 信号中有信息量的成分,并在不同数据集和受试者之间实现具有竞争力的分类性能。作者认为,使用双向循环建模代表了传统基于频谱特征的 EEG 分析的一种潜在替代方案。他们指出,这种方法可能支持未来的研究和基于 MI-EEG 的康复系统的实际应用,为受试者无关的解码提供稳健的解决方案。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。