← 最新论文
💻 computer science

EEG-LM: A Foundation Model for EEG-Based Emotion Recognition via Diffusion-Augmented Cross-Modal Alignment with Large Language Models

本文介绍了 EEG-LM,这是一个通过扩散增强对比学习将 EEG 表征与大语言模型嵌入进行对齐,从而架起脑电信号与自然语言桥梁的基础模型,由此在多个数据集上实现了最先进的性能、强大的泛化能力以及可解释的情绪识别。

原作者: Praveen Goyal, Shyam Maheshwari, Pankaj Pandey

发布于 2026-09-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Praveen Goyal, Shyam Maheshwari, Pankaj Pandey

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

人类大脑是一个由电活动构成的广阔而嘈杂的景观,不断发射着塑造我们思想、情绪和反应的信号。几十年来,科学家们一直试图解读这种电语言以理解我们的感受,希望能构建出能直接感知我们情绪的机器。在这一任务中,最具潜力的工具之一是脑电图(EEG),它通过放置在头皮上的传感器记录这些脑波。尽管潜力巨大,但现实却极其困难。信号往往微弱,且容易受到运动或肌肉紧张的干扰。更重要的是,每个人的大脑连接方式略有不同,这意味着一个针对某人识别“快乐”而训练的计算机程序,在测试另一个人时往往会完全失效。此外,由于为这些脑电信号进行标注需要昂贵且受控的实验,研究人员一直难以收集足够的数据来教计算机如何泛化其所学知识。

现在,一组研究人员提出了一种新的方法来弥补这一差距,他们不只是将该问题视为一个信号处理挑战,而是将其视为一项翻译任务。他们开发了一个名为 EEG-LM 的系统,该系统作为一个基础模型——一个旨在学习情绪脑电活动底层结构的广泛且具有适应性的框架。该系统并非试图从有限的受试者集合中记忆特定模式,而是将大脑的原始电信号与人类用来描述感受的丰富、具象的语言联系起来。通过将混乱、嘈杂的大脑数据与清晰、语义化的文本概念相对齐,研究人员创建了一个共享空间,使计算机即使在从未见过该特定个人的脑电波时,也能理解某种情绪。这种方法表明,如果机器能够学会将脑电信号与“焦虑”或“冷静”等词汇联系起来,它就能跨越不同的人群识别这些状态,甚至在数据量极少的情况下也能实现,从而为更可靠、更具解释性的脑机接口开辟道路。

这一新方法的核心在于将三种截然不同的技术巧妙地结合在一起。首先,系统使用一种复杂的神经网络(类似于现代人工智能中使用的网络)来读取 EEG 信号,并将其转换为紧凑的数字表示。其次,它将此与一个在海量文本上训练过的大型语言模型配对。该语言模型作为一个稳定的参考点,将情绪描述转化为精确的数学坐标。研究人员随后强制要求脑电信号表示与文本描述在中间相遇,从而教会计算机特定的脑电模式对应于特定的情绪概念。为了使学习过程更加稳健(尤其是在数据匮乏的情况下),他们添加了第三个组件:一个能够生成逼真的合成脑电信号的生成工具。该工具填补了空白,使系统可以在不需要从人类志愿者那里记录数小时新数据的情况下,进行更多样化样本的练习。

当研究人员测试该系统时,结果显著优于以往的方法。他们在四个主要的公共数据集上进行了评估,这些数据集包含了来自数十名参与者的记录,使用了不同类型的设备和实验设置。在作为情绪识别标准基准的 DEAP 数据集上,新系统在识别唤醒度(arousal levels)方面的准确率达到了 92.5%,在识别效价(valence,即衡量情绪积极或消极程度的指标)方面的准确率达到了 91.8%。这些数字代表了一个巨大的飞跃,大幅超越了现有的最佳模型。该系统在其他数据集(如 SEED 和 DREAMER)上也表现出色,这些数据集使用了不同数量的传感器和不同的情绪类别。在所有案例中,那个将脑电信号与语言相联系的模型,其表现都优于仅依赖原始电信号数据的模型,证明了语言的连接为计算机的学习提供了至关重要的引导。

这项工作最引人入胜的方面在于,该系统在面对从未见过的特定数据时表现得多么出色。在一项测试中,模型在一个数据集上进行训练,然后被要求在不进行任何再训练的情况下识别另一个完全不同的数据集中的情绪,它依然保持了 85.3% 的准确率。这是一个非凡的泛化能力体现,因为旧模型在这种条件下通常会崩溃,准确率会降至 52% 左右。研究人员还探索了“零样本”(zero-shot)学习,即系统仅通过情绪的文本描述,就被要求识别一种它从未明确学习过的情绪。虽然在这种极端情况下的准确率较低,但系统能够在没有先前接触过特定类别的情况下做出任何有意义的预测,这一事实本身就表明了一种全新的灵活性。更令人印象深刻的是,当系统仅获得通常量 1% 的标记数据时,它仍能达到 78.5% 的准确率,这证明它并不需要海量的数据集就能进行有效学习。

为了确保系统不仅仅是在寻找统计学上的技巧,而是在真正学习关于大脑的知识,研究人员观察了模型内部的运作情况,以查看它在关注什么。通过使用一种可以突出不同输入重要性的技术,他们发现系统高度关注额头和头皮中心的特定通道。这些区域正是神经科学家公认的涉及注意力和情绪处理的区域,这证实了模型使用的是真实的脑电信号而非随机噪声或伪影。数据的可视化显示,系统成功地将脑电信号根据其情绪含义组织成了清晰、独立的簇,就像将不同颜色的弹珠分拣到不同的堆中一样。这种创建结构化、可解释的情绪映射的能力,让科学家们相信该模型是基于真实的神经生理模式做出决策的。

研究还检查了系统增强工具生成的合成脑电信号的质量。通过将人工信号与真实记录进行对比,研究人员发现,与以往的技术相比,这种新方法产生的数据更加真实且多样。这种高质量的合成数据帮助模型更有效地学习,充当了有限的现实世界记录的强大补充。这种数据生成技术与基于语言的对齐相结合,创造了一个不仅更准确而且对现实世界变化更具韧性的系统。研究人员指出,虽然该系统是一个重要的进步,但它还不是一个成熟的产品;它仍需要在不同的文化、设备和临床人群中进行进一步测试,以确保其在更广泛环境下的可靠性。

最终,这项工作代表了我们处理如何从大脑读取情绪这一问题的方式转变。通过将脑电信号与人类语言视为同一事物的两面,研究人员创建了一个既强大又透明的框架。该系统不仅仅输出一个标签,它还将该标签与人类可以理解的概念联系起来,使得机器的决策过程更加公开透明。这种透明度对于未来的心理健康监测或脑机接口应用至关重要,因为在这些领域,信任和清晰度是必不可少的。研究结果表明,解锁大脑情绪语言的关键可能不在于构建更复杂的信号处理器,而在于教机器学会人类情感的语言,利用我们已经掌握的词汇,去解码我们仍在努力聆听的信号。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →