← 最新论文
🧬 biology

Subject Identity Is a Major Source of Variance in EEG Spectral Features and Can Inflate Machine Learning Evaluation

本研究表明,受试者身份是脑电图(EEG)频谱特征中一个主要的方差来源,在评估使用标准数据划分时,这可能会人为地提高机器学习的性能,因此必须采用基于受试者的评估协议,以确保生物标志物发现的有效性。

原作者: Hassan Ugail, Newton Howard

发布于 2026-09-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Hassan Ugail, Newton Howard

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

人类大脑是一个复杂的电活动引擎,科学家们长期以来一直使用一种被称为脑电图(EEG)的技术来倾听它的嗡鸣声。通过在头皮上放置传感器,研究人员可以捕捉大脑在思考、休息或运动时的节奏信号。近年来,机器学习加入了这一努力,提供了强大的工具来寻找这些信号中的模式,这些模式可能会揭示一个人的精神状态、检测抑郁症等疾病,或预测其行为方式。人们希望这些计算机模型能够学习特定疾病的生物特征,将疾病的信号从健康大脑的噪声中分离出来。然而,为了让这些模型获得信任,它们必须经过公平的测试。如果一个计算机程序学会了识别特定的人而非其所患的疾病,它在测试中会表现得近乎完美,但在现实世界中却会彻底失败。这种将个人身份与医疗状况混淆的风险,正是这项新研究试图解决的核心谜题。

一个研究小组致力于测量在标准的脑波记录中,究竟有多少信息属于个人本身,而非其正在执行的任务或记录的时间。他们分析了来自四个不同人群的数据,范围涵盖了从重度抑郁症患者到执行简单运动任务的志愿者。数据来源于多种渠道,包括拥有数十个传感器的尖端研究设备,以及只有几个传感器的更简单的消费级头戴设备。科学家们将脑波数据分解成特定的频段,观察不同节奏的功率,然后提出了一个根本性的问题:如果你观察这些模式,你所看到的内容中有多少是该特定个体所特有的,又有多少仅仅是由于记录环节的变化或任务的不同而产生的变化?

他们发现的答案令人震惊。在通常分析这些脑信号的标准方式中,记录数据的个体身份是最大的变异来源。在不同的研究中,研究人员计算出,个人独特的“指纹”特征占据了数据中总差异的约百分之七十到八十。相比之下,仅仅因为在不同日期进行记录或因为人正在进行略微不同的任务而产生的变化,仅占极小的比例。为了直观理解,在同一个房间里两个不同的人之间的差异,几乎是同一个人在不同天坐在同一个房间里的差异的三十倍。这意味着任何单个个体的脑波都是如此独特,以至于它们形成了一个稳定且可测量的特征,这种特征能够持续存在,即使在个人的日常生活发生变化时,也能维持数月之久。

由于这种个人特征如此强大,研究人员测试了计算机是否可以利用它来识别个人,就像指纹扫描仪一样。他们利用一组脑波记录训练模型来识别个体,然后在稍后时间采集的同一组人的新记录上进行测试。结果近乎完美。模型能够极其准确地区分不同的人,即使这些记录是在数月之后采集的。在某些测试中,计算机几乎每次都能正确识别出正确的人,这证明了脑波模式包含了一个稳健且持久的个体身份代码。这种识别能力不仅限于高质量的研究设备;在更简单的消费级头戴设备数据中也同样存在,尽管当任务发生剧烈变化时,这种效应会减弱。

然而,这项研究最关键的部分在于,观察这种强大的识别人能力何时会干扰医疗诊断。研究人员模拟了一个在这些研究中经常出现的错误做法:按脑波片段而非按人进行数据拆分。在这种有缺陷的设置下,来自同一名患者的一些脑波片段可能会进入训练组,而来自同一名患者的其他片段则可能进入测试组。当他们使用这种方法运行一个用于检测重度抑郁症的机器学习模型时,计算机取得了近乎完美的得分。它看起来完美地学习了这种疾病。但当研究人员强制要求模型进行正确的测试——即保持每个人的所有数据在训练数据和测试数据中完全隔离——时,性能显著下降。

调查揭示了为什么第一种测试具有误导性。计算机实际上并没有学会识别抑郁症的迹表征。相反,它学会了识别患者本人。因为在研究中每位患者的诊断结果是固定的,模型通过识别其独特的脑波特征,简单地记住了谁生病了,谁是健康的。当研究人员训练一个仅识别人而不显示医疗标签的模型时,它仍然可以完美地预测诊断结果。这证明了缺陷测试中的高分是一种幻象,是由模型利用身份作为捷径而产生的。研究得出结论,为了使脑科学中的机器学习值得信赖,研究人员必须将个人的身份视为一个需要控制的主要因素。他们必须确保计算机永远不会在训练阶段和测试阶段看到同一个人,否则,它可能看起来像是发现了一项医学突破,而实际上它只是学会了一个人的名字。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →