← 最新论文
🧠 neuroscience

Reliable Evaluation of Transductive Population Graph Neural Networks for Multisite Autism fMRI

本研究表明,虽然图神经网络可以通过利用特定队列的上下文和监督,在多中心 fMRI 数据上实现极高的自闭症分类准确率,但它们无法泛化到未见的采集站点,这凸显了进行严格的留一站点评估以区分队列调节性能与真实泛化能力的至关重要性。

原作者: Wan, K., Chen, Z., Liu, G., Yu, B., Zhang, Q., Zhang, F., Zhong, N., Kuai, H.

发布于 2026-10-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Wan, K., Chen, Z., Liu, G., Yu, B., Zhang, Q., Zhang, F., Zhong, N., Kuai, H.

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

在医学影像领域,科学家们正越来越多地转向人工智能,以帮助诊断自闭症等疾病。这些系统通过研究大脑扫描图进行学习,寻找能够区分不同人群的细微模式。然而,当这些工具在来自不同医院或不同扫描仪的数据上进行测试时,一个重大的挑战随之而来。一个在某个城市表现完美的模型,在面对来自另一个城市的扫描图时可能会完全失效,仅仅是因为那里的机器或招募的人员略有不同。这被称为泛化问题。为了解决这一问题,研究人员开发了一种被称为“群体图神经网络”(population graph neural network)的巧妙计算机程序。该程序并非孤立地观察每份大脑扫描图,而是构建了一张将研究中的所有人联系在一起的地图。它根据大脑扫描图的相似性以及其他细节将他们连接起来,从而允许计算机在整个群体中实现信息的传递。这种方法取得了显著的成功,一些研究报告称,这些模型识别自闭症的准确率极高,似乎解开了如何解读这些复杂大脑图谱的谜题。

但一组研究人员决定对这种成功进行更深入的观察。他们想知道,这种高准确率究竟是因为计算机学会了识别自闭症的生物学特征,还是因为它在秘密地利用与数据来源相关的捷径。他们利用一个来自二十个不同站点的、大型且著名的脑扫描数据集,在一个受控环境中从头开始重建了这个成功的模型。随后,他们进行了一系列细致的实验,就像科学家通过一次只改变一个变量来测试假设一样。他们问道:模型是否需要看到试图诊断的那个人的特定大脑扫描图?它是否需要知道那个人去了哪家医院?最重要的是,如果它被展示一份来自它从未见过的医院的扫描图,它是否仍然有效?

研究人员发现,该模型在已知群体内的出色表现是真实的,但这种表现并不能转化到新环境中。当模型被允许使用关于参与者来自哪个医院的信息来建立其连接时,它达到了 0.94 的 AUC(曲线下面积)。这与使用所有可用信息时的表现同样之高,表明了解站点信息是其成功的关键。然而,当他们在一个完全新的站点——一个不属于原始二十个站点之中的站点——上测试该模型时,性能显著下降。该模型区分自闭症个体与非自闭症个体的能力降至大约 0.52 的水平,置信区间包含了 0.5,无法提供超出随机概率的明确证据。这与那些没有使用这些复杂连接的更简单的方法形成了鲜明对比,后者在处理未见数据时仍能保持稍好但依然有限的准确度,达到了约 65%。

调查揭示了捷径究竟隐藏在哪里。高准确率取决于模型能够将测试对象与来自同一家医院且已被标记的其他人员联系起来。使用仅包含站点信息的图保留了相似的高辨别力,这表明模型学习的是医院数据的特定“指纹”,而非自闭症的普遍特征。当研究人员阻止模型在训练期间使用来自同一家医院的标签时,AUC 骤降至约 0.48,证明该系统学习的并非疾病本身,而是数据的上下文环境。此外,他们发现这种效应是特定于模型处理信息的方式的。如果他们改变处理人与人之间连接的部分,或者使用另一种更标准的网络架构,高准确率会立即消失。只有当模型以一种非常特定的方式构建,使其能够利用同站点群体的共同特征时,它才会表现得如此出色。

这项研究为医学人工智能领域提供了一个至关重要的现实检查。它表明,一个模型在面对一组它已经见过的群体进行测试时,可能表现得像是一个卓越的诊断工具,但在面对来自不同地点的全新群体时却会完全失败。研究人员表明,先前工作中报告的高分并不一定意味着计算机已经掌握了自闭症的生物学原理,而是它掌握了其训练数据集的特定模式。通过将模型学习当前群体与学习新群体的能力区分开来,该团队为评估未来的工具提供了一个清晰的策略。他们的工作表明,为了使人工智能在医院环境中真正可靠,它不仅必须在它已知的数据上接受测试,还必须在它从未见过的数据上接受测试。在模型能够通过那项测试之前,它的高准确率可能只是一种幻象,是数据来源而非患者病情的反映。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →