Identical runs disagree more than different models: reproducibility limits in deep learning for brain-tumour MRI classification
本研究表明,在名义上相同的脑肿瘤 MRI 分类深度学习运行中,不受控制的随机变异可能会超过不同模型架构之间的性能差异,从而削弱了标准消融研究的可靠性,并使得实施更严格的复现协议成为必要。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在医疗影像这一高风险领域,计算机正越来越多地被要求观察人类大脑的图像并识别肿瘤。这些被称为 MRI 扫描的图像既复杂又精细,而用于分析它们的软件依赖于一种被称为深度学习的人工智能技术。为了训练这些系统,研究人员向它们输入数千张图像,让计算机自行学习模式,通过数百万次的内部参数调整,直到它变得更擅长识别疾病。其目标是创造一种能让医生信任、用于诊断脑肿瘤等病症的工具。然而,为了使这项技术安全且实用,结果必须具有一致性。如果给计算机展示两次相同的数据,理想情况下,它应该给出相同的答案。当科学家比较两个不同的计算机模型以确定哪一个更好时,他们通常会寻找极其微小的准确度差异(有时仅为百分之零点几),以此来决定哪个模型可以进入现实世界的测试阶段。
一位来自旧金山湾区大学的研究员着手测试一个特定的想法:是否通过在标准的脑部成像计算机模型中加入一种特殊的推理机制,能使其在发现肿瘤方面表现得更好。标准模型直接观察图像,而新版本则尝试理解图像不同部分之间的关系,类似于人类如何将特征中的点连接起来。该研究员构建了一个严谨的实验来测试这一点,反复运行计算机模型,以观察这种新方法是否真的带来了优势。然而,他的发现并非在肿瘤检测方面取得了突破,而是对测试过程本身可靠性的一次惊人发现。他发现,计算机自身的训练过程是如此不稳定,以至于两次运行完全相同的模型,所产生的差异竟然大于他在比较两个不同模型时试图测量的那些微小差异。
这项研究始于从数百名患者身上收集的大量 MRI 切片,并进行了仔细划分,确保没有单个患者的数据同时出现在训练组和测试组中。这一点至关重要,因为如果计算机在两组中都看到了同一个患者的肿瘤,它就只是记住了那个特定的人,而不是学会了识别疾病。研究员训练了一个标准模型和一个包含了额外推理层的更复杂的版本。他多次运行每个版本,改变一个被称为“种子”的随机起始数,以观察结果如何变化。在计算机科学领域,这个种子理应确保如果你使用相同的起始数,计算机每次都会执行完全相同的操作。预期的结果是,复杂的模型会比简单的模型稍微好一点或稍微差一点,并且运行三次测试将能得出一个清晰的平均值。
然而,结果却呈现出一种混乱的模式。当研究员使用相同的起始数运行完全相同的模型配置两次时,准确度得分平均相差超过两个百分点。这种波动如此之大,以至于完全淹没了他在比较两个不同模型时所观察到的微小差异。事实上,两次相同运行之间的差异,是简单模型与复杂模型之间差异的两倍多。这意味着实验测量的本质上是噪声而非信号。研究员意识到,计算机的表现并不像一个可靠的仪器;这就像是一个用来称量金币的秤,即使你站在完全相同的位置,它每次给出的读数也都不一样。
通过深入研究,研究员发现了导致这种不可靠性的两个主要原因。首先,计算机的设置不正确。随机起始数是在模型已经构建完成后才应用的,这意味着模型的初始设置仍然是随机且不受控的。即便在修复了这个错误、在模型构建前应用了起始数之后,结果仍然无法完全一致。第二个问题隐藏在计算机的数学引擎深处。尽管软件声称正在以完全确定的模式运行,但用于教导模型的特定计算部分每次产生的微小结果却略有不同。这种隐藏的缺陷在研究人员用来确保实验可重复性的标准检查中是无法被察觉的。
研究还表明,数据划分的方式会极大地改变结果。当研究员按单个 MRI 切片而非按患者进行数据划分时,计算机的准确度跃升了近五个百分点。这是因为计算机在训练集和测试集中识别出了来自同一患者的模式,从而使其能够识别出患者本人而非肿瘤。这种膨胀的分数是一种幻象,掩盖了模型的真实能力。此外,当研究员测试模型处理扭曲或噪声图像的能力时,单次测试显示其中一个模型更具鲁棒性,但当测试重复进行时,结果发生了反转,显示出另一个模型更好。这种反转证明,单次实验不足以得出结论。
这项工作的最终结论是,额外的推理层并没有提高检测脑肿瘤的能力。复杂的模型并不更好,而且在某些方面,它的速度更慢且可靠性更低。更重要的是,这项研究强调了许多医疗 AI 研究开展方式中的一个关键缺陷。研究人员发现的那些差异,往往比测试过程本身的自然波动还要小。研究员认为,在科学家信任一个新模型之前,必须首先验证其测试设置是否足够稳定,足以检测出微小的变化。这包括检查随机起始数是否被正确应用,以及重复进行相同的测试以测量自然波动。这些检查几乎不消耗多少时间和精力,却经常被忽略。如果没有这些检查,该领域面临着建立在过于摇摆的基础之上的风险,而这些基础难以支撑临床决策的重量。这篇论文提醒我们,在追求更好的医疗技术过程中,确保测量工具本身的准确性,与工具本身同样重要。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。