An ablation measured twice: small component effects can change sign across repeated training runs in breast-cancer histopathology segmentation
本研究表明,在乳腺癌组织病理学分割中,消融实验所测得的小型结构组件的贡献度在多次重复训练运行中可能会在量级上发生显著变化,甚至出现方向上的改变,这凸显了在对组件有效性得出确定性结论之前进行重复实验的至关重要性。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在医学影像领域,计算机正越来越多地承担起阅读显微镜切片以寻找癌症的任务。这些被称为深度学习模型的数字化工具,通过训练来识别组织样本中人类肉眼可能忽略的模式。为了构建这些工具,研究人员结合了多种技术,例如通过调整图像颜色来消除不同实验室之间的差异,或者教计算机同时在不同的细节层级上观察图像。当建立一个新模型时,科学家们会创建一个汇总表来展示这些技术究竟哪些起到了作用。这张表通常被称为消融实验(ablation study),它列出了每个部分的具体贡献,告诉读者:“这个部分增加了价值,那个部分毫无作用。”其目标是将有用的工具从噪声中分离出来,以便未来的医生和研究人员确切地知道该信任什么。
然而,在这些总结之下隐藏着一个问题。即使使用完全相同的设置运行两次计算机程序,结果也极少是完全一致的。计算机计算中微小且不可见的波动会导致最终得分产生上下起伏。如果这种自然的“摆动”足够大,它就会让一个有用的工具看起来没用,或者让一个没用的工具看起来有用,而这仅仅是由于偶然。这种不确定性使得人们很难判断所报告的改进是一个真实的发现,还是仅仅是一次幸运的掷骰子。
旧金山湾区大学的一位研究人员决定测试这种自然的“摆动”在识别组织样本中的乳腺癌这一特定任务中到底有多大的影响。该研究聚焦于一个包含来自患者切片的数千个图像块的流行基准数据集。研究人员构建了一个旨在识别肿瘤的计算机模型,并测试了它的七个不同版本。每个版本都开启或关闭了三个特定特征:一种标准化图像颜色的方法、一种同时查看多种尺寸图像的方式,以及一种让计算机能够比较精细细节与宏观概览的机制。其目标是观察哪些特征真正提高了模型寻找癌症的能力。
为了获得计算机自然不稳定性的真实感,研究人员首先连续运行了十二次单个版本的模型,除了改变计算的随机起点外,没有改变任何其他内容。通过测量这两次运行之间的差异,研究人员发现,每次重启模型时,其得分都会发生微小但持续的偏移。这建立了一个基准,用于衡量在模型本身没有变化的情况下,数值会如何移动。
有了这个基调,研究人员随后进行了七个不同模型版本的完整实验。然而,后续对整个实验的重复并非最初的设计选择,而是因为第一次测量中的每块预测文件因版本控制错误而丢失,才不得不进行的。为了恢复数据,研究人员重新执行了网格实验,使用相同的模型配置、相同的数据和相同的起点进行了二十一次全新的训练运行。这创建了第二组独立的实验结果,以便与第一组进行对比。
对比结果揭示了一个显著的模式。第一轮中看到的巨大改进在第二轮中大多得以保持。例如,颜色标准化与多尺寸观察的结合始终能提高模型的性能,尽管第二次提升的具体幅度略小。然而,那些较小、更微妙的影响则完全不可靠。有一个特定的特征,它充当了精细细节与宏观概览之间的桥梁,在第一轮中显示出负面影响,暗示它损害了模型的性能;而在第二轮中,同一个特征却显示出正面影响,暗示它有助于提升性能。另一个微小的效应也从正向转为了负向。
研究发现,无论一个特征的效果有多大,两轮实验之间偏移的大小对于每个特征而言都是大致相同的。这意味着,当一个特征的效果很小时,计算机的自然“摆动”足以将其完全淹没,甚至反转其方向。研究人员得出结论:对于微小的效应,单次实验不足以得出结论。如果一个特征的影响与系统的自然噪声相当,那么它的结果就不够稳定,无法被信任。
唯一经受住这种严格测试的发现是颜色标准化工具的一种特定行为。虽然它并没有显著改变模型的整体平均得分,但它始终对数据集中表现最弱的医院帮助最大,使其性能提升到了与较强医院相匹配的水平。这一模式在第一轮和第二轮运行中都清晰可见,证明了该工具在使系统实现不同地点间的公平性方面确实是有用的,即便整体数字看起来并不剧烈。
最终,这项工作为我们如何解读计算机科学结果提供了一个警示。它表明,当一个计算机模型的改进很小时,如果不进行多次实验,就无法判断它是真正的突破还是仅仅是随机的波动。该研究主张,在宣布模型的某个部分是好是坏之前,研究人员必须首先测量数值自身的摆动程度。如果其效应小于这种摆动,那么结果还不是事实,而仅仅是一个需要进一步证明的建议。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。