Imputation-Based Harmonization Mitigates Site Effects Without Data Leakage in Machine Learning Studies
本文介绍了 MIRTH,这是一种新型的基于插补的协调方法,能够有效减轻神经影像机器学习研究中的站点效应,且不会导致数据泄漏或削弱真实的生物信号。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
想象一下,试图通过观察来自全国各地不同医院的数千份 MRI 扫描图像来理解人类大脑。每家医院都使用自己的机器,而且往往来自不同的制造商,并遵循略有不同的扫描程序。即使科学家们试图标准化这些程序,图像仍然会带有其采集地点的细微特征。来自某家医院的扫描图像可能看起来比另一家稍亮,或者具有不同的纹理,这并不是因为患者的大脑不同,而是因为设备的原因。当研究人员结合这些图像来研究阿尔茨海默病等疾病时,这些技术差异可能会误导计算机程序,使其认为自己发现了某种模式,而实际上那只是反映了医院所在位置的特征。这个问题被称为“站点效应”(site effect),它威胁着医学研究的可靠性,可能导致关于大脑如何运作或疾病如何进展的错误结论。
为了解决这个问题,科学家们开发了数学工具来平滑这些差异,有效地使所有的扫描图像看起来就像出自同一台机器。然而,由 Noah Hillman 及其同事进行的一项新研究揭示了目前使用这些工具时的一个隐藏陷戒。当研究人员试图构建计算机模型来预测患者的状况时,他们经常面临一个艰难的选择:如果他们在平滑过程中包含患者的诊断结果,他们可能会因为让答案影响了数据的准备过程而引入偏差;如果他们将诊断结果排除在外,他们可能会在无意中抹去了他们试图寻找的正当生物学信号。研究人员提出了一种名为 MIRTH 的新方法来应对这一困境。通过使用一种用多个合理的猜测来填补缺失信息的技巧,他们可以在不窥探答案的情况下清理数据,从而确保最终的预测是基于真实的生物学特征,而非技术伪影。
研究人员使用来自两项重大研究的数据测试了他们的想法:阿尔茨海默病神经影像学倡议(ADNI)和巴尔的摩纵向老化研究(BLAS)。他们收集了来自 2,000 多名参与者的脑部扫描图像,其中包括健康个体和阿尔茨海默病患者。这些扫描是在来自 GE、Philips 和 Siemens 三种不同制造商的三台机器上进行的,且处于两种不同的功率水平。团队专注于测量大脑内 145 个特定区域的体积,创建了一幅详细的大脑结构图。随后,他们设置了一系列挑战,以观察他们的新方法是否能在不被采集扫描的医院所误导的情况下,准确预测一个人的年龄、性别或诊断结果。
在实验中,团队将他们的新方法与几种现有方法进行了比较。一种常见的方法是在不告诉计算机患者诊断结果的情况下对数据进行平滑处理。结果显示,这种方法往往削弱了脑部扫描与疾病之间的联系,使得计算机预测谁患有阿尔茨海默病的准确性降低。另一种方法尝试在平滑过程中使用诊断结果,但这造成了一种“数据泄漏”,即计算机在应该进行测试之前就基本上记住了答案,导致结果过于乐观且不可靠。第三种方法尝试通过创造虚假场景来猜测诊断结果,但在数据复杂或信息缺失时,该方法表现挣扎。
新的 MIRTH 方法运作方式不同。它首先在已知诊断结果的数据集上训练计算机,教它如何消除医院之间的技术差异。然后,当遇到诊断结果未知的患者时,该方法使用一种统计过程生成多个可能的缺失信息版本。对于每一个版本,它都会应用从训练数据中学习到的平滑规则,确保在从未向计算机透露真实答案的情况下移除技术噪声。最后,它将所有这些版本的结果结合起来,做出一个单一且稳健的预测。
结果令人瞩目。在模拟计算机应该发现大脑结构与疾病之间不存在联系的情景中,旧的方法有时会仅仅因为某些疾病在特定医院更常见,就发现了一个虚假的联系。然而,新方法正确地发现没有联系,表明它能够区分真实的生物学特征与技术噪声。当研究人员使用真实数据来预测阿尔茨海默病、年龄和性别时,其表现与允许提前使用答案的最佳情况相当,仅在特定指标(如误差率)上存在微小差异。至关重要的是,它在没有使用答案的情况下完成了这一切。即使在数据混乱或部分信息缺失的情况下,预测依然保持准确,而这种情况往往会让其他方法陷入困境。
研究还深入探讨了该方法是否真正消除了医院的影响。当他们询问计算机在平滑处理后能否猜出扫描图像来自哪家医院时,计算机的表现明显比之前差,尽管结果仍略高于随机猜测。这证实了技术差异已被很大程度上抹除,尽管并不完美。相比之下,当我们使用不包含诊断结果的旧方法时,计算机仍然可以轻易识别出扫描图像来自哪家医院,这意味着技术噪声仍然存在,可能会扭曲医学结果。研究人员发现,当疾病在不同医院之间的分布不均匀时,这一点尤为重要;在这种情况下,如果在清理过程中忽略诊断结果,会导致预测结果显著变差。
虽然新方法被证明非常有效,但研究人员指出,它并非解决所有问题的完美方案。例如,如果出现了一家从未见过的医院,该方法可能需要额外的步骤来进行调整。此外,由于该研究依赖于模拟和现有数据,因此仍需进一步研究以观察其在实际临床环境中的表现。尽管如此,这些发现为想要整合多源数据的研究人员提供了一条清晰的路径。通过使用填补空白的多种可能性处理过程,科学家现在可以清理数据以移除技术错误,而不至于在无意中隐藏了他们试图发现的生物学真相。这确保了当计算机模型预测一种疾病时,它是通过学习大脑本身,而不是通过学习拍摄图像的机器来进行预测的。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。