Performance uncertainty in medical image analysis: a large-scale investigation of confidence intervals
本研究通过对 24 个医学影像任务进行大规模实证分析,旨在评估各种置信区间方法的可靠性与精确度,揭示了样本量、指标和聚合策略如何影响不确定性量化,并提供了一个用于指导未来报告标准的实用决策树。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在快速发展的医学影像领域,人工智能正在学习如何观察人类肉眼可能忽略的细节。这些计算机程序可以扫描 X 光片、核磁共振成像(MRI)和 CT 扫描,以检测肿瘤、识别骨折或计数细胞,其速度和一致性足以媲美资深放射科医生。然而,为了让这些工具在医院中获得信任,医生需要的不仅仅是一个显示系统表现如何的单一数字。他们需要知道,如果该系统在不同的患者群体上进行测试,这个数字会有多大的变化。因为任何测试集都只是广阔而复杂的人类疾病现实中的一个微小样本,所以任何性能评分都伴随着误差范围。为了传达这种不确定性,科学家们使用了一种叫做“置信区间”的工具。可以将它想象成围绕在一个性能评分周围的安全网;它是一个可能包含真实、现实世界能力的数值范围。如果网太宽,则告诉医生该系统不可靠;如果太窄,则可能提供一种虚假的安全感。如何正确地绘制这张网,长期以来一直是该领域产生困惑和潜在错误的一个源头。
来自欧洲各机构的一个大型研究团队致力于解决这一困惑,他们通过对医学影像中这些置信区间究竟如何表现进行大规模、系统的调查来解决这一问题。他们没有依赖理论上的猜测或孤立的小型案例。相反,他们建立了一个包含数百个真实场景的虚拟实验室。他们选取了十二种不同的医学任务,从识别 MRI 扫描中的脑肿瘤到对照片中的皮肤病变进行分类,并对每种任务应用了十九种不同的 AI 模型。这创造了一个涵盖了寻找图像中特定形状的任务(称为分割)以及将图像进行类别划分的任务(称为分类)的海量测试用例集合。对于每一个模型与任务的组合,他们都模拟了数千个不同的测试集,以观察置信区间在压力下的表现。他们测试了多种计算这些区间的计算方法,包括标准的统计公式和基于计算机密集型的重采样技术,同时还改变了测试集的大小以及衡量成功的特定指标。
调查结果表明,不存在一种在所有情况下都能表现良好的通用方法来计算这些区间。研究人员发现,方法的选择在很大程度上取决于研究的具体细节。例如,任务的类型非常重要。当 AI 被要求将图像归入一个类别(如“有疾病”或“无疾病”)时,与 AI 被要求绘制器官精确轮廓的任务相比,分类任务需要大得多的测试集才能保证可靠性。在分类任务中,研究人员发现区间通常需要数百个病例才能值得信赖,而在分割任务中,有时则需要少得多的病例。此外,如何结合来自多个类别的数据也起着至关重要的作用。如果医生想要了解 AI 在罕见疾病上的表现,他们必须分别查看每种疾病的表现,然后取平均值。研究表明,这种被称为“宏平均”(macro-averaging)的方法,比简单地将所有数据汇集在一起的“微平均”(micro-averaging)需要更多的数据来产生可靠的安全网。
用于衡量性能的具体指标也会剧烈改变置信区间的行为。一些衡量 AI 与参考形状重合程度良好的指标,往往会产生稳定且可预测的区间。而另一些衡量 AI 轮廓与真实边界之间距离的指标则更加不稳定,需要更大的样本量才能趋于稳定。研究人员发现,数据的分布形状,特别是数据的偏斜程度或不对称程度,是导致这种不稳定的主要驱动因素。当数据高度偏斜时,标准方法往往无法捕捉到真实的性能,导致产生的区间要么过窄且具有误导性,要么过宽而毫无用处。
或许最重要的一点是,这项研究挑战了盲目遵循软件默认设置的普遍做法。许多流行的用于数据分析的计算机程序都有计算置信区间的“默认”设置,通常倾向于某种特定的复杂方法。研究人员发现,这种默认设置在医学影像领域往往是错误的选择。在许多情况下,一种更简单的方法表现得更好,而在其他情况下,默认方法则会发生灾难性的失败,尤其是在数据包含离群值或汇总统计量是中位数而非平均值时。他们还发现,一些广泛使用的方法产生的区间要么宽到几乎无法使用,要么窄到完全错失了真实值。
为了帮助医学界应对这些复杂性,研究人员将他们的发现转化为一个实用的决策树。该指南允许研究人员查看其具体情况——无论是正在进行分割还是分类,使用的是什么指标,以及拥有多少患者——并立即看到哪种计算置信区间的方法最可能可靠。研究结论指出,虽然计算性能的不确定性对于人工智能的安全临床应用至关重要,但这并不是一个“一刀切”的问题。安全网的可靠性完全取决于具体的语境,而选择正确的方法需要理解数据的特定特征。通过绘制出这些依赖关系,这项工作为研究人员提供了清晰的路径,使他们能够以临床实践所要求的诚实和精准度来报告其研究结果。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。