← 最新论文
📊 statistics

The declared winner of a clinical prediction model comparison is often decided by the random split: a simulation study

这项模拟研究表明,在临床预测模型比较中常见的微小效应量水平下,被宣布的“获胜者”往往是由随机数据拆分而非模型的真实优越性所决定的,这导致了性能差距的虚高,并使得使用相同数据的不同分析师之间出现显著的分歧。

原作者: Ananya Sharma

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Ananya Sharma

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在医学研究领域,科学家们不断构建新的工具,以预测谁会生病,谁会保持健康。这些被称为临床预测模型的工具,就像是人体的高级天气预报,利用患者数据来猜测未来事件发生的可能性。为了决定哪个工具更好,研究人员通常会将它们放在一组测试数据上进行对决。他们会计算一个分数来衡量该工具预测正确的频率,而得分较高的那个会被宣布为获胜者。这一过程是该领域进步的标准方式,许多研究经常宣布一种新的机器学习算法击败了旧的、更简单的方法。然而,这些工具之间的差异往往极其微小,有时仅有百分之零点几的差距。当两个模型之间的差距如此之小时,问题便随之而来:被宣布的获胜者是真的更好,还是仅仅因为它在所测试的特定患者群体中碰巧运气较好?

安尼娅·夏尔玛(Ananya Sharma)最近的一项模拟研究探讨了这种不确定性。这项研究并不涉及真实的患者或新的医疗数据;相反,它使用计算机生成了数千个虚构的情景,在这些情景中对两个预测模型进行比较。其目标是观察在这些竞争中获胜的模型在多大程度上是真正更优越的,以及在多大程度上仅仅是由于数据划分方式随机而导致的偶然结果。在这些模拟中,研究人员创建了两个在预测能力上几乎完全相同的模型。随后,他们进行了数千次比较,通过改变测试组的大小和数据的特定随机划分,来观察“获胜者”变化的频率,或者报告的优势被夸大的程度。

研究结果揭示了目前这些比较方式存在着令人震惊的不稳定性。当两个模型之间的真实差异非常小时(这在现实世界的医学研究中是典型情况),宣布的获胜者往往只是偶然的结果。在一种模型技能几乎完全相同的情景中,两名分析完全相同的数据但使用不同随机划分的研究人员,在近一半的情况下会宣布不同的获胜者。即使其中一个模型确实稍好一些,如果测试组较小,那么“较好”的模型也仅能在大约三分之二的时间里被正确识别。这意味着,在许多已发表的研究中,关于一个工具优于另一个工具的结论可能是错误的,仅仅是因为测试集中选出的特定患者在随机运气的作用下,恰好有利于其中一个模型。

另一个重大发现涉及胜利差距的大小。研究发现,当一个模型获胜时,报告的性能差异几乎总是被夸大了,使得差距看起来比实际情况要大得多。例如,如果两个模型之间的真实差异微乎其微,获胜的模型报告的差异往往会是实际值的两倍多。这是因为挑选获胜者的过程自然地选择了在特定测试中获得最有利随机噪声的模型。这类似于掷硬币:如果你掷了十次并得到了六次正面,你可能会声称这枚硬币是有偏向性的,但结果其实只是随机波动。在这些医学模型的背景下,“赢家的诅咒”意味着报告的成功是真实技能与大量统计运气结合的结果,导致研究人员误以为他们发现了突破,而实际上他们发现的主要是随机性的峰值。

该研究还探讨了问题在于如何构建模型,还是在于如何测试数据。通过保持模型固定且仅改变测试组,以及通过在每次新划分时重新训练模型,研究人员发现,这种不稳定性几乎完全来自于测试组本身。这表明,使模型变得更复杂或更稳定并不能解决问题;问题在于许多研究中所使用的测试组实在太小,无法可靠地区分性能非常接近的模型。当测试组较小时,数据中的随机噪声会淹没反映实际差异的微弱信号。

最终,这项研究表明,目前通过单次测试运行来宣布单一获胜者的习惯往往具有误导性。研究建议研究人员不要将单次比较视为最终定论。相反,他们应该报告差异周围的不确定性范围,并且至往关键的是,应通过多次重复测试并使用不同的随机划分,来观察每个模型获胜的频率。如果一个模型在多次重复中仅略微多于一半的时间获胜,那么诚实的结论是,基于现有数据,这两个模型实际上是无法区分的。在测试组足够大以克服这种随机性之前,或者在研究采用这些更严格的报告方法之前,临床预测竞赛中的“获胜者”可能与其说是医学真相的反映,不如说是掷骰子结果的反映。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →