Dataset-structured evidence synthesis for machine-learning prediction models: a methodological framework and worked example
本文提出并论证了一种数据集结构的框架,用于合成机器学习预测模型的证据,该框架将证据单位从论文重新定义为验证实验,从而纠正了由传统聚合方法引起的关于独立性和性能的误报。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在现代医院中,医生越来越依赖计算机程序来预测患者接下来可能发生的情况。这些程序通常被称为机器学习模型,它们通过对海量过往医疗记录的学习,来识别出暗示患者可能发生严重感染、需要特定治疗或面临并发症的模式。其目标是从“猜测”转向“已知”,利用数据来指导关乎生死的决策。为了信任这些工具,医学界会收集关于它们的所有可用研究,并尝试合并结果,就像陪审团权衡证词以做出裁决一样。这种被称为系统评价的过程,通常是统计论文的数量并平均其中报告的成功率。如果十项不同的研究都说一个模型效果很好,那么结论往往是该模型已准备好投入使用。然而,这种传统的计数方法存在一个隐藏的缺陷:它假设每一篇论文都代表一次完全全新且独立的测试。实际上,许多研究使用的是完全相同的患者数据池,或者是在同一组人群上测试不同版本的同一个模型。当这些重叠的测试被当作独立的证据进行计数时,模型真实表现的图景就会变得扭曲,使其看起来比实际更加可靠。
一组研究人员致力于通过改变我们观察证据的方式来解决这个问题。他们提议不再计算论文的数量,而是去计算背后的实际实验和特定的患者群体。他们开发了一个新的框架,将“验证练习”(即在特定数据集上测试模型的特定时刻)视为真正的证据单位。为了验证这种方法是否奏效,他们将其应用于一个现实世界的案例:一组旨在预测呼吸机相关性肺炎(一种影响使用呼吸机的患者的危险肺部感染)的研究。研究人员对一份声称发现了十项独立研究的已发表综述进行了重新构建,从底层开始重建证据。他们透过标题和摘要,去识别潜在的数据源、使用的特定患者群体以及测试的具体性质。
他们的发现与原有的论文计数所呈现的故事大相径庭。虽然传统的综述列出了十份报告,但这种新的、详细的重构揭示了这些报告仅建立在七个独特的患者数据组之上。更重要的是,研究人员发现,其中四份报告使用了名为 MIMIC-III 的同一个公共数据库。在旧的计数方法中,这四份报告看起来像是来自四家不同医院的四项独立测试;而在新的视角下,它们被识别为对同一个底层数据集进行的四种不同分析。研究人员还发现,许多研究并非真正独立,有些是在同一批患者身上测试多种算法,而另一些则是针对同一模型报告了不同时间窗口的结果。当他们分离出这些具有依赖性的结果后,真正独立的测试数量显著下降。事实上,在应用严格的规则来定义什么才算是在新环境中的一次真实测试后,他们发现整个收藏集中竟然没有一项研究符合完全外部验证的标准。这意味着,没有任何模型被证明能在完全不同的医院或使用不同的医疗记录时可靠运行。
这一转变的影响是深远的。原有的综述表明,这些模型具有高准确度,并已准备好用于临床。然而,新的分析显示,虽然模型在对其训练数据进行测试时表现良好,但其在新的、现实世界环境中的能力仍未得到证实。研究人员还指出,这些研究几乎完全集中在模型区分病人和健康人的能力上,即一种被称为“区分度”的指标。他们发现几乎没有关于“校准度”的证据,而校准度是指模型预测事件确切概率的能力,这是医生做出治疗决策的关键因素。缺乏这一信息,模型可能会正确识别患者处于风险之中,却无法告诉医生这种风险究竟有多高。团队得出结论,这些肺炎预测工具的证据基础比之前认为的要小得多,也缺乏成熟度。这些模型展现出了潜力,但在被证明可以广泛临床部署之前,尚未经过足够的测试。
这项工作并不是在暗示机器学习在医学领域正在失败,而是认为我们必须更加谨慎地衡量成功。通过统计数据集和实验,而不是仅仅统计论文,研究人员可以避免因重复使用相同数据而产生的进步幻觉。研究表明,一个可能暗示模型高度有效的单一汇总数字,在混合了来自相同患者和相同数据源的结果时,可能会产生误导。未来的路径要求综述能够区分内部测试与真正的外部验证,并要求在宣布一个工具可以应用于临床床旁之前,必须提供校准度的证据。在这些标准得到满足之前,医学界应将这些预测模型视为具有潜力的工具,而非已证实的解决方案。研究人员为其他科学家提供了一种清晰、实用的方法,让他们可以将同样的严谨审查应用于自己的领域,从而确保医学预测的未来是建立在坚实的、独立的证据之上,而非对同一个故事的重复计数。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。