← 最新论文
🤖 machine learning

A reproducible and extensible framework for benchmarking competing risks survival models

本文介绍了一个开源、可复现且可扩展的框架,用于在多个数据集和性能指标上系统地基准测试竞争风险生存模型,同时也提供了一种基于 SHAP 的新型扩展,用于实现时间依赖型模型的解释性。

原作者: Begoña B. Sierra, Colin McLean, Peter S. Hall, Sarah Friedrich-Welz, Catalina A. Vallejos

发布于 2026-08-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Begoña B. Sierra, Colin McLean, Peter S. Hall, Sarah Friedrich-Welz, Catalina A. Vallejos

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一位试图预知患者未来的医生。你想知道:“这个人会再次生病吗?”或者“他们会死于这种疾病吗?”这就是生存分析(survival analysis)的核心——它是统计学的一个分支,就像是针对“时间-事件”数据的一颗水晶球。但棘手之处在于,生活是混乱的。一名患者可能面临癌症死亡的风险,但也可能先死于心脏病。在统计学世界中,这些被称为竞争风险(competing risks)。如果你忽略了心脏病,并假装该患者仍然只面临癌症风险,你的水晶球就会变得模糊,你的预测也会变得极其错误。你可能会高估癌症风险,从而导致不必要的治疗。几十年来,科学家们开发了各种精妙的新工具——从传统的数学公式到超级复杂的人工智能——来处理这种混乱。但由于每个人都在不同的数据集、遵循不同的规则进行测试,这就像是在拿苹果比橘子。没有人知道哪种工具才是真正胜任这项工作的。

这篇论文就像是一场为这些预测工具举办的规模宏大且有组织的“奥林匹克运动会”。作者构建了一个可复现的开源框架,在真实世界的数据上对六种不同的竞争风险模型进行了并排测试。他们不仅询问“哪一个最快?”或“哪一个能正确排列患者的顺序?”,他们还检查了一切:预测与现实的匹配程度(校准度)、根据风险对患者进行排序的能力(区分度),以及使用这些模型是否真的能帮助医生做出更好的决策(临床实用性)。他们还增加了一个特殊的“X光”功能,用以观察模型为何做出这些选择,将一种流行的 AI 解释工具扩展到了竞争风险领域。

结果如何?情况有些复杂,但也有明显的赢家。作者发现,简单的经典统计模型通常表现得与精妙复杂的深度学习 AI 模型一样出色,尤其是在数据集不是特别庞大的情况下。事实上,最复杂的 AI 模型 DeepHit 经常被评为表现最差的模型,在准确预测方面难以与较简单的选项竞争。然而,一种名为 DeSurv 的新型 AI 模型确实脱颖而出,在整体准确性上往往优于其他模型。一个关键的发现是,如何调优这些模型比模型本身更重要。如果你将一个模型调优为擅长排列患者顺序,它在预测确切事件概率方面可能会变得很差。作者建议,最好的方法是使用一个平衡的分数——**集成布里尔分数(Integrated Brier Score, IBS)**来调优模型,该分数同时检查准确性和排序能力。

最后,论文窥探了这些模型的“黑箱”。他们发现,尽管这些模型具有非常不同的内部结构,但它们都依赖于相同的关键线索(如化疗史)来进行预测。那些华丽的 AI 并没有发现秘密的新模式;它们只是以更复杂的方式处理着同样的老线索。未来的启示是,在转向昂贵且复杂的 AI 之前,医生和研究人员应该先尝试更简单、更快速的工具。如果数据量巨大,AI 可能会有所帮助,但目前来看,“老牌可靠”的方法依然能站稳脚跟,这证明了在预测未来的竞赛中,有时最简单的选手才是赢家。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →