← 最新论文
🤖 machine learning

Learning Under Treatment-Induced Label Indeterminacy with Expert Annotations of Counterfactual Outcomes: A Case Study in Neurological Prognostication

本文提出了一个用于评估和训练临床预测模型的框架,该框架通过利用专家标注的反事实结果来处理不确定病例,从而明确应对了治疗引起的标签不确定性挑战,并揭示了在可观测结果上的准确性与为那些最需要预后支持的患者提供可靠性之间存在的关键权衡。

原作者: Xiaobin Shen, Chloe Y. H. Huang, Jonathan Elmer, George H. Chen

发布于 2026-08-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Xiaobin Shen, Chloe Y. H. Huang, Jonathan Elmer, George H. Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个机器人如何预测天气。你给它看成千上万张云朵的照片,并告诉它:“这张意味着下雨,那张意味着晴天。”机器人变得非常擅长将照片与你所看到的各种天气进行匹配。但如果,在某些照片中,一只巨大的、无形的手突然把天空夺走了,导致你在看到是否下雨或出太阳之前就看不到了,会发生什么?机器人不知道那些缺失的时刻发生了什么。在现实世界中,这不仅仅关乎云朵;它也发生在医院里。有时,医生必须做出艰难的选择,因为病人看起来病得很重而停止生命维持治疗。如果他们停止治疗,病人可能会去世。但棘手的地方在于:我们永远无法得知,如果医生继续坚持治疗,病人是否本可以苏醒并康复。这种结果是“不确定的”——这是一个谜团。这给试图从医疗数据中学习的计算机模型带来了巨大的问题。它们只能从那些结局被我们实际观测到的患者身上学习,而那些最需要帮助的患者,其结局往往被这些治疗决策本身所掩盖了。

这篇论文探讨了心脏骤停康复领域中存在的正是这样一个谜团。研究人员观察了近 2,500 名在心脏骤停后仍处于昏迷状态的幸存者。他们将这些患者分为两组:“确定”病例(即患者要么明确苏醒,要么明确没有苏醒)和“不确定”病例(即由于停止了治疗或其他原因导致治疗失败,从而留下了真实的康复潜力未知的情况)。对于“不确定”组,研究人员并没有仅仅靠猜测;他们请来了一个专家医生团队来查看病历,并询问:“如果我们继续对这个人进行治疗,你们认为会发生什么?”专家们给出了他们的最佳推测,研究人员将这些推测视为一种“影子”标签——它是对真相的一种暗示,但并非真相本身。

这里重大的发现是,标准的计算机模型正在玩一场危险的“捉迷藏”游戏。当研究人员测试不同的模型时,他们发现一个模型在“确定”患者身上表现得近乎完美(能够正确排列谁会康复的顺序),但在“不确定”患者身上却可能完全错误。这就像一个学生在历史选择题考试中拿了满分,却没能理解日期背后的真实故事。论文表明,这里存在着一种严格的权衡:如果你调整模型,让它更多地去倾听专家对“不确定”患者的推测,模型在预测隐藏结局方面会做得更好,但它在处理那些我们已经知道结局的“确定”患者时,就会开始犯更多的错误。反之,如果你让模型在“确定”组中表现完美,它往往会忽略“不确定”组,并给出与专家的直觉不符的过于乐观或过于悲观的预测。

作者建议,我们不能仅仅根据单一的分数来挑选“最好的”模型。相反,我们必须选择一种平衡。他们构建了一个特殊的工具,让医生可以通过调节旋钮,来决定他们希望模型在多大程度上信任专家的推测,又在多大程度上遵循实际发生的硬性数据。研究结论指出,因为“不确定”患者的数据混乱而忽略他们是一个错误。这掩盖了一种失效模式,即模型可能会给那些最需要帮助的人提供错误的建议。通过承认有些结果是推测而非事实,并接受我们在一个群体中的准确性与另一个群体中的准确性之间必须进行权衡,我们可以构建出更好、更诚实的救命工具。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →