← 最新论文
💻 computer science

Proper Scoring Rules for Right-Censored Survival Data

本文提出了一种通过将预测分布映射通过删失机制来对右删失生存数据进行适当评分的统一框架,该框架恢复了既定标准,将 CRPS 和 Brier 分数等常用评分规则扩展到删失设置,并利用“删失回归”(censored engression)实现了改进的多变量建模,同时避免了现有插值加权方法中的排序不一致问题。

原作者: Jef Jonkers, Glenn Van Wallendael, Luc Duchateau, Sofie Van Hoecke

发布于 2026-06-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Jef Jonkers, Glenn Van Wallendael, Luc Duchateau, Sofie Van Hoecke

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你是一名气象预报员,正试图精确预测一场风暴何时会袭击某个特定的城镇。在一个完美的世界里,你会一直观察这场风暴直到它抵达,记录下确切的时间,然后检查你的预测是否正确。

但在生存分析(预测诸如设备故障或患者健康事件发生的时间)的现实世界中,你往往无法看到完整的故事。这被称为右删失(right-censoring)

问题所在:“黑箱”式的删失

想象你正在观看一场比赛,但一些选手因为体育场灯光熄灭而提前离开了赛道(他们被“删失”了)。

  • 选手 A 在 10 分钟时完成了比赛。你知道他们完成的确切时间。
  • 选手 B 在 15 分钟灯光熄灭时仍在奔跑。你知道他们在 15 分钟之后才完成,但你不知道是在 16 分钟、20 分钟还是 100 分钟时完成的。

如果你尝试使用标准的规则来评判你的天气预报(或比赛预测),你会陷入一个陷阱。如果你简单地因为选手 B 在 15 分钟时停止观察就假设他是在“15 分钟”完成的,那么你就是在歪曲数据。如果你尝试猜他是“无穷大”,你也错了。标准的评分规则会感到困惑,因为它们不知道如何处理这些隐藏了事件时间的“黑箱”。

解决方案:“用同样的规则玩游戏”

这篇论文的作者提出了一个聪明且简单的想法:不要试图去猜测隐藏的真相;而是去预测如果你处于观察者所处的相同境况下,你会看到什么。

可以这样理解:

  1. 标准的错误做法: 你有一个水晶球,可以预测每个选手的真实完赛时间。你试图将你的水晶球与那些提前离开的选手进行比较。但数学逻辑在这里失效了,因为你是在用一个完整的故事去对比一个残缺的故事。
  2. 论文的修正方法: 在检查你的水晶球之前,你也先在你的预测上模拟“灯光熄灭”的过程
    • 如果你的水晶球说“选手 B 在 20 分钟完成”,而灯光在 15 分钟熄灭了,那么你的“模拟”预测就会变成“选手 B 在 15 分钟之后完成”。
    • 现在,你是在将你的“模拟半个故事”与你实际观察到的“实际半个故事”进行比较。

通过迫使你的预测也经过与真实数据相同的“删失过滤器”,你就创造了一个公平的竞技场。你不再因为无法预知未来而受到惩罚;你仅仅是根据你所能观测到的部分来接受评价。

新工具:“删失评分”(Censored Scores)

论文将几种标准的预测评分方式(如 Brier 分数或 CRPS)进行了改进,将这些“开关灯”的过滤器内置其中。

  • 局部化评分(Localized Scores): 如果你知道灯光熄灭的确切时间(例如,一个固定的研究截止日期),你只需应用一次过滤器。
  • 边际化评分(Marginalized Scores): 如果灯光熄灭的时间是随机的(例如,患者在不同时间离开医院),你会根据医院已知的规则,对所有灯光可能熄灭的时间点进行评分平均。

作者证明,如果你这样做,即使面对缺失数据,你的“先知”(完美的预测者)也总能获得最好的成绩。他们还展示了旧的方法——即试图通过猜测事件发生的概率来“修复”缺失数据的方法——有时会误导系统,导致一个糟糕的预测比一个好的预测得分更高。

新训练方法:“删失回归”(Censored Engression)

这篇论文不仅提供了一种衡量预测的方法,还提供了一种教计算机如何做出这些预测的方法。

他们引入了一种名为 “删式回归”(Censored Engression) 的方法。

  • 想象一个机器人试图通过观看画面偶尔变黑的视频来学习游戏的规则。
  • 天真做法: 机器人忽略黑屏部分,试图学习完整的游戏,这会让它感到困惑。
  • 删式回归: 机器人被训练去预测包括黑屏在内的视频内容。它学习生成那些也会在正确时刻被黑屏切断的“伪造”视频,然后将其与真实的视频进行比较。

这使得机器人能够学习复杂的、多变量的模式(例如,预测患者何时会出现两种不同类型的肾衰竭),而无需依赖一个可能无法适应复杂现实的简单数学公式。

现实世界测试:ICU

为了证明其有效性,作者使用了来自重症监护室(ICU)的数据进行测试。他们尝试预测患者何时会发生急性肾损伤(AKI)。

  • 挑战: 患者在发生 AKI 之前可能会离开 ICU(出院)或死亡。这切断了数据。
  • 结果: 他们的新方法尊重了数据的“截断”特性,比那些忽略删失或使用“天真”训练方法的旧方法,能更准确地预测肾衰竭发生的时间。它正确地识别出,“灯光熄灭”(出院)是故事中至关重要的一部分,而不仅仅是缺失的数据。

总结

简而言之,这篇论文认为:当你看不全全貌时,不要假装你能看全。 相反,你应该调整你的预测,使其匹配你实际拥有的那种“模糊”的现实。通过这样做,你可以让你的预测获得更公平的评分,并能训练出更聪明的 AI 模型,使其理解自身观察能力的局限性。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →