← 最新论文
🤖 machine learning

Staying Alive: Uncensored Survival Analysis with Tabular Foundation Models

本文介绍了一种无需训练的生存回归方法,该方法利用表格基础模型(Tabular Foundation Models)迭代地填补右删失数据并构建加速失效时间(Accelerated Failure Time)模型,在标准基准测试中实现了与传统训练模型相媲敌的性能。

原作者: Mariana Vargas Vieyra

发布于 2026-06-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Mariana Vargas Vieyra

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心理念:无需训练即可预测“何时”发生

想象你是一名医生,试图预测患者在确诊后能生存多久;或者是一名汽车修理工,猜测某个特定零件何时会损坏。这被称为生存分析(Survival Analysis)。棘手之处在于,通常你无法看到最终的结果。也许是患者搬走了,或者是研究结束时零件还没坏。在统计学中,这被称为右删失(right-censoring)——你知道事件尚未发生,但你不知道它何时会发生。

通常情况下,为了解决这个问题,你需要为每一个新数据集从头构建一个定制模型,这就像是你每买一块地,都要重新雇佣一位建筑师来设计一座房子。

这篇论文介绍了一种使用**表格基础模型(Tabular Foundation Models, TFMs)**来实现这一目标的新方法。把 TFM 想象成一个“超级聪明的、经过预训练的侦探”,他已经阅读过数百万个不同的数据集。他只需看一眼新的事实列表(一张数据表),就能做出预测,而不需要经过重新训练。作者想要看看这个“超级侦探”能否在不需要额外训练的情况下,解决生存分析中的“缺失时间”谜题。

问题所在:侦探看不见结局

问题在于,这些超级侦探(TFM)习惯于看到完整的故事。如果你问他们:“这位患者能活多久?”但你只给了他们直到患者离开研究为止的数据,侦探就会感到困惑。他期待的是一个确定的答案,而不是一个“我还不知道”。

如果你直接忽略那些缺失结束时间的患者(删失数据),侦探就会产生偏差。他会认为所有人都死得比实际更早,因为他只看到了那些早逝的人,而忽略了那些仍然活着的人。

解决方案:“填空游戏”

作者创建了一种名为 TabSA(表格生存分析)的方法,让侦探通过两个巧妙的步骤来解开谜题:

第一步:“猜平均值”(AFT 模型)

首先,他们利用侦探根据特征(如年龄、健康指标等)来猜测每个人的“平均对数时间(average log-time)”。这就像侦探观察人群并猜测:“根据我以前见过的案例,这群人通常能维持大约 X 年。”

然而,为了做出这个猜测,他们只让侦探观察那些确实完成了研究的人。为了让这套机制运转起来,他们只需要调整一个单一的数值(缩放参数)。这就像告诉侦探:“你的直觉很准,你只需要告诉我该如何拉伸或收缩你的猜测。”

第二步:“想象力游戏”(迭代填补法)

这是神奇的部分。由于侦探看不见删失患者的故事结局,作者玩了一个“填补空白”的游戏。

  1. 初步猜测: 他们首先使用一种标准的统计技巧(例如基于其他仍然存活的人进行的粗略估计)来猜测删失患者缺失的结束时间。
  2. 循环过程: 他们将这些猜测反馈给侦探。侦探观察整个群体(包括这些猜测),然后说:“实际上,基于这个新信息,我对那个人的猜测应该再长一点。”
  3. 精炼: 他们更新猜测并再次询问侦探。他们重复这个循环(就像不断完善素描草图一样),直到猜测的结果不再发生变化。

这个过程受到了名为 Buckley-James 估计量的古老统计方法的启发,但不同于进行复杂的数学计算,他们让“超级侦探”(TFM)承担了搞清楚这些缺失时间“应该是多少”的重任。

结果:表现如何?

作者在五个真实世界的数据集(心肌梗死、乳腺癌、重症监护等)上测试了他们的模型,并将其与以下对象进行了对比:

  • 经典模型: 那些需要大量训练的传统“定制建筑师”。
  • 其他零样本(Zero-Shot)方法: 其他无需训练即可使用这些侦探的方法。

研究发现:

  • 排序能力: 他们的这种方法(TabSA-BJ)在排序患者方面表现出色。它能正确判断“患者 A 可能比患者 B 活得更久”,其表现几乎可以媲美那些昂贵的、经过充分训练的模型。
  • 校准度: 虽然在排序方面表现优异,但与通过将时间划分为若干区间(离散化)的方法相比,它在预测特定时间点的精确生存概率方面稍逊一筹。
  • 无需训练: 最大的胜利在于,他们在不需要针对特定数据集重新训练模型的情况下,就取得了这些结果。他们只需输入数据,运行“填补空白”的循环,即可得到结果。

总结

这篇论文表明,我们并不总是需要从头构建一个新模型来预测生存时间。通过使用预训练的“基础模型”作为智能引擎,并利用简单的“猜测与精炼”游戏来处理缺失数据,我们可以获得足以与传统的、经过重度训练的统计模型相竞争的结果。

这就像拥有一位品尝过世间所有菜肴的大厨。你不需要从头教他新食谱,你只需要把食材交给他,并问他:“根据你的经验,这锅炖菜需要煮多久?”然后让他不断调整他的猜测,直到感觉完全正确为止。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →