Tabular Foundation Models Can Do Survival Analysis
本文表明,通过将生存分析重新表述为一系列旨在处理删失数据的二分类问题(该方法直接对累积失效概率进行建模),表格基础模型可以有效地执行生存分析,并在 48 个真实世界数据集上经验性地优于现有的基准模型。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你是一名试图破解谜题的侦探,这个谜题是:“事件何时会发生?”在数据科学的世界里,这被称为生存分析(survival analysis)。它不仅仅是在预测是否会发生某事——比如灯泡是否会烧坏——而是在预测它何时会发生。这在医学领域(预测患者何时可能复发)、工程领域(弄清楚机器零件何时失效)甚至商业领域(猜测客户何时可能流失)都至关重要。
然而,这个谜题中有一个棘手的转折:删失(censoring)。想象你在观察一场比赛,但一些选手在跨越终点线之前就退出了体育场。你知道他们离开时仍在奔跑,但你不知道他们何时会到达终点。在数据术语中,这就是“右删失(right-censoring)”。对于这些人来说,事件尚未发生,或者我们失去了对他们的追踪。传统的数学工具通常难以处理这种缺失的信息,通常需要为每一个新问题从头构建复杂的特殊公式。
于是,**表格基础模型(Tabular Foundation Models, TFMs)**登场了。把它们想象成超级聪明的、经过预训练的侦探。它们已经阅读了数百万份不同的“案卷”(数据集),涵盖了从房价到天气模式的一切内容。它们是识别表格数字中模式的专家,无需为每一个新的谜题进行重新训练。科学家们一直在问的一个大问题是:这些通用的侦探能否在不需要专门修读“生存分析学位”的情况下,解决这个“删失”之谜?
这篇论文的核心思想:将谜题转化为一系列“是/否”问题
来自伦敦帝国理工学院的研究人员决定尝试一个聪明的技巧。他们并没有要求这位超级聪明的侦探去猜测事件发生的精确时间(这在时钟可能提前停止的情况下很难),而是重新表述了整个问题。他们将复杂的“何时发生?”问题转化为了一个简单的**“是/否”问题系列**。
想象你在问一位朋友:“电影会在下午5点前结束吗?”然后问:“会在6点前结束吗?”接着问:“会在7点前结束吗?”如果你能正确回答这些简单的问题,你就能推断出整个时间线。
作者将这个想法应用到了生存数据中。他们将时间线切分成许多小的、离散的块(就像切面包片一样)。对于每一个时间片,他们都会向模型提出一个二元问题:“事件是否已在此时间点之前发生?”
- 是: 事件已经发生。
- 否: 事件尚未发生。
神奇之处在于:如果数据是“删失”的(比如跑者退出了体育场),模型只需将未来的问题视为“缺失标签”。它不会感到困惑;它只会忽略跑者离开之后的时间段问题。这使得模型能够利用其标准的“是/否”训练技能来解决生存问题,而无需任何特殊的生存分析专项训练。
他们的发现:使用“累积”技巧效果最好
团队在 48 个真实世界的数据集(43 个静态数据集和 5 个信息随时间变化的动态数据集)上测试了这个想法。他们将自己的方法与“老派专家”(如 Cox 模型)以及“新派深度学习模型”(如 DeepHit)进行了对比。
以下是他们的发现:
- “是/否”方法胜出: 当他们使用简单的“是否已经发生?”(他们称之为累积失效建模,Cumulative Failure modeling)这一问题时,他们现成的表格基础模型(特别是名为 MITRA 的模型)的表现几乎超越了其他所有模型。它是所有数据集中的平均表现最佳者。
- 传统方法存在缺陷: 还有另一种提问方式:“事件是否恰好发生在这一特定的时间片内?”(这被称为建模离散风险,Discrete Hazard)。论文发现,虽然这种方法在某些时间片表现尚可,但随着增加更多时间片,它就会崩溃。为什么呢?因为在猜测第一个时间片时产生的微小误差会不断累乘并恶化,就像玩“传声筒”游戏一样,信息会变得越来越混乱。而“累积”方法通过观察截至该点的整体情况避免了这一点,使其更加稳健。
- 无需训练: 最棒的部分是?他们不需要重新训练模型。他们只需将数据输入,模型就能利用其现有的“上下文学习”能力立即解决问题。这就像把一份预训练好的侦探交给一个新案卷,由于他们已经了解游戏规则,因此能瞬间破案。
证明与局限性
作者不仅是凭直觉猜测;他们从数学上证明了,如果你拥有足够的数据,最小化这些简单的“是/否”问题的误差,将会引导你得到真实的生存概率。他们展示了所测试的模型确实随着数据集的增加而在提高预测概率的能力。
然而,他们也谨慎地指出了局限性。这种方法依赖于一个假设,即“退出者”(删失)是随机的,并且与事件本身无关。如果那些退出体育场的跑者其实是那些因伤隐瞒了情况、且原本会在最后才到达终点的人,那么模型可能会产生困惑。论文还指出,将连续时间转化为切片(离散化)会损失一点精度,但这种权衡是非常值得的,因为它带来了巨大的准确性和速度提升。
最终,这篇论文表明,我们并不需要为每个生存问题都构建一个全新的、专门化的“大脑”。有时,解决复杂的“何时”谜题的最佳方式,仅仅是提出一系列简单的“是或否”问题,让我们的预训练 AI 侦探来承担繁重的任务。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。