← 最新论文
💻 computer science

SHIFT: Survival Prediction from Incomplete and Heterogeneous Genomic Data

本文介绍了 SHIFT,一种具备缺失值感知能力的 Transformer 模型,该模型通过直接处理不完整的特征输入,而无需进行插补或将分析限制在共有基因上,从而实现了在异构基因组数据集上稳健的生存预测。

原作者: Muhammet Sami Yavuz, Ayhan Can Erdur, Sabri Mustafa Kahya, Benedikt Wiestler, Jana Lipkova

发布于 2026-07-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Muhammet Sami Yavuz, Ayhan Can Erdur, Sabri Mustafa Kahya, Benedikt Wiestler, Jana Lipkova

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图根据患者的遗传“指纹”来预测他们的寿命。通常情况下,医生和科学家面临着一个巨大的难题:每家医院使用的基因检测套件都不一样。一家医院可能会检测 200 个基因,而另一家可能只检测 20 个。这就像是尝试按照一份列有 200 种配料的食谱来烤蛋糕,但你当地的杂货店只卖其中的 20 种。

长期以来,科学家们尝试通过两种方式来解决这个问题:要么丢弃那些没有凑齐 200 种配料的患者(从而损失了宝贵的数据),要么去猜测那些缺失的配料可能是什么(即“插补”)。但猜测是有风险的;如果你猜错了调料,蛋糕的味道就会很糟糕,你的预测也会出错。

于是有了 SHIFT,一种全新的 AI 模型,它扮演着一位超级灵活的大厨。它不需要完整的 200 种配料才能开始烹饪,而是可以观察厨房里现有的任何配料,并立即做出出色的预测。它并不去猜测缺失的部分,而是专注于已有的内容。

魔法技巧:“缺失”遮罩

把 SHIFT 想象成一个戴着特殊眼镜的侦探。当侦探观察患者的基因数据时,如果某个基因缺失了(因为医院没有进行检测),眼镜就会直接将那个位置涂黑。侦探会忽略这些黑点,仅利用可见的线索来破解谜题。

研究表明,这位侦探非常聪明。在针对两种癌症——胶质母细胞瘤(一种脑癌)和肺鳞状细胞癌——的测试中,当所有数据都完美无缺时,SHIFT 的表现与最优秀的传统方法不相上下。但是,当数据变得混乱且缺失大量信息时(例如在肺癌研究中,有一组患者缺失了 175 出 197 个基因,即 88.8% 的数据!),SHIFT 并没有踉跄倒下。

其他方法试图通过猜测(例如根据邻近的数据来猜测缺失的基因)来“填补空白”,而 SHIFT 则只是利用它拥有的真实数据。在肺癌测试中,SHIFT 在从未进行过任何一次猜测的情况下,就达到了与最佳猜测方法相当的表现。

通过“蒙眼”进行训练

这个侦探是如何变得如此擅长忽略缺失线索的呢?作者使用了一种被称为**变量率遮罩(Variable-Rate Masking, VRM)**的巧妙训练技巧。

想象一下,你正在为一个学生进行数学考试训练。通常,你会给他们一份完整的练习卷。但在 VRM 模式下,老师会在每道练习题中随机遮住不同的数字。有时他们遮住一个数字,有时则遮住半页纸。学生学会了利用剩余可见的数字来解题。

论文指出,这种“蒙眼”训练让模型变得更加强韧。即使模型稍后在面对一份没有任何缺失数据的完整练习卷时,它的表现也比那些没有经过“蒙眼”训练的模型更好。这就像是一个通过缺失数字进行练习的学生,由于逻辑能力得到了极大的锻炼,即使在所有数字都齐全的情况下也能轻松应对考试。

“不完整”的队友

这里还有另一个令人惊讶的发现:你不必踢走那些数据不完整的数据。

在研究中,研究人员尝试将一组仅检测了 22 个基因(在通常的 197 个之外)的患者加入到训练组合中。通常情况下,科学家会因为这些数据“过于不完整”而将其丢弃。但论文表明,当你使用 SHIFT 时,你实际上可以利用这组不完整的数据来帮助模型学习。

当我们将这 102 名数据有限的患者加入训练时,模型对另一组完全不同的患者(CPTAC 队列)的预测变得略微精准了。作者认为,即使是“半空”的数据集,只要模型知道如何处理缺失的部分,也能教会模型一些有用的知识。

这并不意味着什么

了解这篇论文没有表达什么意思非常重要。

  • 它并没有说 SHIFT 是治疗癌症的灵丹妙药。它只能预测生存风险。
  • 它并没有说这适用于所有类型的癌症。作者仅在脑癌和肺癌上进行了测试。
  • 它并没有说你应该停止使用其他方法。论文建议 SHIFT 是一个强有力的替代方案,尤其是在数据混乱时,但也承认需要在不同疾病上进行更多测试。
  • 它并不声称“猜测”(插补)总是错误的。它只是表明,当缺失的数据规模巨大且具有结构性特征时(例如整个基因组的一个部分从未被检测过),猜测不如直接使用现有数据可靠。

底线

这篇论文表明,我们可以构建一个单一且智能的 AI 模型,使其能够跨越不同的医院工作,即使这些医院使用的是不同的基因检测套件。通过教导模型去忽略缺失数据而不是去猜测,并通过“蒙眼”训练使其更加强韧,我们可以将更多的患者纳入研究,并获得更好的预测。这是向着实现精准医疗迈出的一步,让精准医疗惠及每一个人,而不只是那些幸运地拥有完美基因检测套件的人。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →