← 最新论文
📊 statistics

Extending Deep Cox Survival Models with Case-Cohort risk set Sampling

本文引入并评估了首次将病例-队列风险集采样(case-cohort risk-set sampling)集成到深度 Cox 比例风险神经网络中,证明了虽然嵌套病例对照采样能始终近似全风险集性能,但小批量训练使得病例-队列采样能够以显著的计算节省实现相当的准确度。

原作者: Justine Nasejje, Michael P. Falk, Marvin N. Wright, Wende Clarence Safari, Pierre-Philippe Dechant, Raeesa Manjoo Docrat, Rukia Nuermaimaiti

发布于 2026-09-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Justine Nasejje, Michael P. Falk, Marvin N. Wright, Wende Clarence Safari, Pierre-Philippe Dechant, Raeesa Manjoo Docrat, Rukia Nuermaimaiti

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在医学研究和工程领域,预测某事何时会发生,往往比知道它确切何时发生更有价值。无论是机器零件失效,还是患者从疾病中康复,科学家们都使用一种称为生存分析的方法来研究事件发生的时间。该领域的一个主要挑战是,研究结束时,并非所有受试者都经历了该事件;有些人仍在研究结束时仍然存活,或者机器仍在运行。这被称为右删失数据(right-censored data),它需要特殊的统计工具来处理这些不完整的信息,而不至于丢弃现有的宝贵数据。几十年来,这一领域的标准工具是一个通过计算在任何给定时刻仍处于风险中的人群(即风险集)的风险模型。

随着数据规模的爆炸式增长,现代研究追踪着数以千计的患者和数百万个数据点,这些传统的计算已成为瓶颈。为了处理数据,计算机必须在每次事件发生时,都要查看研究中仍处于活跃状态的每一个人,这个过程对计算能力和内存提出了极高的要求。这为使用现代强大的人工智能技术制造了障碍,因为这类技术虽然擅长处理大规模数据集,却难以应对这种沉重且重复性的计算。研究人员现在正在探究,如何在保持这些先进模型准确性的同时,使其速度足以应对二十一世纪的大规模数据集。

来自南非、德国和英国的大学研究团队通过测试一种新的训练深度神经网络的方法解决了这一问题,深度神经网络是一种旨在发现数据中复杂模式的人工智能。他们的目标是观察是否可以通过不一次性观察研究中的每一个人,而是观察一个精心挑选的样本,来加速训练过程。他们比较了两种不同的抽样策略:一种是每次针对每个事件挑选一些新的人员进行对比;另一种是在研究开始时挑选一个固定的群体并一直沿用。他们在计算机生成的已知真实答案的数据集以及一个真实的乳腺癌患者数据集上测试了这些方法,测量了模型的生存预测能力以及所需的计算机内存和时间。

研究人员发现,被称为嵌套病例对照抽样(nested case-control sampling)的方法——即为每个事件挑选一组新鲜的人群——几乎表现完美。无论他们使用的是整个数据集还是仅使用一小部分样本,这种方法产生的预测结果都与那种观察所有人的缓慢、沉重的传统方法几乎完全一致。模型学习到了正确的模式,且预测精度与标准方法相当,但无需承担巨大的计算成本。这表明,对于许多大规模问题,研究人员可以安全地使用这种抽样技巧,在不损失任何预测能力的情况下大幅提升模型运行速度。

第二种方法被称为病例队列抽样(case-cohort sampling),其表现则呈现出更为复杂的情况。当研究人员使用一个非常小的固定群体来代表整个研究时,模型的表现显著下降。在针对极小群体的测试中,模型区分高风险和低风险患者的能力大幅下降,预测变得不可靠。然而,研究人员发现,计算机处理数据的方式改变了一切。当他们从一次性处理整个数据集切换到以小规模、快速批次的形式处理时,小规模固定群体的表现得到了显著改善。通过这种更快的处理方式,即使是一个很小的群体也能帮助模型进行有效学习,在节省大量计算资源的同时,恢复了大部分的准确性。

该研究还观察了这些方法如何影响计算机本身。传统的全量数据处理方式需要巨大的内存,通常达到六个吉字节(GB)或更多,这会导致标准计算机崩溃。通过切换到批处理方式,内存占用降至不到零点五个吉字节,使得这些先进模型可以在更小的机器上运行。研究人员观察到,虽然小规模固定群体法在计算机观察全局数据时表现不稳定,但批处理方法平滑了误差,使模型能够稳定学习。这种样本规模与数据处理方式之间的权衡,为科学家提供了一个全新的工具箱:他们可以选择使用一种始终稳健的方法,或者如果愿意调整计算机处理数据的方式,则可以使用更小、更快速的方法。

最终,这项工作架起了经典统计学与现代人工智能之间的桥梁。它表明,分析生存数据所需的繁重工作并不一定非要通过在每一个时刻观察研究中的每一个人来完成。通过使用智能抽样技术,特别是结合现代训练方法,研究人员可以构建既强大又高效的模型。研究结果表明,对于未来的生存分析而言,关键不仅在于拥有更多的数据,还在于知道如何以一种既尊重计算机限制,又能保留数字中所隐藏的真相的方式去观察数据。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →