Transfer Learning and Machine Learning for Training Five Year Survival Prognostic Models in Early Breast Cancer
本研究表明,与标准 PREDICT v3 工具相比,迁移学习、从头机器学习以及集成整合显著提高了早期乳腺癌五年生存预后模型的校准度和鲁棒性,尤其是在涉及临床数据缺失或数据集偏移的情景下。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
每年,全球都有数百万女性被诊断出患有早期乳腺癌。在这一阶段,疾病尚未扩散到乳房或附近的淋巴结,这为多种治疗方案打开了大门。医生必须决定患者是仅需要手术,还是还需要放射治疗、化疗或激素疗法。为了做出这些艰难的选择,临床医生依赖于预后工具——即通过数学模型来估算患者在诊断后五年内的生存概率。这些评估有助于医生和患者权衡积极治疗的益处与副作用的风险。几十年来,最易获得的工具是基于标准临床信息的:肿瘤的大小、患者的年龄以及癌细胞在显微镜下的形态。虽然存在更新、更昂贵的基因检测,但这些更简单、更古老的工具仍然至关重要,因为它们广泛可用且价格低廉。然而,这些传统的工具是基于特定人群的数据构建的,在应用于不同人群或信息缺失时,有时会表现得力不从心。
在最近的一项研究中,研究人员试图看看现代计算机科学是否能为这些经典工具注入新的生命力。他们专注于一个特定的挑战:如何在一个成熟的生存模型基础上,将其适配到一个新的患者群体,而无需从头开始重建整个系统。他们还探讨了新型计算机算法(即机器学习)是否可以直接从患者记录中学习,从而做出更好的预测。团队比较了三种不同的方法:直接使用旧模型、调整旧模型以适应新数据,以及从零开始训练全新的计算机程序。他们的目标是观察哪种方法能为早期乳腺癌患者提供最准确、最可靠的生存评估,特别是在患者记录中存在部分信息缺失的情况下。
研究人员首先使用了名为 MA.27 的大型临床试验数据,该试验追踪了数千名绝经后激素阳性乳腺癌患者。他们希望预测哪些人能在五年内生存且癌症不会复发。首先,他们测试了一个名为 PREDICT 的知名工具,该工具是在英国的数据上训练而成的。当他们将该工具应用于 MA.27 试验中的美国和加拿大女性时,它虽然有效,但并不完美。由于该工具需要特定的细节(例如阳性淋巴结的具体数量或肿瘤的精确大小),而这些细节在试验数据中缺失或记录方式不同,导致该工具无法为近四分之一的患者提供预测。即使对于能够做出预测的患者,该工具的评估也往往略有偏差,经常低估了女性的生存率。
为了解决这个问题,团队尝试了一种称为“迁移学习”的技术。想象一位音乐家已经精通了小提琴,然后开始学习中提琴;他们并不是从零开始,而是利用已有的技能去适应新乐器。类似地,研究人员提取了预训练的 PREDICT 模型,并对其内部设置进行了“微调”,以匹配 MA.27 数据中的特定模式。这个过程通过调整模型的参数来拟合新群体,极大地提高了预测的准确性。然而,与原始工具一样,经过微调的模型仍然无法为大约 24% 的患者提供生存评估,因为它仍然依赖于那些在记录中缺失的特定数据点。相比之下,新的机器学习模型则可以为所有人进行生存预测,无论信息是否缺失。
团队还利用 MA.27 的数据从头开始训练了全新的计算机模型。这些模型采用了擅长发现复杂数据模式的方法构建,并不依赖于旧有的基于英国的规则。相反,它们直接从美国和加拿大的患者数据中学习。其中一个新模型表现得与微调版本一样出色,而另一个则展现出了略有不同的优势。至关重要的是,这些新模型能够自然地处理缺失信息。与原始工具在单个数据项缺失时就会停止工作不同,这些新的计算机程序可以通过利用现有可用信息来进行预测。这在现实世界的医学实践中是一个显著的优势,因为患者的记录往往是不完整的。
最后,研究人员将所有这些方法的优势结合在一起,构建了一个单一的“集成”模型。该系统获取微调工具和新计算机模型的预测结果,并将它们融合在一起,以创建一个最终的统一评估。这种结合的方法证明了其稳健性,既具备了微调工具的可靠性,又具备了新算法的灵活性。当团队在来自不同临床试验的另一组患者身上测试这些改进后的模型时,结果褒贬不一。这些改进在来自美国的大型数据集上得到了证实,证明了模型可以推广到相似的人群。然而,当应用于涉及欧洲和亚洲患者的多国试验时,改进的效果并不明显,且原始的预训练模型在那个特定队列中的表现实际上优于经过适配的版本,这表明模型在面对差异巨大的患者群体时仍需进行仔细的适配。
研究结论指出,虽然传统工具很有价值,但可以通过现代技术得到显著增强。通过对现有模型进行微调或在本地数据上进行训练,医生可以获得更准确的生存评估,即使在患者记录不完善的情况下也是如此。研究强调,患者年龄、受影响的淋巴结数量、肿瘤分级和肿瘤大小是预测生存率最重要的因素,这一发现在这所有不同的模型中都保持了一致。最终,这项工作表明,我们不需要放弃已建立的工具来提升患者护理水平。相反,通过使用智能计算机方法将这些工具适配到新场景中,我们可以为面临乳腺癌的女性提供更个性化、更可靠的指导,确保她们的治疗决策是基于最优质的信息做出的。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。