想象你是一名医生,试图预测患者在确诊后可能存活的时间。这被称为生存分析。棘手之处在于,你往往无法确切知道所有人的答案;有些患者在研究结束前退出,或者在研究结束时仍然存活。这被称为“删失”数据。
为了帮助医生做出决策,我们需要不仅准确而且易于理解(可解释)的模型。如果一个模型是“黑箱”(如复杂的神经网络),医生就无法信任它,因为他们无法看到它做出预测的原因。
本文介绍了一种构建这些预测模型的新方法,即使用生存树。将生存树想象成患者的流程图或“选择你自己的冒险”书籍。你从顶部开始,提出一个问题(例如,“患者的年龄是否超过 60 岁?”),然后沿着路径向下到达一个叶子节点,该节点给出预测结果。
问题:简单的树与复杂的现实
作者解释说,简单、浅层的树易于阅读,但它们往往无法捕捉复杂的医疗现实。要正确捕捉复杂的模式,树通常必须长得非常高大且枝叶繁茂,这使得它难以追踪。
传统上,这些树是使用“贪婪”方法构建的。想象一名徒步者试图通过始终立即采取眼前最陡峭的一步来寻找最高峰。他们可能会被困在小山上,因为他们从未向前看以发现附近更大的山峰。同样,贪婪树做出的局部决策可能会错过全局最佳解决方案。
解决方案:进化更优的特征
本文提出使用遗传编程(GP)来解决这一问题。将 GP 想象成一个数字进化实验室。计算机不是仅仅将原始数据(如“年龄”或“肿瘤大小”)输入树中,而是通过以创造性的方式混合和匹配原始数据,“进化”出新的、更智能的特征。
例如,计算机不仅仅是分别查看“体重”和“身高”,它可能会进化出一个新特征:“体重除以身高平方”(即 BMI)。它通过尝试数百万种组合来实现这一点,保留表现最好的组合,并淘汰其余部分,就像自然选择一样。
本文测试了三种主要策略:
- 带有进化特征的贪婪树:计算机首先进化出智能特征,然后使用这些特征构建标准的“贪婪”树。
- 类比:给徒步者一张带有预先标记小径的更好地图,因此即使他们采取最陡峭的一步,也能走在正确的道路上。
- 带有进化特征的最优树:计算机进化特征,然后使用复杂的数学方法为这些特征找到完美的树结构。
- 类比:给徒步者地图,然后使用超级计算机计算通往顶峰的绝对最佳路线。
- 进化树(新星):计算机同时进化智能特征和树结构。
- 类比:不仅仅是给徒步者一张地图,而是同时进化徒步者的大脑和地图。徒步者学会提出正确的问题,而地图则被绘制得完美契合这些问题。
实验
作者在两件事上测试了这些想法:
- 合成谜题(XOR 问题):他们创造了一个虚假的医疗问题,其中答案只有在以特定的非线性方式组合两个变量时才有意义。
- 结果:标准的贪婪树惨败,因为它无法看到这种组合。只有那些能够进化出复杂的二元“是/否”特征的方法才能解决它。
- 真实医疗数据:他们使用了两个真实的乳腺癌数据集(GBSG 和 METABRIC)。
- 结果:新方法,尤其是进化树,表现与最先进的复杂“黑箱”AI 模型(如 DeepSurv)一样好,但对医生来说仍然易于阅读。
关键要点
- 浅层是好的:如果你给它智能的、进化过的特征作为工作基础,你可以保持树的小巧和易于理解。
- 联合进化是最佳:最有前途的方法是同时进化特征和树结构。这就像训练一个团队,其中球员和战术手册一起进化,而不是先训练球员再编写战术手册。
- 没有“黑箱”:这些模型实现了高精度,而无需依赖限制其他流行医疗模型的严格数学假设。它们是透明的,这意味着医生可以查看树并说:“啊,我明白为什么这位患者属于这个群体了。”
简而言之,本文表明,通过让计算机“进化”出更智能的数据观察方式,我们可以构建既强大到足以保证准确性,又简单到足以让医生信任并使用的医疗预测工具。
技术摘要:利用遗传编程进行可解释生存分析的特征演化与整树演化
1. 问题陈述
生存分析旨在预测特定事件发生的时间,这一任务在医学领域至关重要。主要挑战在于处理删失数据(研究期间未发生事件的病人),同时平衡预测准确性与可解释性。
虽然生存树通过递归划分患者队列提供了固有的可解释性,但它们面临两个主要局限性:
- 复杂度与可解释性的权衡:为了捕捉协变量之间复杂的非线性关系和交互作用,生存树往往需要生长得很深,这损害了其可解释性并增加了过拟合风险。
- 贪婪诱导的局限性:经典的生存树诱导采用贪婪的自顶向下方法,在每个节点选择局部最优的分裂。这往往忽略了全局最优的分裂组合,特别是当真数据分布需要特定的非线性特征组合(例如类 XOR 交互作用)而无法通过简单的单变量分裂捕捉时。
现有的深度学习方法(如 DeepSurv)虽然实现了高准确率,但缺乏可解释性,且通常依赖于限制性较强的 Cox 比例风险假设。相反,符号回归方法(如 CoxKAN)虽然近似神经网络,但仍受限于比例风险假设,且未直接针对生存预测进行优化。
2. 方法论
作者提出并比较了利用遗传编程(GP)增强浅层生存树的策略,具体采用了多目标 GP-GOMEA 算法。该工作扩展了PISA(可解释生存分析流水线)框架。
2.1 核心方法
本研究调查了三种不同的生存树学习策略,所有策略均在多目标优化框架下进行评估(平衡综合 Brier 分数 [IBS] 与模型复杂度):
带有 GP 构建特征(GFC)的贪婪生存树(Greedy ST):
- 利用 GP 演化一组非线性特征(符号表达式)。
- 将这些特征输入到标准的贪婪树诱导算法中。
- 数值型与二值型:系统测试了演化数值型特征(树在局部寻找阈值)和二值型特征(GP 表达式本身代表分裂,例如 x<t)。
- 注:在此设置中,特征构建和树诱导是分开的阶段。
带有 GFC 的最优生存树(Optimal ST):
- 使用动态规划,在给定一组二值输入特征的情况下,寻找可证明最优的树结构。
- GP 演化的特征被约束为二值型(同时包含协变量变换和阈值)。
- 分裂选择基于 Cox 比例风险模型最大化偏似然。
进化生存树(Evolutionary ST):
- 一种新颖的方法,其中整个生存树结构和分裂逻辑在单个 GP 种群中联合演化。
- 表示法:采用多树表示,每个 GP 树对应生存树中的一个特定节点(按广度优先分配)。
- 约束:每个 GP 树被约束为输出二值决策(同时捕捉特征和阈值)。
- 增强:作者引入了GP 树交换(改变基因型中树的顺序)和独特的患者分层初始化策略,以确保初始种群的多样性并避免冗余个体。
2.2 适应度与评估
- 目标:最小化综合 Brier 分数(IBS)并最小化特征/树的复杂度(大小)。
- 复杂度计算:
- 对于 GFC 方法:计算所用唯一特征的大小之和。重复使用的特征只计算一次。
- 对于进化生存树:每次特征复用都单独计数,因为树结构本身是优化的一部分。
- 数据集:
- 合成 XOR 问题:旨在测试捕捉非线性交互作用的能力,其中轴平行分裂会失效。
- GBSG:淋巴结阳性乳腺癌生存数据(内部和外部验证)。
- METABRIC:乳腺癌分子分类数据(内部和外部验证)。
- 基线:与 DeepSurv、CoxKAN、随机生存森林(RSF)和标准 Kaplan-Meier 估计器进行比较。
3. 主要发现
3.1 合成数据(XOR 问题)
- 使用原始特征的标准贪婪树未能对真实情况进行建模。
- 即使提供了正确的预定义数值特征,贪婪树仍然失败,因为贪婪算法基于即时增益选择了次优的根分裂。
- 成功条件:仅当贪婪树被提供正确的二值指示器(非线性交互作用的结果)或使用最优生存树或进化生存树时,才恢复了真实情况。
- 这表明对于复杂的交互作用,要么必须预先构建包含交互逻辑的特征,要么树诱导必须是非贪婪的。
3.2 临床基准(GBSG & METABRIC)
- 性能:使用演化特征(GFC)的生存树显著优于使用原始特征的基线。
- 深度 3 树:GFC 增强的贪婪生存树和进化生存树实现了与最先进的 DeepSurv 和 CoxKAN 相当的 C-index 分数,且无需依赖比例风险假设。
- 最优生存树:表现良好,但在某些配置下计算成本高于进化生存树。
- 特征构建:
- 令人惊讶的是,对于临床数据,仅使用数值算子的 GFC 贪婪生存树的表现与使用二值算子的相当。这表明对于这些特定数据集,与合成 XOR 案例不同,复杂的二值交互作用对于高性能并非严格必要。
- 数值特征允许贪婪算法在局部搜索最优阈值,提供了比在 GP 阶段强制二值分裂更强的表达能力。
- 进化生存树的优势:
- 计算效率:进化生存树训练速度最快(单核深度 3 仅需 45 分钟),而 GFC-贪婪树需要 19 小时,因为它避免了外部的树构建过程。
- 全局优化:它成功诱导了局部次优但有助于全局最优树结构的分裂,这是贪婪方法所缺乏的能力。
- 可解释性:它生成了多个具有良好性能的浅层、可检查的树。
4. 贡献与意义
该论文声称以下贡献和意义:
- 多目标特征构建的验证:研究表明,多目标特征构建是使浅层生存树变得强大的关键。它允许生成帕累托前沿模型,使临床医生能够在复杂度和准确性之间进行选择。
- 新颖的进化生存树:引入的进化生存树联合优化树结构和分裂逻辑,被呈现为“最有前景”的方法。它结合了非贪婪优化的优势与浅层树的可解释性。
- 无比例风险假设的竞争性性能:所提出的方法在真实世界临床数据集上实现了与深度学习基线(DeepSurv, CoxKAN)相当的预测性能,但无需受限于比例风险假设,并具有完全透明的模型。
- 实际可解释性:通过保持树的浅层(深度 2 或 3)并使用符号特征,生成的模型是“固有可检查的”,允许临床医生将预测追溯至具体的患者特征和风险因素。
5. 局限性与未来方向
作者谦逊地指出了当前的局限性:
- 二值特征约束:进化生存树目前要求演化二值特征(协变量 + 阈值组合)。作者建议,一种允许重用具有优化阈值的数值特征的模块化表示,可以在不增加搜索空间复杂度的情况下提供更大的灵活性。
- 资源分配:本研究在所有方法中使用了统一的超参数(种群大小、代数)。由于进化生存树解决了更复杂的问题,未来的工作应调查是否为其分配更多的计算资源会进一步提高性能。
总之,该论文认为,虽然特征构建改进了贪婪树,但整个树结构的联合演化为创建准确、可解释且浅层的生存模型提供了最大的潜力。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。