想象一下你是一位正试图批改一大叠试卷的老师。班上的大多数学生表现都很出色;他们能正确回答简单的问题,并轻松地完成考试。然而,有少数学生在应对某一特定类型的难题时感到吃力。
在计算机科学领域,特别是当教计算机预测**药物相互作用(DDI)**时,这个“班级”就是一份庞大的药物对列表。大多数药物对都是安全的(那些表现优异的学生),只有极少数会对产生危险的副作用(那些棘手的题目)。
长期以来,计算机使用一种标准的评分方法,叫做二元交叉熵(Binary Cross-Entropy)。你可以把它想象成一位对每个学生都一视同仁的老师。计算机对每一个安全的药物对投入的精力,与对待危险药物对的精力是完全一样的。问题在于?计算机会被成千上万个“容易”的安全药物对分散注意力,从而忽略了那些危险的药物对。这就像老师因为那些成绩优异的学生而感到无聊,以至于不再注意到那个举手求助的学生。
新的解决方案:“ClinicalFocal Loss”
研究人员在这篇论文中引入了一种新的评分方法,称为 ClinicalFocal Loss。这种方法不再平等对待每一个学生,而是像一位严格的导师,会说:“我不需要把时间花在那些已经知道答案的学生身上。让我们把所有的精力都集中在那些挣扎中的人身上。”
它是这样运作的,这里有一个简单的类比:
- “容易”的配对(安全药物): 当计算机正确识别出两种药物是安全的时候,新方法会说:“做得好,你答对了,”然后立即跳过。它不再在这些容易取得的胜利上浪费精力。
- “困难”的配对(危险相互作用): 当计算机对一个危险的相互作用犹豫不决时,新方法会说:“这很重要!我们要更加关注这里。”它迫使计算机对那些一直出错的棘手案例投入额外的注意力。
尝试之后发生了什么?
研究人员在了一个大规模的药物相互作用数据集(称为 TWOSIDES)上测试了这种新方法,并将其与旧方法进行了直接对比。他们保持其他所有内容完全一致——计算机的大脑(架构)、它学习的数据以及测试规则。他们改变的仅仅是“评分方法”。
结果是惊人的:
- 漏掉的危险大幅减少: 旧方法会漏掉大约 30% 的危险相互作用(假阴性)。而新方法仅漏掉了 9%。换句话说,它几乎抓住了所有它应该发现的危险药物对。
- 更少的虚假警报: 它也变得更擅长确认安全药物确实是安全的,减少了将安全药物对错误标记为危险的情况。
- 总分: 计算机的整体准确率从约 70% 跳升至 89%。对于机器学习模型来说,这是一个巨大的飞跃。
根据论文,为什么这很重要
论文强调,他们并没有为了获得这些结果而去构建一个更大、更复杂的计算机大脑。他们没有增加新的层,也没有改变模型的结构。他们只是改变了计算机学习的方式。
把它想象成一个跑步者。旧方法就像一个全程以同样速度慢跑的跑步者。新方法则像是一个意识到:“我在平路上已经很快了,所以我可以节省体力。但当我遇到陡坡(困难的药物相互作用)时,我会冲刺。”
核心结论
论文声称,通过使用这种“非对称”的关注方式——即让计算机忽略容易的部分,并痴迷于那些困难且危险的部分——它可以更准确地预测药物相互作用。这在医学领域意义重大,因为在医学中,错过一个危险的相互作用(假阴性)比犯一个小错误要严重得多。新方法使计算机在无需从头重建的情况下,能够更好地发现这些关键的危险。
技术摘要:用于药物相互作用预测的非对称焦点损失(Asymmetric Focal Loss)
问题陈述
同时使用多种药物(多重用药)是一个日益严重的临床挑战,药物不良反应(ADEs)导致了显著的发病率和死亡率。在发生前识别有害的药物-药物相互作用(DDIs)至关重要,然而可能的药物组合数量远超临床试验能够评估的范围。虽然图神经网络(GNNs)已成为建模复杂药物关系的有效工具,但标准的训练目标——通常是二元交叉熵(BCE)——对易分类样本和困难样本分配了相等的学习能力。在大型且不平衡的 DDI 数据集中,这种方法会导致“容易”的样本主导训练目标,从而可能导致模型忽略困难的正向相互作用(即难以预测的真实 DDI)。这对于以安全为导向的应用场景尤为关键,因为漏掉真实的相互作用(假阴性)会产生严重的临床后果。
方法论
作者提出了 ClinicalFocal loss,这是一种非对称焦点目标函数,旨在不改变底层图架构的情况下,改进多关系 DDI 预测。
数据与预处理
- 数据集: 研究使用了 TWOSIDES 基准测试(通过 Decagon 和 Stanford BioSNAP 处理),包含来自 645 种药物的 963 种副作用关系的 4,576,287 个正向相互作用三元组。
- 特征: 药物由 1,024 位 Morgan 指纹(半径为 2)与 200 个 RDKit 理化描述符拼接而成,形成 1,224 维特征向量。
- 负采样: 通过破坏性采样(corruption sampling)创建了一个平衡数据集(1:1 比例),其中正向三元组中的一种药物被随机替换,前提是所得组合不在观测集合中。
- 验证: 采用了五折分层交叉验证,并对所提方法和基线模型使用相同的划分、随机种子(42)和超参数,以确保受控比较。
模型架构
研究采用了 关系感知图卷积网络(R-GCN):
- 编码器(Encoder): 三层 R-GCN 在通过副作用类型边连接的药物节点之间传播消息。它利用基分解(basis decomposition)在不同关系间共享参数,并使用门控循环单元(GRU)更新节点表示。
- 解码器(Decoder): 最终的药物嵌入通过元素级乘积、绝对差值和求和进行组合,然后与副作用关系嵌入拼接。随后通过一个多层感知器(MLP)处理该结果以预测相互作用概率。
- 训练目标: 核心创新在于损失函数。虽然架构与基线保持一致,但训练目标不同:
- 基线: 标准二元交叉熵(BCE)。
- 提议方法(ClinicalFocal): 一种非对称焦点损失,定义为:
L=wr[(αfn(1−p)γfn×y)+(αfppγfp×(1−y))]×CE(p,y)
- 正类(困难样本): 使用强聚焦指数(γfn=2.0)和更高的权重(αfn=0.75),将学习重点集中在困难且易被忽视的相互作用上。
- 负类: 使用较温和的聚焦项(γfp=0.5)和较低的权重(αfp=0.25)。
实验方案
两个模型均使用 AdamW 优化器进行训练,并使用相同的超参数(学习率、权重衰减、批大小 65,536)和早停标准。性能通过准确率(Accuracy)、F1 分数、AUROC、AUCPR 以及类别特定召回率/特异性指标进行评估。
关键结果
集成 ClinicalFocal loss 后,在所有指标上均比 BCE 基线实现了统计学意义上的显著提升(P<0.001):
- 分类性能:
- 准确率: 从 0.699 (BCE) 增加到 0.892(提升了 19.3 个百分点)。
- F1 分数: 从 0.700 提高到 0.894(提升了 19.4 个百分点)。
- AUROC: 从 0.766 增加到 0.914。
- AUCPR: 从 0.714 提高到 0.860。
- 误差减少:
- 假阴性率(漏掉的相互作用)从 29.8% 大幅下降至 9.1%,对观测到的相互作用三元组实现了 90.9% 的召回率。
- 假阳性率从 30.4% 下降至 12.5%,特异性从 69.6% 上升至 87.5%。
- 总分类误差降低了 64.1%(相对降幅)。
- 收敛动态: ClinicalFocal 展示了更优的收敛稳定性,在第 54 个 epoch 时达到 0.82 的验证准确率平台期且波动极小,而 BCE 则收敛于较低的平台(0.71)且具有较高的变异性。
- 概率校准: 提议的模型产生了更清晰的正负预测分离,将正向相互作用集中在高概率模式(>0.65)中,并减少了模糊的中等区间预测。
与现有技术(SOTA)的比较
ClinicalFocal 在所有评估指标(准确率、AUROC、AUCPR、F1)上均优于多种成熟的基于 GNN 和深度学习的 DDI 预测方法,包括 SkipGNN、CASTER、BioBERT 和 KG-DDI。值得注意的是,尽管其使用的架构框架比那些侧重于复杂子结构或知识图谱集成的模型更简单,但它实现了 0.914 的 AUROC,超过了 SkipGNN (0.892) 和 CASTER (0.856)。
意义与主张
论文指出,损失函数的设计是一个直接且可调的杠杆,能够有效提升基于图的 DDI 预测性能,其效果往往不亚于架构创新。
- 面向安全的优化: 通过非对称地强调困难的正向样本,ClinicalFocal 显著降低了假阴性率,这对于多重用药筛查中的患者安全至关重要。
- 架构无关性: 该方法无需修改底层的图编码器或特征表示,即可实现显著的性能提升,使其能够轻松兼容现有的基于 GNN 的 DDI 模型。
- 高效性: 该方法仅需调整焦点损失参数(α 和 γ),即可提供具有竞争力的或更优的性能,且不会增加额外的计算复杂度。
- 临床相关性: 改进的概率校准和清晰的决策边界表明,该模型能产生适用于临床决策支持系统的可操作预测,通过过滤掉不确定案例来减轻临床医生的认知负担。
作者总结道,虽然仍需外部验证和校准评估,但本研究证明了通过在损失层面解决类别不平衡问题,可以成为提升 DDI 预测性能的主导因素。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。