想象一下,你正在设计一把定制钥匙(抗体),使其能完美契合特定的锁(抗原)以打开一扇门。这把钥匙最关键的部分是位于最尖端的“齿”,即CDR 环。如果这些齿的形状正确,钥匙就能转动;否则,它就毫无用处。
长期以来,计算机在设计这些齿时一直犯着一个非常具体的错误。它们反复猜测相同的几种形状,而忽视了自然界实际使用的庞大形状多样性。本文介绍了一种名为EvoStruct的新方法来解决这一问题。
以下是他们如何修复这一问题的故事,借助了一些简单的类比:
问题:“无聊的厨师”与“微型图书馆”
将旧的计算机方法(称为图神经网络 GNN)想象成一位在狭小厨房工作的无聊厨师。
- 微型图书馆:这位厨师只能访问一本包含约 3,000 种食谱的小烹饪书(即抗体 - 抗原对的有限结构数据)。
- 错误:由于图书馆太小,厨师不敢尝试新事物。他们注意到“酪氨酸”和“甘氨酸”(两种特定成分)在他们拥有的少数食谱中出现频率很高,于是开始在每一道菜中都放入这两种成分。
- 结果:厨师忽视了那些稀有但至关重要的成分(如色氨酸或半胱氨酸),而这些成分实际上是钥匙发挥作用所必需的。用本文的术语来说,这被称为**“词汇坍塌”**。计算机不再预测多样化的氨基酸集合,而只是重复那几种,导致抗体的有效性降低。
解决方案:拥有“魔法窗户”的“主厨”
作者们意识到,虽然“厨房”(结构数据)很小,但存在一个巨大的“图书馆”,其中包含数百万种蛋白质食谱的进化历史。他们构建了EvoStruct,以结合两者的最佳之处。
- 主厨(预训练语言模型 PLM):他们使用了一个名为ESM-2的预训练 AI 模型。将其想象为一位阅读过数亿种蛋白质食谱的主厨。这位厨师确切知道每种成分应该使用的频率,并深刻理解自然的“风味规则”。
- 魔法窗户(适配器):问题在于,主厨并不知道当前特定的“锁”(抗原)长什么样。因此,他们在主厨与锁的三维结构之间建立了一个魔法窗户(交叉注意力适配器)。
- 工作原理:
- 主厨基于数百万年的进化,对钥匙的“齿”应该是什么样子有一个强烈的概念。
- 魔法窗户让厨师得以窥视锁的三维形状。
- 厨师说:“好的,我知道规则,但看着这个特定的锁,我应该稍微调整我的设计。”
- 关键在于,厨师永远不会忘记他们已经知道的数百万种食谱。他们只是根据新的视觉信息调整计划。
为何这很重要
以前的方法试图仅利用那本微型图书馆从头开始学习一切。它们最终产生了一种缺乏多样性的“无聊”设计。
EvoStruct就像赋予了设计者一种超能力:
- 更多样性:EvoStruct 不再仅使用两种成分,而是使用多样化的混合,其多样性比旧方法高出2.3 倍。
- 更高的准确性:因为它尊重蛋白质化学的自然规则,其设计正确的概率比最佳的前代方法高出16%。
- 更低的困惑度:论文中提到了“困惑度”(衡量模型困惑程度的指标)。EvoStruct 的困惑度降低了43%,意味着它对预测结果更加自信。
不足之处
论文承认,虽然 EvoStruct 在设计序列(成分列表)方面非常出色,但在预测钥匙如何物理上锁入门方面并不完美。另一种完全忽略锁的方法在物理“锁合”测试中实际上表现略好。这表明,虽然“主厨”完美地掌握了成分,但“魔法窗户”在将锁的三维形状转化为最终设计方面仍需改进。
总结
EvoStruct阻止了计算机反复猜测相同的几种氨基酸。它通过让一个超级智能的 AI(在数百万种蛋白质上训练过)观察目标的三维形状,并说“我知道自然的规则,而这就是我将它们应用于这个特定形状的方式”来实现这一目标。其结果是,设计抗体关键部分的方法变得更加多样、准确和可靠。
技术摘要:EvoStruct
问题:基于图神经网络(GNN)的互补决定区(CDR)设计中的词汇崩溃
当前设计抗体互补决定区(CDR)的最先进方法严重依赖等变图神经网络(GNN)。尽管这些方法实现了较高的序列恢复率,但它们存在一种被称为“词汇崩溃”的关键失效模式。在这种现象中,在有限的结构数据(约 3,000 个抗体 - 抗原复合物)上训练的模型未能学习氨基酸的完整分布。相反,它们过度预测狭窄的残基子集——具体为酪氨酸和甘氨酸——而忽略了功能关键但罕见的残基,如色氨酸、半胱氨酸和甲硫氨酸。
这种崩溃发生的原因是,GNN 编码器试图从稀疏的结构训练集中从头学习氨基酸替换模式,从而丢弃了编码在包含数亿蛋白质序列的数据库中的丰富进化替换模式。因此,这些模型表现出:
- 多样性降低:有效词汇量(Veff)从天然的约 15.5 降至 3.0–5.5。
- 结合对学习不佳:模型未能捕捉到互补位(抗体)和表位(抗原)氨基酸对之间的特定相关性。
- 接触位置薄弱:与抗原接触位置的序列恢复率显著低于非接触位置,表明未能学习抗原特异性的结合物理机制。
方法论:弥合进化与结构先验
为了解决这些问题,作者提出了EvoStruct,这是一个通过交叉注意力适配器将冻结的蛋白质语言模型(PLM)与 3D 结构上下文相连接框架。该架构在两条并行路径上运行:
- 进化路径(PLM 骨干):模型利用冻结的 ESM-2(6.5 亿参数)生成抗体重链的嵌入表示。通过在推理过程中屏蔽 CDR 位置,ESM-2 提供高质量的进化先验,并基于其在超过 2.5 亿条序列上的训练,提供校准过的氨基酸词汇表。
- 结构路径(GNN 编码器):一个关系感知的 E(3) 等变 GNN 编码完整的 3D 抗体 - 抗原复合物图。它捕捉空间几何、残基相互作用和表位邻近性。为了管理内存,GNN 将抗原上下文裁剪为距离 CDR 最近的 Kag 个残基。
- 微型结构适配器:这是核心创新。它执行交叉注意力,其中:
- 查询(Q):源自 ESM-2 的 CDR 嵌入(进化先验)。
- 键(K)和值(V):源自 GNN 编码的结构上下文(CDR + 裁剪后的抗原残基)。
- 适配器将这些投影到共享空间,使进化表示能够查询“我处于什么样的结构环境中?”并接收 GNN 的结构答案。输出被投影回 ESM-2 嵌入空间。
- 序列头:最终预测由完全在 PLM 嵌入空间内运行的序列头完成,从而保留 ESM-2 的词汇校准。
训练策略
EvoStruct 采用特定的训练方案,以防止在适应结构任务时灾难性地遗忘进化先验:
- 渐进式解冻:遵循 Howard & Ruder (2018) 的方法,ESM-2 骨干最初保持冻结,同时训练适配器和 GNN。随后的阶段逐步解冻顶层 Transformer 层,最后微调所有参数。
- R-Drop 一致性正则化:为了确保对 Dropout 变化的鲁棒性,模型使用不同的 Dropout 掩码执行两次前向传播,并惩罚由此产生的序列损失之间的不一致性。
- 多任务损失:目标函数结合了序列交叉熵、坐标损失(Huber)、配对对比损失(InfoNCE)、对接损失和阴影互补位损失(成对距离监督)。
主要贡献
- 定量诊断:本文利用有效词汇量(Veff)和结合对相关性指标,系统地分析了 CDR 设计中的词汇崩溃,揭示了 GNN 方法仅能恢复 20–35% 的天然氨基酸多样性。
- 新颖的适配:它将 PLM-结构桥接范式专门适配于 CDR 设计,引入了渐进式解冻和 R-Drop 正则化,以解决该领域独特的多样性 - 准确性权衡问题。
- 实证验证:该研究证明,PLM 词汇校准可以成功转移到 CDR 设计中,打破了传统上高准确性通常以低多样性为代价的权衡。
结果
在CHIMERA-BENCH基准上针对 11 个基线(包括 GNN、扩散模型和自回归方法)进行评估,EvoStruct 实现了:
- 最高的序列恢复率:0.43 的氨基酸恢复率(AAR),比最佳 GNN 基线(0.37)相对提高了 16%。
- 最低的平均困惑度:1.88(相比 RAAD 降低了 43%),表明预测更加自信且经过校准。
- 恢复的多样性:实现了 12.4 的有效词汇量(Veff),恢复了 80% 的天然多样性,而 GNN 基线仅为 4.7–5.3。它生成的氨基酸多样性提高了 2.3 倍。
- 改善的结合相关性:实现了最高的互补位 - 表位对相关性(r=0.73)和界面富集相关性(r=0.81),表明抗原信息成功路由到了序列头。
- 结构质量:生成的 CDR 骨架均方根偏差(RMSD)为 1.84 Å,与顶级 GNN 方法相当。
意义与局限性
本文声称,EvoStruct 解决了 GNN 未能利用进化先验的系统性失败,证明了将冻结的 PLM 与结构编码器相结合是抗体设计的有效策略。它确立了像 ESM-2 这样的模型的词汇校准可以转移到 CDR 设计中,使模型能够同时实现高准确性和高多样性。
然而,作者对结合指标持谨慎态度。虽然 EvoStruct 在序列质量方面领先,但它并未实现最高的结合界面指标(例如 $fnat$ 和 DockQ);值得注意的是,RefineGNN(未以抗原为条件)实现了略高的结合分数。作者将此归因于交叉注意力适配器未能充分利用抗原结构信息进行界面预测,并指出接触位置的恢复仍然是所有方法的挑战。他们建议未来的工作应探索更丰富的适配器架构和替代目标,以进一步改善抗原特异性的结合预测。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。