生命取决于分子之间持续且复杂的对话。蛋白质作为生物界的劳模,很少单独行动;它们必须相互寻找、紧密结合,并形成复杂的机器,以执行诸如对抗感染或在细胞间传递信号等任务。为了理解这些生物机器如何运作,科学家需要观察它们的三维形状。虽然近年来预测单个蛋白质的形状已变得异常准确,但预测两个不同蛋白质如何相互契合仍然是一个巨大的挑战。可能性的空间是巨大的,而它们结合的正确方式往往隐藏在数百万个错误的猜测之中。如果没有这些伙伴关系的清晰图像,设计新药或工程化更好的抗体将变成一个盲目的试错过程。
一个研究小组开发了一种名为 EnsPlex 的新策略来解决这个特定的谜题。他们并没有依赖单一的方法来猜测蛋白质复合物的形状,而是结合了多种不同的方法来撒下更广的网。想象一下试图在黑暗的房间里寻找一把丢失的钥匙;只用一支手电筒可能会错过那个位置,但从不同角度使用四支手电筒会增加找到它的机会。研究人员使用了四种不同的计算工具来生成数千种可能的蛋白质对形状。其中一种以速度著称的工具可以直接从基因序列预测结构。另一种则使用更传统的基于物理的方法,来模拟蛋白质可能如何碰撞并粘在一起。通过同时运行这四种工具,该团队确保了他们覆盖的潜在形状范围比任何单一工具单独能实现的都要广泛得多。
然而,生成许多猜测只是成功的一半;真正的困难在于从数千个错误的猜测中识别出那一个正确的形状。这四种工具中的每一种都有自己的内部评分系统来对其猜测进行排名,但这些评分彼此并不兼容。一个工具的高分并不意味着另一个工具的高分具有相同的含义。为了解决这个问题,研究人员训练了一个名为 FACET 的新型人工智能模型,充当一个通用的裁判。该模型学会了观察蛋白质界面的几何细节——即两个蛋白质接触的具体点——并预测它们的契合程度,无论该形状最初是由哪种工具生成的。它有效地将四种工具的不同语言转化为一个统一且可靠的排名系统。
该团队在涉及抗体及其靶向抗原的 102 个具有挑战性的案例上测试了这个组合系统,这些案例因其灵活性而被称为极难预测。当他们将新系统的结果与在匹配输出预算下的 AlphaFold3 及其内置排名进行比较时,发现有了显著的提升。与单独使用内置排名的 AlphaFold3 相比,这种新方法成功识别出正确结构的靶标数量最多增加了 27.8%。研究表明,不同的工具经常能找到其他工具错过的正确形状,而新的评判模型对于发现这些隐藏的成功至关重要。研究人员证明,他们的这种方法不仅在用于训练的特定数据上有效,在完全未见的全新数据集上也同样有效,证明了其泛化能力。
研究结果表明,蛋白质结构预测的未来不在于构建一个单一、完美的工具,而在于整合多个不完美的工具。通过将多样化的采样方式与智能且统一的选择方式相结合,科学家可以更有效地应对蛋白质相互作用的复杂性。这种方法并不声称已经解决了该领域的每一个问题,但它为处理最困难的情况提供了一个稳健的框架。这项工作强调,在探索生命分子机器的过程中,方法的多元化和选择的精准性同样重要。
技术摘要:EnsPlex
问题陈述
蛋白质复合物结构预测面临着双重挑战:一是生成足够广泛的候选构象集以包含近原生结构,二是能否在有限的输出预算内有效识别出这些准确的模型。现有方法通常将这两个阶段孤立对待。端到端模型(如 AlphaFold-Multimer、AlphaFold3、Bolz-1)和分子对接工作流(如 HADDOCK)侧重于候选生成,但依赖于性质各异且未经校准的内部评分函数,难以一致地对准确模型进行排序。相反,质量评估模型通常对来自单一来源的预定义池进行重排序,未能解决不同生成器之间需要互补采样的需求。这在抗原-抗体系统中尤为关键,因为弱共进化信号和柔性界面使得任何单一方法都难以同时提供广泛的覆盖范围和高置信度的选择。
方法论
作者提出了 EnsPlex(用于蛋白质-蛋白质相互作用复合物结构预测的集成源采样与选择框架),这是一个将多源结构采样与拓扑感知候选选择机制相结合的统一框架。该工作流由三个连续阶段组成:
多源结构采样:
- 生成器: 该框架通过四个不同的来源独立生成候选结构:
- AlphaFold-Multifer、AlphaFold3 和 Boltz-1: 从序列生成结构的端到端深度学习模型。
- 构象扩展对接: 一个涉及通过短分子动力学模拟扩展单体系综,随后进行带有界面约束的柔性 HADDOCK 对接的工作流。
- 策略: 这种方法旨在捕捉单一生成器可能遗漏的互补构象空间。
通过 FACET 进行源内重排序:
- FACET 模型: 采用了一种名为 FACET(基于拓扑信息预测的融合原子接触评估)的统一质量评估模型,对四个来源中的每个候选者进行重排序。
- 架构: FACET 使用了一种“结构优先”的架构,结合了:
- 全局 Cα 残基图编码。
- 界面重原子图编码。
- ESM-2 序列嵌入的后期融合。
- 训练目标: 该模型在一个大型数据集(来自 >6,000 个 PPI 系统中的 >1,000 万个候选者)上进行训练,用于预测 DockQ 指标的三个组成部分:Fnat(原生接触比例)、Si(界面 RMSD 分数)和 SL(配体 RMSD 分数)。最终的 DockQ 分数通过这三个组件的平均值进行重建。这使得模型能够区分局部合理的界面与正确的全局组装。
源平衡输出:
- 来自每个来源的候选者由 FACET 进行排序。
- 从每个来源中选择预定义的配额以形成最终输出集,从而确保不同采样方法的互补性在最终预测池中得以保留。
核心贡献
- 集成框架: EnsPlex 将互补采样与统一的质量评估工具耦合在一起,解决了当前流程中生成与选择脱节的问题。
- FACET 模型: 一种新型的、与来源无关的质量评估工具,通过利用全局几何结构、界面接触和序列信息来预测 DockQ 组件。它在重排序任务中优于特定来源的评分函数以及现有的数据驱动方法(如 DeepRank-GNN-ESM、GDockScore)。
- 构象扩展: 引入构象扩展对接分支(单体扩展 + HADDOCK)提供了获取非端到端深度学习模型本身所能采样的构象区域的途径。
结果
该框架在经过筛选的 102 个抗原-抗体靶标测试集上进行了评估,这些靶标代表了具有挑战性的蛋白质-蛋白质相互作用子集。
- 靶标成功率: 在匹配输出预算的情况下,与使用内置排序的 AlphaFold3 相比,EnsPlex 在靶标成功率(定义为至少有一个模型满足 DockQ ≥ 0.23)方面实现了 27.8% 的相对提升。
- 互补覆盖范围: 对回转半径(Rg)和溶剂可及表面积(SASA)分布的分析表明,四个来源采样了不同的构象区域。特别是构象扩展对接,比 AlphaFold3 覆盖了更广泛的 Rg-SASA 空间,尽管其原生评分函数无法有效识别这些可接受的模型。
- 重排序性能: 与其原始评分函数相比,FACET 在所有四个候选来源中均一致地提高了 Top-k 靶标成功率。
- 在构象扩展对接池中,FACET 的表现优于 HADDOCK 分数、范德华力能以及 PRODIGY ΔG。
- 在基于 AlphaFold 的候选池中,FACET 超越了内置置信度指标(如 ipTM)。
- 泛化能力: FACET 在外部同源性过滤数据集(AbSet 盲对接和位点定向子集)以及 FoldBench 基准测试中保持了性能,表现优于 DeepRank-GNN-ESM、GDockScore 和 AlphaFold3 自有的排序指标。
- 案例研究: 代表性示例(如 PDB ID 7TXT, 8WTD)表明,由于存在局部合理但全局错误的界面,FACET 成功识别出了被原始评分排在较低位置的正确全局组装体。
意义与主张
论文声称,EnsPlex 的成功源于必须将采样和评分视为耦合的组件,而非独立的组件。作者认为:
- 互补性至关重要: 没有单一生成器能为所有靶标提供足够的覆盖;结合异构生成器可以扩大搜索空间。
- 统一评分是关键: 不同工具的原始分数是不可比的。需要像 FACET 这样的统一模型来校准并从这些多样化的来源中选择最佳候选者。
- 上下文相关性: 准确的预测需要将局部界面接触置于整个复合物组装的背景下进行评估,FACET 通过区分正确与错误的全局取向展示了这一能力。
作者总结道,将互补采样与有效的候选选择相结合,比单独改进其中任何一个步骤都能获得更优的结果。他们指出,目前的评估局限于抗原-抗体系统和匹配的输出计数,在固定计算预算下的表现以及对其他 PPI 类别的适用性仍是未来工作中开放的问题。
每周获取最佳 bioinformatics 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。