← 最新论文
💻 bioinformatics

Benchmarking antibody-antigen co-folding on human monomeric antigens

本研究引入了 HuMonoAg-Bench 基准测试,用于评估十种抗体-抗原共折叠方案,结果表明,尽管近年来的方法在 CDRH3 建模方面取得了显著改进,并对约一半的截断后复合物实现了中等或更好的准确度,但在采样正确结合模式和建模柔性环路方面仍存在挑战,从而限制了对许多结构异质性复合物的预测。

原作者: Park, M., Nett, R., Petersen, B., Sivasubramanian, A.

发布于 2026-08-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Park, M., Nett, R., Petersen, B., Sivasubramanian, A.

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

在人类免疫系统的微观世界中,抗体扮演着高度专业化的“钥匙”角色,旨在完美契合入侵病毒或有害蛋白质所呈现的“锁”。几十年来,科学家们一直梦想着仅通过观察化学蓝图就能准确预测这些“钥匙”与“锁”是如何契合的。这种能力将彻底改变医学领域,使研究人员无需在实验室中构建并测试每一个版本,就能设计出新的药物和疫苗。然而,这种预测一直以来都是生物学中最顽固的谜题之一。虽然计算机已经非常擅长猜测两个蛋白质如何粘附在一起,但抗体是一个特例。与大多数随其伙伴共同进化的蛋白质不同,抗体是独立进化的,这意味着它们缺乏有助于计算机做出准确推测的共同进化历史。此外,抗体真正抓取目标的部位是一个灵活、摇摆的环状结构(loop),其形状不断变化,这使得使用标准工具对其进行建模变得极其困难。

一个研究团队致力于测量最新一代计算机程序在解决这一特定谜题方面取得了多大的进展。他们收集了412个真实的抗体与人类蛋白质结合的案例,创建了一个严谨的测试集,该测试集在这些计算机程序构建之前从未被它们见过。通过针对这一新数据运行十种不同的预测方法,他们发现最新的软件取得了巨大的飞跃,能够成功预测大约一半的新未知案例的正确形状。然而,研究也表明,即使是最优秀的程序在面对最灵活的部分时仍然感到吃力,而且仅仅通过增加尝试次数并不总能得到更好的答案。研究人员发现,如果他们能告诉计算机抗体应该在哪里接触目标,旧的程序就能赶上新的程序,这表明主要的障碍不仅在于软件的智能程度,还在于它在浩如烟海的可能性中寻找正确起点点的能力。

研究人员首先组建了一个名为 HuMonoAg-Bench 的基准测试,这是一个包含412个涉及人类蛋白质的抗体复合物的精选库。他们根据结构被发现的时间,将这个集合仔细分为两组。一组由2021年9月之前发布的278个复合物组成,这个日期是许多现代预测工具训练数据的截止日期。另一组则包含134个在那个日期之后发布的复合物,确保计算机程序从未见过这些特定的形状。为了使测试更加精确,他们进一步将新组分为涉及与旧抗原非常相似的抗原,以及涉及完全新颖抗原的抗原。这种设置允许他们测试计算机是在简单地记忆旧案例,还是在真正学习如何预测新的相互作用。随后,他们针对该数据集运行了十种不同的共折叠协议(co-folding protocols)——即模拟两个蛋白质如何共同折叠的方法——并将结果与实际的实验结构进行对比,以观察预测结果的接近程度。

结果显示,与旧方法相比,最新方法有了显著的改进。在预测这些新的、未见过的复合物结构时,旧软件仅能在约16%到22%的案例中找到正确或接近正确的形状。相比之下,最先进的方法,如 Protenix v2、IntelliFold-2 和 ESMFold2,在同样的案例中,成功找到中等或更好质量模型的比例约为33%到52%。表现最好的 Protenix v2 在处理标准抗体时实现了52%的成功率,而在抗原已知的情况下,对于特定类型的单域抗体,其成功率甚至达到了82%。尽管取得了这些进展,研究仍强调,近一半的新目标仍未被解决,这表明虽然该领域发展迅速,但很大一部分抗体相互作用仍超出了当前技术的能力范围。研究人员指出,这种进步并非仅仅因为新程序看到了更多数据(因为它们拥有相似的训练截止日期),而是由于它们在建模复杂形状方面有了根本性的改进。

对某些预测成功而另一些失败的原因进行更深入的研究,指向了一个特定的结构特征:CDRH3 环。这是抗体上的一个灵活的、发夹状的结构,也是与目标接触的主要接触点。研究发现,这个单一环路的准确性是预测是否成功的最强指标。虽然计算机在模拟抗原的刚性部分和其他更稳定的抗体环路方面表现良好,但 CDRH3 环仍然是最难处理的部分,尤其是当它较长时。较新的方法在建模这个特定环路方面表现出了显著的进步,这与其更高的整体成功率直接相关。然而,即使局部环路结构建模良好,也不保证整个抗体相对于目标的位置是正确的,这表明把零件做对并不等于正确地组装整个拼图。

研究人员还测试了如果给计算机程序一个关于抗体应在哪里结合的“提示”,会发生什么。在现实场景中,科学家可能知道目标蛋白质上抗体附着的几个关键位点,但他们并不知道抗体的确切形状。通过提供这种有限的信息作为约束,旧方法的成功率提升了20到30个百分点,使其达到了最强非约束方法的水平。这一发现表明,旧软件的主要局限性不在于缺乏物理学理解,而在于无法在数十亿种可能性中找到正确的结合模式。当搜索空间被提示缩小后,旧程序就能找到解决方案。然而,这种收益高度依赖于提示的准确性;如果提供的信息仅是部分正确,这种改进就会消失。

最后,团队调查了通过增加更多次的模拟运行是否能解决剩余的问题。他们发现,对于非约束方法而言,主要问题在于采样失败:正确的形状在生成的模型集中从未出现过。当他们增加模拟运行次数时,他们确实找到了更多正确的形状,但也发现计算机的排名系统经常无法将最好的那个选为首选答案。这产生了一个新的瓶颈:即使生成了正确答案,软件也并不总是将其识别为最佳选项。研究结论认为,虽然增加尝试次数有所帮助,但正确排序和选择最佳模型的能力正变得与生成模型的能力同样重要。剩余的未解决案例是多种难以处理的目标的混合体,并没有单一的共同特征,这表明未来的路径需要解决多种不同类型的挑战,而不仅仅是修复某一个特定的问题。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →