← 最新论文
💻 bioinformatics

An interpretable open platform for sequence-based antibody developability prediction

本文介绍了 DELPHI,这是一个开源平台,使实验室能够通过严格的交叉验证来训练、评估和解释基于序列的抗体可开发性预测器,且在无需访问专有训练数据的情况下,在专有和公开数据集上均实现了高性能。

原作者: Nguyen, H. N., Kothiwal, D., Su, Y., Kieu, M. A., Cao, R., Zhu, H., Teixeira, A. A. R.

发布于 2026-09-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Nguyen, H. N., Kothiwal, D., Su, Y., Kieu, M. A., Cao, R., Zhu, H., Teixeira, A. A. R.

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

抗体是免疫系统的专业化士兵,是呈Y形结构的蛋白质,旨在识别并中和诸如病毒或细菌之类的特定入侵者。在现代医学中,科学家们通过工程化手段设计这些分子,以对抗从癌症到自身免疫性疾病的各种疾病。然而,创造一种治疗性抗体是一场高风险的赌博。仅仅因为一个分子能够抓住目标,并不意味着它能在通往患者的旅途中幸存下来。许多候选药物之所以失败,是因为它们具有“粘性”,会聚集在一起或与体内的错误蛋白质结合,这可能导致它们被过快清除或引发危险的免疫反应。这些被称为“可开发性缺陷”(developability liabilities)的失败,往往在开发过程的后期才被发现,从而浪费了数年的研究时间和数百万美元。几十年来,了解一种抗体是否安全且稳定的唯一方法是在实验室中合成它并进行物理测试,这是一个缓慢且昂贵的瓶颈,无法跟上现代遗传技术产生的数百万种潜在候选物体的速度。

来自蛋白质创新研究所(Institute for Protein Innovation)的一个研究小组构建了一个名为 DELPHI 的新工具来解决这一瓶颈。可以将它想象成一个训练有素的数字侦察兵,可以在实验室制造出第一个分子之前,通过观察抗体的遗传蓝图来预测其是否稳定且安全。研究人员不仅创建了一个单一的预测模型,还构建了一个开放平台,允许任何实验室使用其特定的数据来训练自己的定制预测器。通过将二十五种不同的人工智能技术组合与现实世界的实验数据进行对比测试,他们发现,准确预测的关键不在于计算机算法的复杂程度,而在于如何向机器呈现抗体的序列。他们的系统成功学会了识别导致失败的细微化学特征,例如抗体结合区域电荷不平衡的问题,并且现在能够以媲美顶尖人类专家的准确度来筛选候选药物。

这项工作的核心在于教计算机阅读蛋白质的语言。抗体由氨基酸链组成,这些构建块的具体顺序决定了分子的行为方式。研究人员收集了大量已经在实验室中经过测试的抗体序列,并将它们标记为“通过”(稳定且无粘性)或“失败”(易于聚集或粘附到错误物体上)。他们将这些数据输入 DELPHI,该系统尝试了多种将这些氨基酸链转化为计算机可理解格式的方法。有些方法将序列视为简单的零件列表,而另一些则使用了先进的“语言模型”,这些模型能够理解蛋白质不同部分之间的上下文和关系,就像人类理解一个单词的含义会根据所在的句子而改变一样。

结果令人瞩目。系统学到,如何表示抗体序列的选择远比使用哪种计算机模型来做出预测更为重要。具体而言,同时观察抗体的重链和轻链而非孤立观察的模型,在识别导致失败的细微模式方面表现得更好。在对超过 246,000 个抗体的库进行测试时,表现最好的 DELPHI 版本在区分稳定抗体与不稳定抗体方面达到了 0.95 的 AUC 值。即使当系统被要求预测它从未见过的抗体(包括来自非训练数据的临床试验中的抗体)时,这种性能依然保持稳定。在与一场主要的行业竞赛进行的盲测中,尽管该工具无法获取竞赛的特定数据,但其表现与顶尖的人类提交方案不相上下。

除了仅仅预测“通过”或“失败”之外,DELPHI 还提供了以往大多数研究人员无法获得的细节水平。它不仅仅给出一个分数,还会通过指出导致风险的具体氨基酸来解释给出该分数的原因。分析显示出一个一致的模式:失败的抗体往往在其结合环中拥有过多的带正电荷的构建块(特别是精氨酸和赖氨酸),同时缺乏带负电荷的构建块(如天冬氨酸)。这种电荷失衡使抗体具有“粘性”,导致它会抓取无关的蛋白质或聚集在一起。该工具在两种不同类型的失败中识别出了相同的危险特征:一是粘附到错误物体的抗体,二是无法保持为单一稳定单元的抗体。这表明,修复这些特定区域的电荷可以同时预防多种类型的失败。

研究人员还绘制了使这些预测变得可靠所需的多少数据。他们发现,随着更多数据的加入,系统的准确性会迅速提高,但在添加了大约 5,000 个多样化的抗体序列后,准确性开始趋于平缓。这为实验室提供了一个明确的指南:他们不需要数百万个样本来构建一个有用的预测器;通常只需要几千个经过良好表征的示例就足以达到高度的置信水平。此外,该工具旨在具备灵活性。由于它是开源软件,任何实验室都可以上传自己的实验结果,针对其特定类型的抗体重新训练模型,并立即开始筛选新的候选药物。这使预测可开发性的能力变得民主化,推动该领域从昂贵的后期失败转向一个更早地识别最具前景的抗体、从而为需要它们的患者节省时间和资源的未来。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →