← 最新论文
💻 bioinformatics

Repurposing PeTriBERT for Protein Protein Interaction Prediction with Sequence Structure Fusion

该论文介绍了 PeTriPPI2,这是一个融合了 ESM-2 序列嵌入与 PeTriBERT 结构表征的混合框架,用于预测蛋白质-蛋白质相互作用,在 Pinder 数据集上实现了高准确率和高精确度,并通过消融研究展示了序列特征与结构特征之间的互补价值。

原作者: Wavreille, A., Krouk, G., Dumortier, B.

发布于 2026-09-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Wavreille, A., Krouk, G., Dumortier, B.

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

微观世界的生命是一个充满持续连接的世界。在每一个活细胞内部,蛋白质扮演着工人、建造者和信使的角色,维持着生命机器的运转。这些分子并非孤立的存在;它们很少独自工作。相反,它们必须寻找特定的伙伴并紧密结合在一起,组成驱动化学反应、发送信号或构建细胞结构的团队。这种两个蛋白质相互寻找并粘合在一起的过程被称为蛋白质-蛋白质相互作用。了解究竟哪些蛋白质会配对以及它们是如何进行的,对于科学家来说至로重要。如果研究人员能够绘制出这些连接图谱,他们就能弄清楚疾病是如何发生的、为什么某些药物有效,以及如何设计新的药物来修复损坏的生物系统。

长期以来,弄清这些伙伴关系就像是在解一个缺少拼图块的谜题。科学家可以在实验室中观察蛋白质的相互作用,但这个过程缓慢、昂贵且往往不完整。近年来,人工智能介入其中提供了帮助,学习如何预测蛋白质如何折叠成三维形状。这一突破开启了一扇新门:如果我们能预测蛋白质的形状,我们或许就能预测它如何与其他蛋白质相互作用。然而,蛋白质的形状仅仅是故事的一半。它的化学序列——即其构建模块的具体顺序——也蕴含着至关重要的线索。挑战在于建立一个能够同时读取序列和形状的计算机模型,将两者结合起来,从而对两个蛋白质是否会发生相互作用做出可靠的预测。

法国的一个研究小组通过创造一种名为 PeTriPPI2 的新工具,在这一努力中迈出了重要一步。他们的工作重点在于一种巧妙的策略,即重新利用现有的人工智能模型来解决一个新的问题。他们从两个强大的预训练系统开始。第一个模型阅读了数百万个蛋白质序列,学习生物学的语言,就像人类学习口头语言一样。第二个模型最初被设计用于执行与通常预期相反的任务:它不是根据序列预测形状,而是被训练去猜测会产生特定形状的序列。这个被称为 PeTriBERT 的模型在理解控制蛋白质部分如何在三维空间中相互契合的几何规则方面表现得异常出色。

研究人员意识到,虽然 PeTriBERT 是为不同的任务而设计的,但其对蛋白质几何结构的深刻理解对于预测相互作用极其有用。他们将这个几何模型与序列阅读模型融合在一起,创建了一个混合系统。在他们的设置中,待测试的两个蛋白质通过两种方式输入系统。一条路径将氨基酸的原始序列送入语言模型,以捕捉化学指令。另一条路径将蛋白质的三维结构送入几何模型。系统随后观察这两股信息流是如何对齐的。它会询问这两个蛋白质的化学指令和物理形状是否足够兼容,以形成稳定的键合。

为了测试这种方法是否奏效,该团队在一个包含超过 160 万对蛋白质的大型数据集上训练了他们的新模型,其中一半是已知相互作用的,另一半则不是。随后,他们将模型应用于一组从未见过的 2,342 对蛋白质进行测试。结果非常强劲。该模型以极高的准确度正确识别了相互作用的配对,得分达到了 0.898。更重要的是,当它预测两个蛋白质会发生相互作用时,其准确率高达 91.7%。这种高水平的精确度意味着该模型非常擅长避免误报,这对于需要可靠线索进行实验室后续研究的研究人员来说是一个关键特性。

这项研究还通过测试移除模型的部分功能来揭示其工作原理。当研究人员阻断模型获取序列信息时,其预测相互作用的能力显著下降。当他们阻断结构信息时,模型的准确度降至 0.523,F1 分数降至 0.118,表现仅略好于随机猜测。这证实了化学序列和物理形状对于该系统的运作都是必不可少的。该模型不仅仅是在记忆模式,它确实是在利用序列和形状这两类数据的结合来进行决策。

与其他领先的方法相比,PeTriPPI2 展示了独特的优势。它比一个类似的混合模型 SpatialPPIv2 更精确,这意味着它在预测相互作用发生时犯错更少。然而,它的敏感性稍低,捕捉到的总相互作用数量较少。这表明 PeTriPPI2 的运行标准更为严格,倾向于在做出判断前先确保准确。对于科学家来说,这种权衡是有价值的。在许多研究场景中,拥有一份包含少量高度可靠候选者的名单,比拥有一份包含许多错误线索的长名单要好得多。

这项工作证明了为特定生物学任务训练的人工智能模型可以成功地转化为其他任务。通过将一个旨在逆向工程蛋白质形状的模型教导以识别相互作用,研究人员展示了底层的几何知识是具有可迁移性的。虽然该模型仍然依赖于对蛋白质形状的良好预测才能发挥作用,但这种方法的成功表明,蛋白质科学的未来可能在于这些混合系统。它们结合了蛋白质序列的广博知识与物理几何的精确逻辑,为理解分子世界的连接提供了更完整的图景。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →