← 最新论文
🧬 biology

PepLLM: ESM-Guided Llama for Structured Protein-Peptide Binding Interface Analysis

该论文介绍了 PepLLM,这是一个指令微调框架,它将 ESM 编码的蛋白质嵌入与 LLaMA 解码器相结合,以生成详细描述蛋白质-多肽结合界面的物理化学机制和多属性特征的结构化、机器可读的 JSON 注释。

原作者: Hao Qian, Shikui Tu, Lei Xu

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Hao Qian, Shikui Tu, Lei Xu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

在每一个活细胞内,被称为蛋白质的微小分子机器不断地伸出触手去抓取其他分子,这些分子通常是被称为多肽的短氨基酸链。这些相互作用充当了维持生命运转的开关和信号,控制着从细胞如何相互交流到免疫系统如何对抗入侵者的一切。由于这些连接至关重要,科学家们长期以来一直试图开发能够预测多肽如何与蛋白质结合的计算机程序。多年来,这些程序就像简单的“是或否”问卷调查:它们可以告诉研究人员一次结合事件是否会发生,或者指出蛋白质上发生连接的大致区域。然而,它们难以解释实际的握手机制。它们无法描述将两个分子连接在一起的具体化学力,例如形成了多少个氢键,这种连接是依赖于电荷吸引,还是分子将它们的油性部分深埋在接触区以保持稳定。缺乏这些细节,理解如何设计新药或工程化更好的生物工具仍然像是一场猜谜游戏。

为了弥补这一差距,上海交通大学的一个研究团队开发了一种名为 PepLLM 的新方法。他们没有要求计算机仅仅预测一个单一的结果,而是教它撰写一份详细的报告。想象一下这样一个计算机程序:在查看了代表蛋白质和多肽的字母序列后,它能生成一份结构化的、机器可读的文档,详细列出它们是如何相互作用的。这份文档包含了具体细节,例如多肽是深埋在口袋中还是仅仅停留在表面,连接它们的氢键密度如何,是否存在盐桥,以及两个分子之间的电荷平衡情况。研究人员通过结合两种强大的人工智能构建了这个系统。其中一部分在数百万个蛋白质序列上进行了训练,理解生命的生物语言;另一部分是类似于用于写作和对话的大型语言模型,擅长遵循指令并生成结构化文本。通过将这两者连接起来,该团队创建了一个能够将原始生物序列转化为对所起物理作用进行清晰、有序描述的模型。

为了训练这个新系统,研究人员首先必须创建一个已知答案的海量示例库。他们从现有的科学数据库中收集了数千个蛋白质-多肽结构,并使用专门的软件对它们进行了分析。该软件计算了分子接触时埋藏的精确表面积,统计了形成的氢键和盐桥数量,并测量了电势以观察电荷如何互补。随后,他们将这些复杂的物理测量值转换为简单的类别,例如用“深”或“表层”来表示埋藏程度,或用“强”或“弱”来表示电荷吸引。为了确保计算机学习的是通用规则而非仅仅记忆特定示例,他们仔细划分了数据,确保具有非常相似序列的蛋白质不会同时出现在训练组和测试组中。这产生了一个包含约 32,000 个训练样本的数据集,使模型能够学习支配分子结合的微妙模式。

研究人员随后将他们的蛋白质理解引擎连接到了语言生成器。他们将蛋白质和多肽序列输入第一个引擎,该引擎为分子的每个部分生成了一组数值表示。这些表示随后通过一个小型适配器,被转化为语言生成器可以理解的格式。至关重要的是,研究人员并没有仅仅要求语言模型猜测一个标签;他们指示它填充一个特定的模板,用它刚刚接收到的生物数据替换句子中的占位符。模型随后被训练通过生成剩余的结构化报告来完成句子。这种方法使系统能够将生物数据视为连续、流动的过程,而非僵化的类别,从而能够生成关于相互作用的连贯叙述。

当团队测试这个新系统时,它证明了自己能够产生有效且结构化报告的卓越能力。在短短几轮训练后,该模型生成的输出几乎总是格式正确的,这意味着计算机可以轻松读取并解析结果。在准确性方面,该系统正确识别多肽埋藏状态的概率约为 64%,识别盐桥存在的概率约为 61%。随着训练的持续,它在估算氢键密度和整体疏水界面性质方面的能力也有所提高。虽然模型在精确预测电荷互补性方面仍面临挑战,但它展现出了与简单方法不同的优势特征:尽管标准的分类模型在平均水平上略高,并且在疏水性和静电互补性等特定领域表现更好,但 PepLLM 在预测埋藏状态、氢键密度和盐桥存在方面表现出色。研究人员指出,虽然判别式基准模型在处理孤立问题时可能更准确,但新系统通过一次性提供统一的多属性描述,提供了显著的优势。这表明该模型正在学习将相互作用作为一个整体进行推理,而不仅仅是回答一系列不相关的疑问。

这项工作代表了科学家对待分子分析方式的一种转变。通过超越简单的二元预测,研究人员证明了大型语言模型可以被引导去生成关于复杂生物机制的结构化、可解释的描述。该系统不仅说明多肽是否结合,还解释了它是如何结合的,详细阐述了界面的化学景观。这种能力为那些需要快速筛选数千种潜在候选药物或解读复杂实验结果的研究人员开辟了新的应用前景。虽然当前版本仍处于早期阶段,且依赖于序列数据而非完整的 3D 结构,但它建立了一种利用人工智能解码生命物理规则的新范式。研究人员建议,未来的版本可以纳入更详细的结构信息,从而有望成为一个帮助科学家通过理解分子相互作用的精确机制来设计更好药物的工具。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →