← 最新论文
💻 bioinformatics

ProtBLIP2-SST: Protein Function Prediction via BLIP2 with Sequence, Structure, and Text

ProtBLIP2-SST 是一种新型的两阶段框架,它通过结构感知语言模型和 Q-Former 投影器将蛋白质序列与 3D 结构信息进行整合,从而使大语言模型能够生成灵活、开放式的功能描述,进而克服了传统僵化的基因本体(gene ontology)分类的局限性。

原作者: Chen, Z., Luo, Q.

发布于 2026-07-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Chen, Z., Luo, Q.

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

想象一下你拥有一个蛋白质,它基本上是一个由长链氨基酸组成的小型、复杂的机器。长期以来,试图弄清楚这些机器“功能”为何的科学家们一直在玩一场“猜标签”的游戏。他们会观察这条长链,并尝试在僵化的清单上勾选选项,比如“它是否结合 DNA?是/否。”这就像试图通过仅仅勾选“动作”、“喜剧”或“剧情”来描述一整部电影。你会错过情节、角色和感觉。

其他研究人员尝试使用大型人工智能聊天机器人(大语言模型)来为这些蛋白质编写自由流动的叙述。但有一个问题:这些 AI 模型只观察氨基酸序列。它们是在阅读食谱,却忽略了它所做出的蛋糕的 3D 形状。由于蛋白质的功能往往取决于它如何折叠成特定的 3D 形状,忽视这种结构就像是通过阅读零件清单来试图理解汽车发动机,却从未见过它们是如何组装在一起的。

核心理念:ProtBLIP2-SST
该论文的作者构建了一个名为 ProtBLIP2-SST 的新系统来解决这个问题。你可以把它想象成一个超级聪明的翻译官,它不仅能阅读成分(序列),还能在写故事时同时手握蓝图(3D 结构)。

他们是这样一步步构建它的:

1. “结构感知型”字典
首先,他们需要一种方法将氨基酸字符串和 3D 形状同时输入到他们的 AI 中。他们使用了一个名为 SaProt 的工具。想象一下,SaProt 是一个字典,它不仅有氨基酸的词汇(如“A”或“B”),还有代表 3D 形状的特殊标记(如“折叠起来的”或“扭曲的”)。它将序列和结构融合为一个单一的、超详细的描述。

2. “翻译官”(Q-Former)
接下来,他们需要教会 AI 理解这种新的、复杂的蛋白质语言。他们使用了一个名为 Q-Former 的“翻译”模块(借鉴自一个名为 BLIP-2 的模型)。

  • 设置: 他们冻结了蛋白质编码器(SaProt)和文本编码器(BiomedBERT),以免它们忘记已有的知识。
  • 训练: 他们教导 Q-Former 扮演一个桥梁的角色。它使用了三种不同的技巧来进行学习:
    • 对比学习(Contrastive Learning): “嘿,这个蛋白质和这段文本描述是一对;那个则不是。”
    • 匹配(Matching): “这个特定的蛋白质是这段话所描述的那个吗?是或否。”
    • 标题生成(Captioning): “这里有一个蛋白质;请写一段关于它的短篇故事。”
  • 结果: Q-Former 学会了从序列和结构中提取最重要的“蛋白质特征”,并将其转化为大 AI 可以理解的格式。

3. “讲述者”(Galactica)
最后,他们将这个翻译官连接到一个名为 Galactica-1.3B 的科学 AI。他们并没有重新训练整个庞大的大脑(因为那太昂贵了);相反,他们使用了一个轻量级的适配器 LoRA 来教会它如何倾听蛋白质特征。现在,当你给它一个蛋白质时,它不会只吐出一个清单。它会写出一段丰富的、自由文本形式的描述,涵盖了蛋白质的功能、它在细胞中的位置以及它所属的家族。

他们的发现(证据)
团队在来自 Swiss-Prot 的 441,000 个蛋白质-文本对以及来自 AlphaFold 数据库的 3D 结构数据集上进行了测试。

  • 评分: 他们的模型 ProtBLIP2-SST 在几乎所有测试中都击败了之前的最佳模型(如 ProtT3)。
    • 对于检索(寻找与蛋白质匹配的文本),其 650M 版本的模型平均得分达到了 90.83,超过了仅基于序列的模型。
    • 对于编写描述(标题生成),与仅基于序列的版本相比,它在 BLEU-4 (58.53)ROUGE-L (68.23) 等指标上得分更高。
  • “顿悟时刻”: 他们进行了深入研究,以了解为什么它表现得更好。他们发现,添加 3D 结构对于描述蛋白质的功能(例如“这个酶分解糖分”)帮助最大。这很合理,因为功能通常取决于 3D 形状。
  • 局限性: 然而,3D 结构对于相似性标签(例如“这看起来像家族 X”)帮助不大。论文指出,这是因为相似性主要取决于序列的字母组合,而不是形状。

他们排除了什么
论文明确反对了一些观点:

  • 仅靠序列是不够的: 他们展示了仅观察氨基酸字符串(没有 3D 结构)的模型在得分上始终较低。
  • 分离式编码器很笨拙: 他们反对那些分别对序列和结构进行编码并在稍后尝试将它们粘合在一起的模型。他们的这种方法从一开始就将它们融合,效果更好。
  • 直接粘贴原始数据行不通: 他们尝试在没有 Q-Former 翻译器的情况下直接将原始氨基酸字符串喂给 AI,结果失败得很惨(在某些测试中精确匹配率为 0.00)。这个“翻译”步骤至关重要。

他们的确定程度如何?
作者对他们的数字非常有信心,因为他们在 9,239 个他们从未见过的蛋白质组成的留存集上进行了测试。他们不仅仅是在猜测,而是在测量。

  • 他们发现,在 35M 规模上,他们的模型比仅基于序列的模型多赢得了 24 个精确匹配,在 650M 规模上多赢得了 22 个
  • 他们认为,来自 3D 结构的增益是“任务相关”的,这意味着它对某些工作(功能)很有帮助,但对其他工作(相似性)则不然。

底线
ProtBLIP2-SST 表明,如果你想让 AI 真正理解一个蛋白质的故事,你不能只给它食谱;你还必须向它展示 3D 形状。通过结合序列、结构和一个聪明的翻译器,他们创造了一个能够生成灵活的、人类可读的蛋白质功能描述的系统,从而从僵化的清单转向了开放式的叙事。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →