← 最新论文
🧬 biology

EIHR-PROT: Explicitly Modelling of Homology Reliability for Protein Function Prediction

EIHR-PROT 是一种新型蛋白质功能预测框架,它通过一种能够显式建模同源证据可靠性的学习门控机制,将 ESM-2 序列嵌入与基于同源性的先验知识进行自适应整合,从而超越了现有方法。

原作者: Oluranti Jonathan, Uwidia . E. Osalodion

发布于 2026-08-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Oluranti Jonathan, Uwidia . E. Osalodion

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

蛋白质是维持生命运转的分子机器,它们执行的任务从构建细胞结构到催化驱动我们身体的化学反应不等。为了了解一种特定蛋白质的功能,科学家通常会观察其氨基酸序列,即构成它的独特构建块链条。几十年来,预测蛋白质功能最可靠的方法是寻找另一段已被研究过的、具有非常相似序列的蛋白质;如果它们看起来相似,它们很可能也从事同样的工作。这种被称为“同源性”(homology)的方法在科学记录中存在近亲时效果极佳。然而,随着研究人员探索生命的多样性,他们越来越多地遇到与已知蛋白质差异巨大的蛋白质,导致这些传统的比较方法失效。近年来,在数百万个蛋白质序列上训练的人工智能模型已经成为强大的工具,能够捕捉到简单的序列匹配所忽略的细微模式和进化线索。然而,一个悬而未决的问题仍然存在:当出现一种新蛋白质时,我们应该信任寻找“相似物”的旧方法,还是信任模式识别的新方法,抑或是两者的结合?

来自尼日利亚考文特大学(Covenant University)的一个研究小组开发了一种新方法来回答这个问题,创建了一个不仅是在两者之间做选择,而是学习何时信任各自的方法的系统。他们将该框架称为 EIHR-PROT。该模型并没有对如何结合这两类证据强加固定的规则,而是像一个智能过滤器一样,评估每一个被检查蛋白质的“相似物”匹配质量。如果系统在数据库中找到了非常强大且接近的匹配,它就会严重倾向于传统的证据。如果匹配很弱、很远或不存在,系统会自动将信心转向人工智能模型,后者依赖于从研究数百万种蛋白质中所学到的深度模式。这种动态调整使模型能够避免盲目信任微弱相似性的陷阱,同时在相似性可靠时充分利用它们。

研究人员使用两个主要信息流构建了他们的系统。第一个信息流来自一个名为 ESM-2 的复杂语言模型,该模型已在海量的蛋白质序列集合上进行了训练,以理解其生物学语法。该模型将蛋白质序列转换为数学表示,从而捕捉其隐藏的结构和功能特征。第二个信息流来自一个标准的搜索工具,用于在已知蛋白质数据库中寻找相似序列。创新之处在于如何连接这两个信息流。研究人员添加了一个“门控”(gating)机制,该机制会检查有关数据库匹配质量的具体线索,例如蛋白质序列的对齐程度以及匹配的统计得分强度。基于这些线索,门控决定了对于该特定蛋白质,要在数据库匹配与 AI 预测之间分配多少权重。

当团队在具有已知功能的蛋白质大型数据集上测试该系统时,结果表明这种自适应方法优于使用固定规则结合证据的现有方法。该模型在预测三大类蛋白质功能方面达到了极高的准确度:蛋白质参与的生物过程、执行的分子任务以及在细胞内的位置。在这些测试中,该系统以极高的精确度正确识别了蛋白质的功能,击败了其他混合序列和同源性数据的领先方法。研究人员发现,在预测生物过程时,这种改进最为显著,因为这是一个复杂的领域,其中传统匹配的可靠性变化极大。通过对同源性证据的可靠性进行显式建模,该系统学会了忽略可能误导简单模型的噪声或错误匹配。

为了理解为何效果如此之好,研究人员进行了移除系统中特定部分的实验。当他们取消判断匹配可靠性的能力时,模型的性能下降了,这证实了智能门控机制是其成功的关键。他们还在一组与训练数据库中任何内容都非常不同的蛋白质上测试了该系统,模拟了发现全新生物实体的过程。即使在这些传统方法往往难以应对的困难案例中,该系统仍保持了强大的性能。这表明,该模型成功学会了在传统的“相似物”证据过于微弱而无法被信任时,转而依赖 AI 对蛋白质模式的深度理解。这项研究表明,蛋白质功能预测的未来并不一定需要在新旧方法之间做出选择,而是建立能够根据每个独特案例智能权衡可用证据的系统。

这项工作的意义不仅在于在测试中获得更高的分数。通过使决策过程透明化,该系统允许科学家准确看到在任何给定蛋白质上,数据库匹配与 AI 预测分别占据了多少信任权重。这种可解释性对于那些在采取行动前需要理解预测依据的研究人员来说至关重要。作者指出,虽然目前的系统能有效处理蛋白质序列,但未来的版本可以利用相同的灵活逻辑,整合其他类型的生物数据,如蛋白质结构或相互作用网络。目前,这项研究提供了一条清晰的前行路径:一种既尊重传统生物学知识的价值,又充分拥抱现代人工智能力量的方法,并能根据遇到的每种蛋白质的具体需求来调整其策略。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →