← 最新论文
💻 bioinformatics

A novel benchmark dataset for enzyme function prediction reveals the limitations of state-of-the-art models

本文介绍了 EnzymARC,这是一个由结构破坏型酶诱饵组成的新型基准数据集,旨在证明当前的先进酶功能预测器严重依赖系统发育捷径,且无法区分催化失能变体与功能性酶,从而强调了在模型训练和评估中引入结构感知负样本的紧迫需求。

原作者: Sartori, J., Guimaraes, A. C. R., Machado, L. d. A.

发布于 2026-08-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Sartori, J., Guimaraes, A. C. R., Machado, L. d. A.

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

在生命的浩瀚图书馆中,每一个生命都携带一套用称为 DNA 的代码编写的指令。在这些指令中,包含了被称为酶的微小生物机器的蓝图。这些酶充当细胞的工人,加速维持生物体生存的化学反应,从消化食物到修复受损组织。为了记录科学家发现的数百万种不同的酶,他们使用了一种称为酶分类委员会编号(EC number)的标准标记系统。可以将这些数字想象成一个通用的目录系统,它能准确告诉研究人员某种特定酶执行的具体工作。随着科学家对越来越多的生物进行基因组测序,他们正以惊人的速度发现新的酶。现在的挑战在于,如何在不通过实验室测试每一种酶的情况下,弄清楚这些新发现的酶的功能,因为这项任务将耗时数个世纪。为了解决这个问题,研究人员转向了计算机,训练人工智能通过观察酶的序列,并基于其从已知案例中学习到的模式来预测其功能。

最近,一个研究小组决定测试这些计算机模型是真的理解酶是如何工作的,还是仅仅在走捷径。他们创建了一套新的测试数据,称为 EnzymARC,以观察现有的最佳程序是否能够区分一个正常工作的酶和一个损坏的酶。为了构建这个测试,他们从已知可以工作的酶开始,然后有系统地破坏它们。利用酶的三维结构模型,他们瞄准了发生化学反应的特定位置,即被称为活性位点的地方。随后,他们改变了结构,以破坏酶的功能能力,从而创造出他们称之为“诱饵”序列的东西。这些诱饵被设计得与原始的、正常工作的酶几乎完全一样,除了使它们无法工作的关键机械部分受到了破坏。他们通过改变距离活性位点特定距离内的结构来创建这些损坏的版本,范围从极小的 5 埃(Angstroms)到较宽的 15 埃半径,确保酶的其他部分基本保持不变。

研究人员随后将这些损坏的诱饵输入到三种不同类型的计算机预测工具中,以观察机器会给出怎样的判断。一种工具依赖于在数据库中寻找相似的序列;另一种方法通过比较不同的蛋白质形状来进行学习;第三种则是专门用于识别非工作酶的深度学习模型。结果是发人深省的。当计算机模型观察这些轻微受损的酶时,它们几乎完全失败了。尽管催化机制已被破坏,这些模型仍自信地为这些损坏的酶分配了原始且正确的任务描述。事实上,对于受损最轻微的诱饵,模型的错误预测率超过了 90%。这表明,这些模型并没有真正学习酶工作的物理规则;相反,它们是在依赖一种捷径。它们通过观察整体相似性来判断,并假设如果它看起来像鸭子,那它一定就是鸭子,即使这只鸭子已经坏掉了。

即使是那个经过专门训练以识别损坏酶的最先进模型,在针对活性位点进行观察时,也难以识别出特定的损伤。虽然该模型在面对更严重的损伤时表现得更好,但它仍然错过了那些导致酶失效的有针对性的破坏。这项研究表明,目前的计算机程序极易受到这些“系统发育捷径”(phylogenetic shortcuts)的影响,这意味着它们很容易被蛋白质的家族历史所误导,而不是根据其实际功能进行判断。研究人员得出结论,要构建真正可靠的生物学理解工具,下一代模型必须使用包含这些具备结构感知能力的、损坏版本的样本进行训练。只有通过教计算机去识别一台功能完备的机器与一台损坏机器之间的区别,而不仅仅是匹配模式,我们才能开发出足够强大、足以应对酶功能复杂现实的模型。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →