Benchmarking unsupervised protein mutational effect predictors: practical guidelines for protein engineering and reduced accuracy at beneficial residues
本文利用大规模深度突变扫描数据,对三种主流无监督蛋白质突变效应预测器进行了基准测试,旨在为蛋白质工程提供实践指南,同时揭示了这些预测器在预测功能增益突变以及处于特定结构或理化环境中的残基方面存在的共同局限性。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
蛋白质是维持生命运转的分子机器。它们折叠成复杂的三维形状,以执行诸如携带氧气、对抗感染或催化化学反应等任务。由于这些形状决定了蛋白质的功能,科学家们长期以来一直寻求一种方法,来预测改变蛋白质链中单个构建模块将如何改变其功能。这个被称为蛋白质工程的过程,涉及将一种氨基酸替换为另一种,以提高蛋白质的性能,例如让酶的工作速度更快,或让药物靶点的结合更紧密。虽然计算机已成为模拟这些变化的强大工具,但该领域一直过度依赖于测试不同程序预测蛋白质形状稳定性的能力,而非它们识别出哪些特定变化能真正提升蛋白质功能的有效性。
来自东京大学、北里大学以及日本产业技术综合研究所的研究团队,致力于测试这些计算机程序的实际应用价值。他们将重点放在了“无监督”方法上,即那些通过学习大量现有蛋白质数据进行学习,而不需要针对每个新蛋白质提供特定指令或标记示例的算法。研究人员比较了三种主要类型的工具:计算物理作用力的分子模拟、通过进化历史学习模式的蛋白质语言模型,以及基于蛋白质结构训练的机器学习模型。他们并没有仅仅询问计算机是否能猜中正确的氨基酸,而是提出了一个更具实践意义的问题:这些工具能否告诉科学家,应该在蛋白质的哪个特定位置进行突变,以改善其功能?
为了回答这个问题,研究小组收集了一个涵盖十种不同蛋白质和五种不同功能属性的海量实验数据集合,这些属性包括酶分解药物的能力、蛋白质相互结合的强度以及蛋白质发光的亮度。他们将这三类计算机程序应用于这些数据,以观察预测结果与现实的匹配程度。结果提供了一份清晰的优劣势图谱。蛋白质语言模型(通过分析基于进化的氨基酸序列的统计可能性)在整体准确度方面通常优于其他方法。然而,基于结构的机器学习工具在不同类型的蛋白质中表现得更为一致,展现出了语言模型有时缺乏的鲁棒性。
研究表明,预测的成功在很大程度上取决于突变发生的位置以及目标是什么。例如,计算机在预测蛋白质紧密堆积的核心区域的变化方面,要比预测其暴露表面或与其他分子结合的界面处的变化要准确得多。这对蛋白质工程而言是一个重大障碍,因为最有用的变化往往发生在表面。此外,研究人员发现,输入结构的 choice(选择)至关重要。当试图提高一种蛋白质与其他蛋白质结合的能力时,使用能将两个蛋白质作为一个复合物共同看待的计算机模型,比单独观察它们的效果更好。相反,当试图预测细胞会产生多少种蛋白质时,观察蛋白质本身则更为有效。
或许最令人震惊的发现是蛋白质工程核心的一个悖论。研究人员发现,那些最有可能改善蛋白质功能的突变位点,恰恰也是计算机程序预测最不准确的位点。换句话说,算法在最需要它们的时候表现得最差。这意味着,虽然这些工具已经成熟到足以引导对有益突变的初步搜索,但在确定能产生最佳结果的具体氨基酸替换这一最后一步,仍然是一个艰巨的挑战,特别是对于驱动更优酶制剂和治疗药物开发的“功能获得型”突变而言。
该研究还强调了所涉及氨基酸的物理性质如何影响预测准确性。改变残基电荷或将疏水(排斥水)部分替换为亲水部分的改变,比其他变化更难预测。此外,蛋白质的形状也很重要:位于扁平片层结构中的突变比位于螺旋或松散环状结构中的突变更容易被预测。这些发现为科学家提供了切实的指导原则。它们表明,虽然没有哪种工具是完美的,但根据具体目标选择正确的方法和正确的结构输入,可以显著提高成功的概率。这项工作并不声称已经解决了蛋白质设计问题,它澄清了现状,向研究人员展示了目前的工具在哪些地方可靠,以及在哪些地方可能会失灵。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。