← 最新论文
💻 bioinformatics

RegimeFormer: A Large Protein Model of Global Perturbation Regimes

RegimeFormer 是一个大规模蛋白质模型,通过其关联的包含超过 2 亿条序列的 RegimeAtlas 数据库,建立了全局扰动机制(global perturbation regimes),用以预测残基水平的突变效应,并提升下游生物学建模的表现,特别是在处理未见过的蛋白质和家族时。

原作者: Ma, S., Chai, Y., Wu, Y., Zhang, Q., Yuan, Y., Zhao, K., Chen, Z., Wang, H., Cao, S., Yu, X., Han, X., Liu, Y., Liu, Y., Zhu, T., Tao, D.

发布于 2026-08-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Ma, S., Chai, Y., Wu, Y., Zhang, Q., Yuan, Y., Zhao, K., Chen, Z., Wang, H., Cao, S., Yu, X., Han, X., Liu, Y., Liu, Y., Zhu, T., Tao, D.

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

蛋白质是生命的劳模,它们是微小的分子机器,负责构建细胞、对抗感染并执行维持我们生命的化学反应。它们由被称为氨基酸的构建模块组成的长链构成,而这些模块的具体排列顺序决定了蛋白质如何折叠以及其发挥什么作用。几十年来,科学家们已经知道,即使是改变这条链中的单个构建模块,也可能产生剧烈的后果。有时这种变化是无害的;而有时它会使这台机器彻底损坏,导致疾病。近年来,研究人员开发出了强大的计算机工具来预测这些结果,但这些工具大多局限于一次只能研究一种蛋白质。在面对自然界中存在的广袤且未经探索的蛋白质海洋时——其中许多蛋白质从未在实验室中被观察到——这些工具显得力不从心。

一组研究人员现在构建了一种新的地图,覆盖了这片完整的海洋。他们创建了一个系统,将蛋白质的行为视为一个统一的景观,而非一系列孤立的谜题,这个景观拥有不同的区域。通过分析来自生命之树每个分支的超过 2 亿个蛋白质序列,他们发现蛋白质可以分为不同的“状态”(regimes),这些状态描述了它们对变化的反应方式。有些蛋白质是脆弱的,这意味着即使是微小的调整也会使其损坏。另一些则具有适应性,能够吸收变化甚至改善其功能。研究人员构建了一个庞大的模型,可以在这个景观中进行导航,预测特定变化将如何影响蛋白质,即使该蛋白质从未被研究过。这项工作提供了一种理解分子层面生命规则的新方法,为那些想要工程化设计更好蛋白质或理解遗传突变如何导致疾病的科学家提供了指南。

研究人员首先收集了惊人的数据。他们从公共数据库中收集了 4.24 亿条原始蛋白质序列记录,其中包括从人类基因到土壤细菌以及病毒的一切内容。在清理了这些数据以去除错误和重复项后,他们得到了 2.02 亿个独特的蛋白质。这个被他们命名为 RegimeAtlas 的集合,代表了科学界已知的蛋白质宇宙的近乎完整的地图。研究人员并没有仅仅列出这些蛋白质,而是使用了一个复杂的计算机模型来组织它们。他们将这些序列投影到一个连续的空间中,在该空间内,行为相似的蛋白质被归为一类。这创建了一个关于蛋白质如何响应突变的全球坐标系,揭示了整个蛋白质集并非随机分布,而是遵循一种结构化模式。

为了让这张地图能用于特定的问题,团队专注于一个规模较小但高度多样化的、包含一百万个蛋白质的群体,来训练他们的主要模型,称之为 RegimeFormer。该模型学会了观察一个蛋白质并根据其所属的“状态”将其分配到地图上的一个位置。一旦蛋白质的状态已知,模型就可以预测如果更换一个氨基酸会发生什么。它通过计算蛋白质链中每一个位置的三个关键指标来实现这一点:脆弱性(fragility)、适应性(adaptability)和不确定性(uncertainty)。脆弱性衡量一个位置在发生改变时损坏的可能性。适应性衡量一个变化被容忍甚至产生帮助的可能性。不确定性则告诉研究人员模型对其预测的信心程度。

团队将该系统与现实世界的实验进行了对比测试,在这些实验中,科学家已经测量了数千种突变的影响。他们发现,模型的预测结果与实验结果高度吻合。更重要的是,当面对其他工具通常会失效的情况时,该模型表现出色:例如观察与其见过的内容迥异的蛋白质,或者处理在训练数据中较为罕见的蛋白质家族。这表明该模型学习到了关于蛋白质运作的基本规则,而不仅仅是记住了特定的例子。研究人员还检查了他们的预测在生物学上是否合理。他们发现,模型标记为“脆弱”的位置,恰恰是蛋白质通常执行最关键任务(如与其他分子结合或催化化学反应)的位置。相反,“适应性”高的位置通常位于蛋白质可以改变形状而不致损坏的区域。

为了证明这张地图不仅仅是一个数学技巧,研究人员将他们的结果与来自其他领域的独立数据进行了比较。他们查看了由其他人工智能系统预测的蛋白质三维结构,发现被模型标记为脆弱的蛋白质往往结构稳定性较低,而标记为适应性的则更为稳定。他们还考察了进化史,观察蛋白质在数百万年间是如何变化的。他们发现,模型识别出的脆弱位点正是那些在漫长岁月中保持不变的位点,这表明自然界长期以来一直在筛选掉这些区域的变化。这种与结构和进化证据的一致性证实,该模型揭示了一个真实的生物学事实。

该系统的力量在于其可扩展性。虽然模型是在一百万个蛋白质上训练的,但它被应用于整个图谱中近 4 亿个单独的位点。这创造了一个庞大的预测库供科学家查询。研究人员不再需要等待昂贵且耗时的实验室实验来测试每一种可能的突变,现在他们可以使用这张地图来优先筛选值得测试的突变。团队展示了使用这张地图来选择测试突变比使用旧方法效率显著更高,能够让科学家以更少的实验次数找到有益的变化。

除了预测蛋白质行为之外,研究人员还将这张蛋白质图谱与细胞反应联系起来。他们将蛋白质层面的预测与细胞在暴露于药物或其他压力源时基因活动发生变化的数据联系起来。他们发现,蛋白质层面的洞察有助于解释为什么某些细胞会对药物做出特定的反应。这种从分子层面到细胞层面的桥接表明,了解蛋白质的“状态”可以帮助预测整个细胞或生物体的行为。团队还构建了一个名为 RegimeAtlas Explorer 的公开工具,允许任何人搜索这个庞大的数据库,可视化预测结果,并查看其背后的证据。

这项工作代表了科学家看待蛋白质世界方式的一种转变。研究人员表明,蛋白质并非作为孤立实体必须逐一研究,而是存在于一个全局的行为系统中。通过绘制这个系统的地图,他们创造了一个可以引导未来生物学发展的工具,从设计新药到理解疾病的遗传基础。该模型不仅预测会发生什么,它还揭示了蛋白质为何如此运作的底层逻辑,为通过新的视角观察生命的机械装置提供了可能。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →