← 最新论文
🧬 biology

Deciphering the Language of Nature: A transformer-based language model for deleterious mutations in proteins

该论文介绍了 MutFormer,这是一种结合了自注意力机制和卷积层的 Transformer 模型,用于预测人类蛋白质中的有害错义突变,通过有效捕捉短程和长程序列依赖性,证明了其性能可与现有工具相媲美或更优。

原作者: Theodore Jiang, Li Fang, Kai Wang

发布于 2026-07-15✓ Author reviewed
📖 1 分钟阅读☕ 轻松阅读

原作者: Theodore Jiang, Li Fang, Kai Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

想象一下,你的身体是一座由一本巨大的说明书构建而成的、繁忙且生机勃勃的城市。这本手册由四种字母代码(A、C、T、G)编写,告诉你的细胞如何制造维持生命运转的机器。有时,手册中的一个字母会出现“拼写错误”。大多数情况下,这些错误是无伤大雅的,就像食谱中写错了一个单词,但味道依然不错。但偶尔,一个错误会改变关键的成分,将一个美味的蛋糕变成一块砖头。这些发生在构建蛋白质的部分手册中的“拼写错误”被称为错义突变(missense mutations)。科学家们长期以来一直试图构建数字侦探,以从无害的错误中识别出危险的错误,但这是一项艰巨的任务,因为这些指令如此复杂且依赖于上下文环境。

要理解这篇论文中描述的新工具,你需要了解两件事。首先,蛋白质是长链状的构建块,称为氨基酸。这些构建块的顺序决定了蛋白质如何折叠以及它如何发挥作用。其次,在计算机世界中,有一种人工智能被称为“Transformer”。你可能知道它们是智能聊天机器人或翻译应用背后的“大脑”,能够理解句子中即使相距很远的词语之间的关系。科学家们最近开始使用这些相同的“语言”大脑来阅读“生物语言”,将蛋白质链视为句子,将氨基酸视为单词。核心问题在于:一个学会了阅读人类语言的计算机,是否也能学会阅读生命语言,并足以预测哪些遗传错误会导致疾病?

于是,由研究员 Theodore T. Jiang、Li Fang 和 Kai Wang 开发的全新数字侦探——MutFormer 应运而生。他们决定构建一个专门用于理解蛋白质“语法”的 Transformer 模型。MutFormer 不仅仅孤立地观察单个突变,它会阅读整个蛋白质序列,关注每一个氨基酸如何与包括近处和远处在内的每一个其他氨基酸进行相互作用。

研究人员首先为 MutFormer 制定了一个庞大的教学计划。他们向它输入了超过 128,000 条人类蛋白质序列,包括“正确”的版本以及在普通人群中常见的无害突变版本。你可以把这想象成向 AI 展示数百万个句子,让它在不被告知哪些是“错误”的情况下,学习蛋白质语法的规则。在训练过程中,MutFormer 学会了预测缺失或被打乱的部分序列,从而有效地学习了生命的“句法”。

在模型完成预训练后,研究人员给了它一个特定的测试:识别哪些突变是危险的。他们利用已知致病突变和无害突变的数据库对 MutFormer 进行了微调。他们实验了三种不同的提问方式,让模型执行任务:

  1. 逐残基法(Per Residue): 要求模型将链中的每一个氨基酸标记为“安全”或“不安全”。
  2. 单序列法(Single Sequence): 向模型展示突变的蛋白质,并问道:“这整个东西坏掉了吗?”
  3. 配对序列法(Paired Sequence): 向模型同时展示原始蛋白质和突变版本,让它进行对比并判断这种变化是否有害。

结果非常明确:配对序列法效果最好。这就像是给侦探提供了原始蓝图和修改后的蓝图,以便通过对比发现差异。

但 MutFormer 的真正聪明之处在于这里。大多数以往用于此工作的 AI 模型都使用固定的“词汇表”(氨基酸模式),这些词汇表是无法改变的。然而,MutFormer 使用了一种涉及**卷积层(convolutional layers)**的特殊技巧。你可以把这些层想象成一组可调节的透镜,模型利用它们来扫描蛋白质。MutFormer 并不依赖于预制的词典,而是利用这些透镜在训练过程中学习属于自己的重要模式“词汇”。这就像是这位侦探不仅背诵了字典,还学会了识别蛋白质独特的“笔迹”和风格。

当研究人员使用 MutFormer 与现有的工具(该领域的现有“侦探”)进行对比测试时,它表现出了极强的竞争力。在与其训练数据相似的通用数据集上,MutFormer 的表现与现有最优秀的方法持平甚至更优。即使是在非常不同的数据集上——具体是在一些模型此前未见过太多数据的特定基因突变中——它依然能够达到顶尖工具的水平。

论文还指出,MutFormer 并不只是在重复其他工具的结论。当他们将 MutFormer 的预测结果与依赖进化历史(观察物种在数百万年间如何变化)的工具 EVE 进行比较时,发现这两个工具并不总是达成一致。这表明 MutFormer 捕捉到了不同的线索——具体来说,是蛋白质序列的即时“语法”——而进化工具可能会忽略这一点。

研究人员谨慎地指出,虽然 MutFormer 是一个强有力的竞争者,但它并不是解决一切问题的“魔杖”。该模型是基于特定的数据集进行训练的,因此像任何学生一样,面对它从未见过的题目时可能会遇到困难。他们还提到,该模型目前主要依赖于字母序列,尚未完全整合 3D 形状或其他生物学因素(如甲基化),未来引入这些因素可能会使其变得更加聪明。

简而言之,MutFormer 表明,通过将蛋白质视为一种语言,并使用一种可以学习自身词汇的复杂“语言模型”,我们可以获得一个全新的、强大的视角,来识别哪些遗传错误是危险的。这是一个充满希望的进展,有助于医生和科学家优先处理那些需要高度关注的遗传变异,从而在完善现有工具的基础上,为人类健康提供更清晰的图景。目前,代码和模型已开放供他人使用和开发,为探索如何破解这种“自然语言”开启了大门。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →