← 最新论文
💻 bioinformatics

TEDlm: domain-centric protein language models with optional structural pre-training

该论文介绍了 TEDlm,这是一种以结构定义域片段为预训练基础的领域中心蛋白质语言模型,其在远程同源性检测和分子功能预测方面优于规模更大的全序列模型,证明了专注于结构域内在信号可以产生紧凑且具备结构信息的表示。

原作者: Wei, T., Kandathil, S. M., Buchan, D. W. A., Jones, D. T.

发布于 2026-07-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Wei, T., Kandathil, S. M., Buchan, D. W. A., Jones, D. T.

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

将蛋白质想象成巨大的、错综复杂的乐高城堡。长期以来,试图通过阅读其“说明书”(氨基酸序列)来理解这些城堡的科学家们,一直是在同时阅读整本书。问题在于?这些书很杂乱。它们包含了建造城堡的指令,但也包含了关于桥梁、花园以及将一切连接在一起的随机涂鸦(连接子和无序区域)的指令。当你试图通过阅读整本杂乱的书来学习一个特定塔楼的形状时,信号会被噪声淹没。

于是,TEDlm 登场了——这是一支全新的 AI 侦探团队,他们决定不再阅读整本书,而是开始只阅读那些单独的、形态完美的乐高塔楼(称为“结构域”)。

核心理念:更小的书,更强大的大脑

研究人员(由 David T. Jones 和 Tiejun Wei 领导)构建了一种新型 AI,名为 TEDlm。它不再是在全长蛋白质序列上进行训练,而是从一个名为“结构域百科全书”(The Encyclopedia of Domains, TED)的海量库中,喂入数百万个这些干净、孤立的“结构域”片段。

可以这样想:如果你想学习如何烤出一个完美的巧克力蛋糕,你不会去读一本包含汤的食谱、汽车手册和面粉历史的食谱。你只会阅读关于蛋糕的章节。这就是 TEDlm 所做的。它学习了“蛋糕配方”(蛋白质结构域的具体形状和折叠),而没有被“汤的配方”(全长蛋白质中的杂乱部分)所干扰。

结果:小即是强

这里有一个令人惊讶的转折:尺寸并非决定一切。

通常在 AI 世界里,越大越好。一个拥有 30 亿个神经元的巨大大脑(比如著名的 ESM2 3B 模型)理应碾压一个只有 6.5 亿个神经元的小型大脑。但在这次竞赛中,这个较小的、专注于结构域的大脑赢了。

  • TEDlm 650M 模型(那个较小的、专注的模型)在名为 CATH S40 的一项艰巨测试中(该测试衡量模型识别蛋白质远亲的能力)得分 0.28 AUROC1
  • 巨大的 ESM2 3B 模型(那个庞大的、不专注的模型)仅得分为 0.22

论文指出,通过在更干净的数据上进行训练,较小的模型比那个被全长噪声分散注意力的巨大模型,更好地学习了蛋白质的“折叠”。这就像那个专注于线索的小侦探,比那个试图阅读整个案卷每一页的巨大侦探更快地破解了谜团。

超能力:看见“隐形”的结构

团队还创建了一个增强版本,称为 TEDlm3D。这个模型不仅阅读乐高说明书,还获得了一份“秘密小抄”,展示了这些积木在 3D 空间中应该如何接触(具体来说,是“α-碳原子”,即结构核心积木之间的距离)。

这种额外的训练成为了一个游戏规则的改变者。

  • TEDlm3D 达到了 0.50 AUROC1
  • 这与使用实际 3D 结构来寻找匹配项的工具 Foldseek(得分为 0.53)非常接近。

令人惊叹的是,TEDlm3D 只需要文本(序列)即可工作。 在测试时,它不需要 3D 结构。它在训练期间学习了 3D 规则,现在仅通过阅读字母就能“看见”形状。论文表明,这种结构信号不仅仅存储在一个单独的“输出头”(类似于连接在大脑上的计算器)中,而是被编织进了大脑自身的思考过程中。

关于其他任务

研究人员还在其他任务上测试了这些模型,例如预测蛋白质的“功能”(分子功能)或其结合金属的能力。

  • 分子功能: 专注于结构域的模型(TEDlm)表现出色,击败了大型 ESM2 模型。这很好理解,因为蛋白质的主要工作通常是由单个乐高塔楼(结构域)完成的。
  • 生物过程与定位: 在这些方面,大型 ESM2 模型守住了阵地。为什么?因为了解一个蛋白质在细胞中的位置或它如何帮助整个生物体,通常需要看到整个“城堡”,而不仅仅是一个塔楼。仅关注结构域的模型错失了大局背景。

“中间层”的惊喜

最酷的发现之一是关于 AI 在何处存储其知识。在许多 AI 模型中,最后一层是最“聪明”的。但在本研究中,研究人员发现 TEDlm 模型的中间层 实际上最擅长识别结构关系。最终层似乎变得过于专注于仅仅预测序列中的下一个字母,从而忘记了宏大的结构图景。这就像一个学生在备考后,由于太专注于背诵章节的最后一句,反而忘记了故事的主线剧情。

该论文排除了什么

作者谨慎地说明了他们 没有 做的事情。他们没有使用多序列比对(观察进化家族树)来训练这些模型;他们完全依赖于纯粹的序列和输入的结构数据。他们还指出,虽然他们的模型在寻找结构亲缘关系方面表现出色,但它们并不完美,无法预测依赖于整个蛋白质上下文的事物,例如热稳定性(即蛋白质在热量下的稳定性),因为热稳定性通常取决于不同塔楼之间如何相互作用,而不仅仅是塔楼本身。

总结

这篇论文表明,我们并不一定需要构建更大、更昂贵的 AI 大脑来理解蛋白质。相反,我们可能只需要喂给它们更干净、更专注的数据。通过教 AI 一次观察一个“结构域”,研究人员创造了紧凑且智能的模型,它们预测蛋白质形状和功能的能力,几乎可以媲美那些需要实际 3D 蓝图的工具。这提醒我们,有时为了看清全貌,你必须放大细节。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →