← 最新论文
🧬 biology

Yeti: A compact protein structure tokenizer for reconstruction and multi-modal generation

本文介绍了 Yeti,这是一种基于无查找量化与流匹配技术的紧凑且富有表现力的蛋白质结构分词器,其实现了高重建精度与令牌多样性,从而能够训练小型多模态模型,使其具备从头生成合理蛋白质序列与结构的能力。

原作者: Nabin Giri, Steven Farrell, Kristofer E. Bouchard

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Nabin Giri, Steven Farrell, Kristofer E. Bouchard

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

想象一下,你正在尝试教会计算机理解和创造蛋白质。蛋白质是我们体内微小而复杂的机器,几乎负责所有功能,从消化食物到抵御感染。在计算机眼中,蛋白质看起来像是一串长长的、弯曲的珠子(氨基酸)串,它们折叠成特定的三维形状。

问题在于,计算机通常使用“离散”的词汇(如 0 和 1 或字母)进行交流,而蛋白质形状却是“连续”的(三维空间中平滑、漂浮的坐标)。这就像试图仅用一本由嶙峋岩石组成的词典,来描述一条平滑流动的河流。

本文介绍了Yeti,一种旨在解决这一翻译问题的新工具。以下是其工作原理的简明解释:

1. 问题:“河流与岩石”的两难困境

现有工具试图将蛋白质形状的平滑河流转化为岩石列表(离散标记),以便计算机读取。然而,大多数这些工具就像糟糕的翻译:它们擅长观察一条已形成的河流,并说出“构成这条河流的岩石是这些”,但它们极不擅长凭空想象一条新的河流。它们优先考虑复制的准确性,而非创造的能力。

2. 解决方案:Yeti(大师级翻译)

作者构建了Yeti(代表Yielding Encoded Tokens for Intermodality,即跨模态生成编码标记)。将 Yeti 想象成一位高效的翻译,它将蛋白质的平滑三维形状转化为计算机易于理解和操作的紧凑“单词”(标记)列表。

  • 词典:Yeti 使用包含 8,192 个独特“形状单词”的词典。
  • 方法:Yeti 并非仅仅记忆形状,而是使用一种称为**流匹配(Flow Matching)*的技术。想象一团尘埃(随机噪声)缓慢旋转并凝聚成完美的雪花(蛋白质)。Yeti 学习了尘埃变成雪花的确切路径。这使得它不仅能复制形状,还能生成*新的、合理的形状。

3. Yeti 的独特之处

本文将 Yeti 与其他“翻译器”(如 ESM3、DPLM-2 和 Kanzi)进行了比较,发现了三大优势:

  • 它是紧凑的天才:Yeti 出奇地小。它取得了与大 10 倍的模型相当的效果。这就像一台口袋大小的计算器,其解决数学问题的能力堪比占据整个房间的大型超级计算机。
  • 它充分利用了整个词典:许多翻译器变得懒惰,反复只使用词典中的少数几个词。Yeti 几乎使用了其 8,192 词词典中的每一个词。这意味着它拥有更丰富的词汇量来描述复杂的形状。
  • 它能从零开始创造:作者仅使用 Yeti 的单词和氨基酸序列训练了一个新的人工智能模型,从零先验知识开始。这个新模型能够同时发明蛋白质的序列(珠子串)及其三维形状。它无需庞大的预训练大脑即可完成这一任务,证明了 Yeti 的“单词”质量之高,足以从零构建新的蛋白质。

4. 工作原理(折叠之舞)

本文还观察了 Yeti 在生成过程中如何“折叠”蛋白质。这不是一条直线;而是一场包含两个阶段的舞蹈:

  1. 聚拢:首先,蛋白质迅速聚集成一个紧凑的球体(就像人群聚集)。
  2. 精炼:只有在最后阶段,它才会瞬间定格为其最终、详细的形状(就像人群突然组成特定的人体金字塔)。

核心结论

Yeti 是一种新颖、高效且富有表现力的方法,用于将蛋白质形状转化为计算机语言。它证明了你不需要庞大臃肿的模型来理解蛋白质;你只需要一个聪明、紧凑的标记器,能够流利地讲述三维形状的语言。这为计算机设计既结构稳固又功能实用的新蛋白质打开了大门,同时比现有方法消耗更少的计算资源。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →