← 最新论文
📄 synthetic biology

TaxoFormer: Hierarchical Transformer for Predicting the Full Taxonomic Lineage of Protein Sequences

本文介绍了 TaxoFormer,这是一种层次化 Transformer 架构,它利用结构化标记化方案来无损地表示庞大的 NCBI 系统发育树,使一个简单的生成模型能够准确预测完整的蛋白质分类谱系,并从 1.88 亿条序列中学习有意义的系统发育表示。

原作者: Parsa, M., Azimian, K., Wei, K. Y.

发布于 2026-06-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Parsa, M., Azimian, K., Wei, K. Y.

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

想象一下你拥有一棵巨大的、古老的家族树,它包含了地球上每一个现存的生物,可以追溯到数十亿年前。这棵树如此庞大,拥有超过 130 万个分支和叶片。现在,想象你发现了一个神秘的蛋白质(生命的一个微小构建模块),你的任务是弄清楚它在这一巨大家族树中的确切位置。

这就是 TaxoFormer 这篇论文所解决的挑战。以下是他们如何解决这一问题的简单解释:

问题所在:藏书过多的图书馆

通常,当计算机试图预测某个事物的类别时,它们会将每个类别视为一个独立的、互不相关的选项。但在生物学中,类别是像家族树一样相互关联的。如果你知道某个东西是“哺乳动物”,你就自动知道了它也是“动物”和“真核生物”。

研究人员希望教会计算机仅通过观察蛋白质的序列(其遗传密码),就能预测出该蛋白质的整个家族历史,而不仅仅是猜测最终的标签。

解决方案:用于树状结构的特殊“拉链”

团队构建了一个名为 TaxoFormer 的新 AI 模型。他们的最大窍门在于如何教计算机去“阅读”这棵家族树。

  • 旧方法: 想象一下,试图通过列出每一页上的每一个单词来描述一本 130 万页的书。这会变得非常庞大且混乱。
  • TaxoFormer 的方法: 他们发明了一种特殊的“词汇表”(一套由 15,000 个唯一代码组成的集合),它就像一个拉链。这个拉链可以将整个 130 万个节点的家族树锁定在一起,形成一种紧凑、有序的格式,且不会丢失任何细节。这就像是将一片蔓延、纠缠的森林变成一串整齐的珠子,珠子的顺序讲述了整个故事。

它是如何工作的:讲故事的人

他们采用了一个已经对蛋白质了解很多的聪明 AI(称为 ESM-2),并给了它一个新工作:讲故事

AI 不仅仅是指出一个标签,而是被要求逐字逐句地写出蛋白质的家族历史,从最广泛的类别一直写到最具体的类别。这就像是要求一名侦探逐步重建嫌疑人的整个行踪,而不是仅仅猜测其最终目的地。

他们使用包含 1.88 亿个蛋白质 的庞大库来训练这个讲故事的人。他们没有使用任何复杂的、自定义的规则;他们只是使用了一种标准的“纠正错误”方法(交叉熵)。

结果:学习地图

结果令人印象深刻。该模型不仅答对了问题,它实际上还学习了地图

因为 AI 必须写出整个家族树才能得到答案,所以它自然而然地理解了不同生命群体是如何相互关联的。它在自己的“大脑”中创建了一个精神空间,在这个空间里,亲缘关系近的蛋白质靠在一起,而亲缘关系远的则相距较远,而这一切都是在没有被明确告知的情况下完成的。

核心结论

这篇论文表明,如果你给 AI 一个清晰的、结构化的方式来观察全貌(整个家族树),并要求它循序渐进地描述这张图景,它就会变得极其擅长理解自然界中隐藏的联系。这是一种快速、高效的方法,可以在不需要将蛋白质与每一个其他蛋白质进行逐一对比的情况下,对其进行标注。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →