← 最新论文
🧬 biology

Leveraging Natural Language Processing to Unravel the Mystery of Life: A Review of NLP Approaches in Genomics, Transcriptomics, and Proteomics

本综述探讨了从词嵌入到先进的 Transformer 和 Hyena 模型等自然语言处理技术,是如何被应用于分析基因组、转录组和蛋白质组数据,以揭示生物学见解并推进我们对生命过程的理解。

原作者: Ella Rannon, David Burstein

发布于 2026-07-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Ella Rannon, David Burstein

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

想象一下,生命的构建模块——DNA、RNA和蛋白质——不仅仅是化学链,实际上也是语言。正如英语拥有字母、单词和句子,并遵循语法规则来创造意义一样,生物学也有核苷酸(A, C, G, T)和氨基酸,它们遵循“生物语法”来创造生命。

这篇论文综述了科学家如何利用**自然语言处理(NLP)**技术——即那种能让 Siri 理解你或让 Google Translate 翻译法语的技术——来阅读并理解这些生物语言。

以下是使用日常类比对该论文核心观点的拆解:

1. 生物“阅读”能力的演进

论文追溯了计算机在阅读这些生物“文本”方面如何随着时间的推移而变得更加出色,从简单的工具进化到了超智能的 AI。

  • 旧方法 (Word2Vec 及其同类): 想象一下,仅通过查字典来试图理解一本书。你知道“run”这个词的意思,但你不知道它是指“跑一场比赛”还是“牛奶用完了”。早期的工具将每个生物字母或一小组字母视为具有固定含义的静态单词。它们速度很快,但忽略了上下文。
  • 中间阶段 (LSTMs): 随后出现了像人类阅读句子那样从左向右阅读文本的工具。它们理解一个词的含义会根据它之前的词而改变。然而,它们在处理非常长的句子(如整个基因组)时表现挣扎,因为当它们读到句子末尾时,往往会“忘记”句子的开头。
  • 当前的超级明星 (Transformers): 这是现代 AI(如 ChatGPT)背后的技术。这些模型可以同时阅读整个句子。它们使用一种称为“注意力”(attention)的机制,同时观察句子中的每一个词,以理解它们之间如何相互关联,无论它们距离多远。这对于生物学至关重要,因为 DNA 链最开头的一个字母可能会控制最末端的一个字母。
  • 新的挑战者 (Hyena): 即便是 Transformers 也有弱点:处理极长文本时会变得缓慢且耗费内存。论文介绍了一种名为 Hyena 的新架构,它就像一个超高效的阅读者,可以处理极其庞大的书籍(长达数百万个字母),而不会感到疲劳或耗尽内存。

2. “分词”(将文本切分为单词)的挑战

在人类语言中,空格告诉我们一个单词在哪里结束,另一个单词在哪里开始。但在生物学中,不存在空格。一段 DNA 只是由字母组成的漫长字符串:ATCGATCG...

论文解释说,科学家必须发明自己的“空格”,以教计算机如何阅读。他们使用不同的策略:

  • 字符级 (Character-level): 将每一个字母都视为一个单词。(细节丰富,但会产生非常长的句子)。
  • K-mers: 将文本切割成固定大小的块(例如,将每 3 个字母作为一个单词)。
  • 子词级 (Sub-word / BPE): 一种智能方法,学习将频繁出现的字母组合聚集在一起,类似于我们将“un-believ-able”视为三个部分而非一个长词。这有助于计算机处理它从未见过的新的或罕见的组合。

3. 生命的三种主要“语言”

论文回顾了这些工具如何应用于三种特定的生物“语言”:

  • DNA & RNA(指令手册):

    • 这些是蓝图。论文重点介绍了像 DNABERTHyenaDNA 这样的模型,它们通过阅读这些蓝图来寻找“开关”(启动子),从而开启或关闭基因,或者预测突变(文本中的“错别字”)可能如何改变结果。
    • 类比: 这就像使用 AI 扫描一份庞大的说明书,以找到哪一段落指示工厂开始制造汽车,或者发现会导致汽车爆炸的错别字。
  • 蛋白质(机器):

    • 蛋白质是根据 DNA 指令制造出的实际机器。它们更复杂,因为它们有 20 种不同的“字母”(氨基酸)而不是仅仅 4 种。
    • ESMProtTrans 这样的模型在这方面表现得极其出色。它们可以查看蛋白质序列并预测其 3D 形状(就像将一张纸折叠成纸鹤),或者弄清楚蛋白质的工作。
    • 类比: 如果 DNA 是食谱,那么蛋白质就是蛋糕。这些模型可以查看配料表,并精准预测出蛋糕看起来和尝起来是什么样子的,甚至可以设计出一种从未被烘焙过的“新蛋糕”。
  • 基因组(整个图书馆):

    • 有些模型不只是看单个基因,而是观察整个基因组(整个基因库),以了解基因是如何协同工作的。
    • gLM 这样的模型将包含多个基因的一段 DNA 视为一个单一的“句子”。这有助于它们理解基因是如何组织成簇的(就像书中的章节),以及它们是如何相互作用的。

4. 这些模型实际能做什么

根据论文,这些工具目前正被用于:

  • 预测结构: 仅通过查看其字母序列就能推断出蛋白质的 3D 形状(比传统方法更快)。
  • 寻找“错别字”: 预测 DNA 的单个变化如何影响一个人的健康或病毒的感染能力。
  • 生命分类: 仅通过阅读其遗传密码,识别样本属于哪种细菌或病毒。
  • 设计新生命: 生成自然界中不存在但可能具有有用功能的全新蛋白质序列(例如一种新的酶)。
  • 寻找调控元件: 定位 DNA 中控制基因表达的“开关”。

5. 局限性

论文谨慎地指出,这目前还称不上是魔法。

  • 上下文至关重要: 就像一个词可以有不同的含义一样,一个生物字母根据其所处的位置也可能意味着不同的东西。简单的模型会错过这一点;先进的模型捕捉得更好。
  • 数据饥渴: 最智能的模型需要海量的数据来学习,而处理这些数据的成本可能非常高昂。
  • “黑箱”问题: 虽然这些模型在预测结果方面表现出色,但我们有时并不完全理解它们为什么做出特定的预测,尽管科学家们正开始通过观察模型的“注意力图”(attention maps)来查看 DNA 的哪些部分引起了它的关注。

总结

简而言之,这篇论文认为,通过将生物学视为一种语言,我们可以利用现有的最强大的 AI 工具来解码生命的“语法”。我们正在从仅仅阅读 DNA 的字母,转向理解生命的语法、故事,甚至编写生命之书的新篇章。该领域正在迅速发展,新的模型不断涌现,以处理更长的序列和更复杂的生物学问题。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →