Vipsania: Unsupervised Deep Gene Finding
Vipsania 是首个通过直接从未注释序列中学习,从而准确预测多样化真核基因组中蛋白质编码基因结构的无监督深度学习工具,由此克服了需要高质量训练数据且在处理远缘或基部演化支时表现不佳的有监督方法的局限性。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
我们在地球上发现的每一个新生命形式,在科学上的生命始于一串字母:一段漫长且连续的DNA序列,它包含了构建生物体的蓝图。但原始序列就像一本语言中的书,其中的单词间距被抹去了,大写字母也被移除了。为了理解该生物如何运作,科学家必须首先找到“句子”——即基因——它们告诉细胞如何构建蛋白质,而蛋白质是执行生命实际工作的分子机器。这个过程被称为基因发现(gene finding),是几乎所有生物学研究中至一个至关重要的第一步。没有它,基因组就只是一段沉默的代码。几十年来,解读这些代码最可靠的方法是寻找来自外部世界的线索,例如将DNA与已知近缘物种的已知蛋白质进行比对,或使用RNA数据来观察基因组的哪些部分是活跃的。然而,当科学家遇到地球上绝大多数生命时,这种方法就会遭遇瓶颈,因为这些生命既没有具有已知基因的近亲,也没有可用的RNA数据。对于这些生物而言,构建生命的指令一直处于隐藏状态。
格赖夫斯瓦尔德大学(University of Greifswald)的研究团队现在推出了一种名为 Vipsania 的新工具,它改变了我们阅读这些“沉默之书”的方式。Vipsania 不依赖外部线索或预设的地图,而是通过阅读DNA序列本身来学习寻找基因,而无需任何关于基因特征的先验知识。研究人员在来自数千个不同物种的近一万亿个DNA字母上训练了这个计算机程序,教它根据之前的字母来预测序列中的下一个字母。在这个过程中,该程序意外地学习到了生命的“隐藏语法”:即区分基因与周围非编码DNA的特定模式。其结果是一个能够准确识别几乎任何真核生物(从微型藻类到复杂动物)中基因的系统,即使从未有人见过该特定类群的基因。
寻找基因的挑战在于,指令并不是以简单的、连续的线条形式编写的。在复杂生物体中,编码蛋白质的基因部分经常被长段的非编码DNA所中断,就像一个句子中重要的单词被随机、无意义的填充物隔开一样。为了重建基因,计算机必须弄清楚这些中断从哪里开始、在哪里结束,以及句子是以什么方向被读取的。传统方法依赖于“监督式”学习,即向计算机展示来自研究充分的物种的数千个正确基因示例,并教会它识别这些模式。这对于人类或果蝇等熟悉类群效果很好,但当计算机遇到与其训练样本差异过大的物种时,就会失效。如果计算机只见过哺乳动物的基因,它在寻找海绵或真菌的基因时就会感到困难,往往会遗漏它们,或者凭空创造出并不存在的结构。
Vipsania 采取了一条不同的路径。它是一个“无监督”系统,这意味着在训练期间,它从未见过任何一个正确的基因示例。相反,它被给予了原始的DNA序列,并被要求填补空白。研究人员遮蔽了序列中的随机字母,并要求模型根据周围的上下文来猜测这些字母。为了使这项任务成为可能,他们在计算机的大脑中构建了一个特殊的层,充当“语法检查器”。这一层强制执行基因结构的规则,例如确保阅读框保持一致,以及终止信号出现在正确的位置。随着模型试图预测缺失的字母,它必须学习基因组的底层结构才能成功。随着时间的推移,模型自主发现了基因的模式,学会了如何在没有任何关于“什么是基因”的告知下,区分编码区和非编码区。
这种方法的成果是惊人的。在与现有最佳工具进行对比测试时,Vipsania 在他们检查的几乎所有生物类群中都表现出了更高的准确性。虽然其他方法在应用于远缘物种时往往会降低准确性,但 Vipsania 保持了其性能,证明它学习的是生命的根本规则,而非仅仅是记忆特定的例子。在涉及真菌、昆虫和各类藻类的测试中,Vipsania 正确识别了绝大多数情况下的基因结构,其表现往往优于那些依赖大量外部数据的工具。它甚至成功找到了使用略有不同的遗传密码的生物中的基因,在这些生物中,标准的基因“终止”信号具有完全不同的含义。通过仅调整一个小设置以匹配特定生物的编码,研究人员能够在短短几小时内完成对单个基因组的训练,并立即开始生成准确的注释。
这种能力对于生物学的未来至关重要。目前一项全球性的宏大工程正在进行中,旨在测序地球上所有已知物种的基因组,该项目目标是创建一个包含所有167万种已知真核生物的参考库。然而,瓶颈不再是测序DNA,而是注释它。目前,公共数据库中只有不到20%的基因组拥有基因注释,这使得包括许多类型的藻类和微型动物在内的整个生命之树的分支都缺乏结构图谱。Vipsania 提供了一种填补这一空白的方法。因为它不需要RNA数据或近缘物种即可工作,所以它可以应用于任何基因组,无论对该生物物的了解程度多么有限。研究人员已经发布了针对17个主要生命类群的预训练模型,覆盖了超过99%的已知真核物种,并为剩余的部分提供了一个通用模型。
Vipsania 的成功表明,基因结构的规则足够普遍,仅通过DNA的原始文本本身即可被学习。通过消除对外部证据的需求,研究人员创造了一个能够照亮生命之树最黑暗角落的工具。虽然使用RNA数据的工具对于数据丰富的研究充分的物种来说可能仍是最佳选择,但 Vipsania 为地球上绝大多数从未以这种方式被研究过的生命提供了最先进的解决方案。它代表了一种从依赖“我们已知什么”向“发现那里存在什么”的转变,仅仅通过倾听基因组本身的语言。科学家们首次拥有了一种可以为几乎任何真核生物生成高质量基因图谱的方法,将沉默的DNA字符串转化为生命的、可读的指令。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。