Targeted ortholog search in unannotated genome assemblies with fDOG-Assembly
该论文介绍了 fDOG-Assembly,这是一种能够直接在未注释的基因组组装体中进行针对性的、特征架构感知的直系同源物搜索的新型工具,从而克服了依赖预先注释蛋白质组的传统方法的局限性,并揭示了新的生物学见解,例如跳虫中广泛存在的 -内酰胺生物合成潜力。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
地球上的生命是以一种存在于每个生物细胞内的代码形式书写的,这是一套告诉有机体如何构建自身并运作的指令。科学家们已经非常擅长读取这种代码的原始字母——DNA,涵盖了从最微小的昆虫到最大的哺乳动物等无数物种。他们可以提取组织样本,进行 DNA 测序,并将这些微小的片段拼接在一起,形成一个完整的基因组,这本质上就是该物种完整的遗传指令库。然而,拥有这座图书馆仅仅是成功了一半。要真正理解一个物种是什么以及它是如何进化的,科学家需要知道那座图书馆中哪些部分是真正的“工作章节”——即构建蛋白质并驱动生命过程的基因。对于公共数据库中成千上万个全新的基因组而言,这些章节尚未被标记或识别。没有这些标签,数据就像一本被锁住的书,难以用于理解不同物种之间的亲缘关系或其运作方式,导致大量的生物学潜力未能被开发利用。
一个研究小组开发出一种新方法,无需先阅读每一页,即可解锁这些未标记的遗传库。他们创建了一个名为 fDOG-Assembly 的工具,旨在直接在原始的、未经注释的 DNA 序列中搜寻特定的、熟悉的遗传模式。传统上,寻找这些模式需要一个费力的过程,即首先识别基因组中的每一个基因,这一步骤既缓慢且往往在处理复杂生物时会失败。这种新方法完全跳过了中间步骤。它不再试图绘制整个图书馆的地图,而是寻找特定的、已知的序列,这些序列就像独特的指纹。研究人员将他们的工具与现有方法进行了对比测试,发现它在寻找这些标准遗传标记方面的表现同样出色,但具有一个关键优势:它不受限于那些在所有生命体中通用的、数量有限的固定基因列表。它可以搜索科学家感兴趣的任何特定基因,甚至是在那些从未被完整绘制出图谱的基因组中。
为了证明该工具的有效性,研究人员利用它在老鼠和一种海葵近亲(一种类似水母的生物)的基因组中寻找五千个人类基因。结果令人震惊。这种新方法找到基因的成功率与依赖于完整标注蛋白质列表的最佳传统工具相匹配。更重要的是,它找到了那些由于原始基因图谱不完整而导致旧方法遗漏的基因。通过填补这些缺失的部分,该工具有助于科学家构建一个更完整的关于基因如何在生命之树中共享的图景。随后,研究人员将这一能力应用于一个涉及土壤生物的现实世界谜题。他们扫描了 176 种不同的土壤无脊椎动物的遗传库,专门寻找负责制造 β-内酰胺类抗生素(一类用于对抗细菌感染的强效药物)的基因。
这次搜索带来了一个令人惊讶的发现。制造这些抗生素所需的基因并不罕见或孤立存在;它们广泛分布于跳虫(一种常见的微小土壤节肢动物)之中。在某些个体物种中,研究人员发现了产生头孢菌素(一种特定类型的 β-内酰胺类抗生素)所需的几乎整套指令。这表明,这些微小且常被忽视的生物可能是这些救命化合物的天然工厂,而这一事实此前因其基因组缺乏妥善注释而被隐藏了起来。这项研究并未声称已证明这些动物目前正在大量生产这些药物,但完整遗传机制的存在强烈暗示了它们具备这种能力。通过允许科学家直接搜索原始遗传数据,这个新工具为在多年来一直堆放在架子上的庞大且未开发的基因组数据集中寻找隐藏的生物宝藏打开了大门,将那些未读之书转化为活跃的发现资源。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。