← 最新论文
📄 plant biology

BOTANIC-1: a series of long-context plant genomic foundation models in the agentic era

本文介绍了 Botanic1,这是一个由基于未标注植物数据训练的长上下文、集成智能体基因组语言模型家族,该系列模型在预测性状相关区域方面优于现有模型,并通过机制可解释性提供生物学见解,同时向研究界开放,以加速气候韧性作物的开发。

原作者: Barozet, A., Cabeli, V., Ogier du Terrail, J., Rukhovich, A., Janssoone, T., Klajer, G., Sheikhitarghi, Z., Andrews, G., Veran, C., Strouk, L.

发布于 2026-09-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Barozet, A., Cabeli, V., Ogier du Terrail, J., Rukhovich, A., Janssoone, T., Klajer, G., Sheikhitarghi, Z., Andrews, G., Veran, C., Strouk, L.

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

想象一个生命的代码由由 A、C、G 和 T 这四个字母组成的语言书写的世界。这些字母构成了 DNA 序列,决定了一株植物如何生长、如何抵御干旱以及如何对抗疾病。几十年来,科学家们一直试图解读这种语言,但它是一篇宏大而复杂的文本,拥有数十亿个词汇,且其中大部分是以随物种而异的方言书写的。当植物面临恶劣的气候或新的病虫害时,解决方案往往在于这段代码中一个微小的变化——仅仅是一个字母的替换,就可能让作物变得更加强壮。寻找这个特定的变化,就像是在一座图书馆规模的草堆中寻找一根针,而这根针对肉眼而言是隐形的。传统方法依赖于通过比较许多植物来寻找模式,但这既缓慢又昂贵,且往往会让研究人员面对成千上万种可能性,而不是一个清晰的答案。

巴黎的一支研究团队现在引入了一种阅读这种生物文本的新方法。他们构建了一个名为 Botanic1 的人工智能模型家族,专门用于理解植物 DNA 的语法。与以往需要人类教授生物学规则的工具不同,这些模型是自主学习这种语言的。他们向模型输入了 320 种不同植物物种的遗传序列(从微小的苔藓到高耸的树木),并要求模型预测序列中缺失的字母。通过进行数百万次的这种练习,模型学习了 DNA 结构的隐藏规则、基因如何开启与关闭,以及代码中的微小变化如何影响植物。其结果是一个能够观察一段长长的 DNA 序列,并能瞬间感知哪些部分对植物生存至关重要,以及哪些变化可能是有害或有益的系统。

研究人员不仅构建了一个模型,还创建了一个利用智能软件代理(agents)来管理整个训练和测试过程的“工厂”。这些代理负责处理繁重的任务,包括组织数据、运行实验和修复错误,从而让人类科学家能够专注于宏大的构想。这种方法使他们能够训练出可以读取长达 128,000 个字母长度 DNA 序列的模型,这一长度捕捉到了此前无法同时分析的基因组不同部分之间的远程相互作用。在测试中,这些模型的表现优于现有的所有其他工具,包括那些规模更大、训练数据更多的工具。它们能够识别 DNA 中最重要的部分,例如基因开始和停止的边界,甚至能发现指示细胞如何剪切和粘贴其遗传指令的特定信号。

这项发现之所以特别强大,是因为模型在没有被告知规则的情况下自主学习了这些规则。当研究人员深入观察模型内部以了解其学习内容时,他们发现 AI 独立发现了诸如“剪接位点”(splice sites)之类的生物学概念,即基因在变成蛋白质之前如何进行编辑的指令。在一个引人注目的例子中,模型识别出了基因中一个特定的位置,而标准的科学数据库在此处标记错误已超过二十年。模型的内在逻辑指向了另一个位置,当研究人员检查该基因的历史记录时,发现 1 世纪 1999 年的原始描述实际上是正确的,而模型重新发现了被后来的更新所遗失的真相。这表明这些模型可以作为一种新型显微镜,揭示隐藏在数据中但被人类注释所忽略的生物学真相。

该团队还展示了这些模型如何以一种全新的方式与人类研究人员协作。他们设定了一个场景:要求一个通用人工智能代理去寻找导致甜瓜特定性状的原因——即为什么有些植物产生雌花,而有些植物则同时产生雌性和雄花。该代理获得了一份包含数千个遗传差异的列表,并被要求找出负责该性状的那一个。当该代理尝试仅使用标准工具来解决问题时,它可以缩小列表范围,但无法选出正确答案。然而,当研究人员将 Botanic1 模型作为工具提供给该代理时,该代理立即将正确的遗传变化排在了第一位。模型提供了一个关于遗传变化“令人惊讶程度”的连续度量,这有助于代理从噪声中分辨出真正的诱因。

这项工作代表了我们研究植物方式的一次重大飞跃。通过教机器阅读 DNA 的语言,研究人员创造了能够加速寻找能够抵御气候变化的作物的工具。这些模型不仅速度更快,而且更准确,并且能看到此前无法察觉的模式。它们提供了一种方法,让我们从猜测哪些基因可能重要,转向以极高的信心确定哪些基因是关键。随着研究人员向科学界发布这些工具,他们开启了一个植物生物学的新时代,在这个时代,复杂的生命代码可以以此前难以企及的速度和精度得到理解与改良。这些模型现在已向其他科学家开放使用,有望帮助培育更好的作物,并理解植物界生命的基本机制。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →