← 最新论文
💻 bioinformatics

A foundation model enables prediction of natural product molecular properties, bioactivity, and structural similarity from biosynthetic gene cluster sequence

本文介绍了 BGC-MLM,这是一种在未标记的生物合成基因簇序列上进行预训练的基础模型,它显著提高了对天然产物性质、生物活性和结构相似性的预测能力,从而增强了挖掘新型天然产物的基因组挖掘效率。

原作者: Walker, A.

发布于 2026-07-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Walker, A.

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

想象一下,你是一名正在一座宏伟的古籍图书馆中寻找稀有魔法药水的寻宝猎人,而这些药水就隐藏在古书之中。在科学世界里,这些“药水”就是天然产物(如药物或化学物质),而这些“书”则是生物合成基因簇(即告诉细菌或真菌如何制造这些药水的 DNA 指令组)。

问题在于,科学家们已经发现了数百万本这样的“指令书”,但他们只有时间和资源去打开并测试极小的一部分。大部分图书馆都处于未被触及的状态,我们也不知道哪些书里藏着最令人兴奋的宝藏。

旧方法 vs. 新方法

以前,科学家尝试使用计算机程序(机器学习)来猜测特定的一组指令会制造出什么样的药水。然而,这些程序就像是在试图通过只读字典中寥寥几页来学习一门语言的学生。因为缺乏足够的“标记”数据(即我们已经已知其内部药水的书籍),这些程序的猜测能力并不理想。

“基础模型”解决方案

这篇论文介绍了一个名为 BGC-MLM 的新工具。你可以把它想象成一个利用巧妙技巧进行学习的超级聪明的学生:

  1. “填空式”训练(预训练): 首先,给这个学生数百万本指令书,但其中一些词语被隐藏了(掩码)。学生的任务是根据上下文来猜测缺失的词。尽管学生还不知道这些书最终会做出什么样的药水,但这个过程教会了他们生物指令的“语法”和“结构”。他们学习了自然界化学的“语言”。
  2. 专项测试(微调): 一旦学生掌握了这门语言,他们就会被交给一个特定的任务:“观察这本指令书,并告诉我它制造出的药水是否可能杀死细菌、分子的形状如何,或者它包含哪些化学部分。”因为学生已经如此深刻地理解了这门语言,所以即使只有极少数的例子,他们也能非常快速地学会这些特定任务。

这篇论文的发现

研究人员将这种新的“基础模型”与旧方法进行了对比测试。他们发现:

  • 先学习语言有助于提升表现: 经过“填空式”训练的模型,比那些试图在没有背景知识的情况下直接学习的模型表现得更好。
  • 它是一个多功能工具: BGC-MLM 可以预测关于潜在药水的许多不同信息,例如其生物活性(它可能产生的生物作用)、结构类别(它属于哪个家族),甚至可以统计特定的化学部分(官能团)。
  • 它足以胜任: 它的表现与那些专为单一特定任务设计的工具不相上下,甚至更优。

简而言之,这篇论文展示了一种聪明的、具有适应性的 AI,它首先学习自然界指令手册的“语言”,从而使其能够高效地预测哪些隐藏指令极有可能产生最有趣的化学宝藏,让寻找新药的过程变得更加快速且高效。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →