← 最新论文
🧬 biology

TheBioCollection: Unified Pre-Training Scale LLM Corpus for Biology

本文介绍了 TheBioCollection,这是一个统一的 52.6B token 预训练语料库,它将多样化的生物资源整合为一种通过计算属性和指令任务进行增强的凝聚性格式,在显著提升一个 16B 参数模型在多个领域的生物学理解与性能的同时,保留了其通用的语言能力。

原作者: Hyunjin Seo, Hyeon Hwang, Gyubok Lee, Jay Shin, Jimin Park, Taesoo Kim, Sanghoon Lee, Hongjoon Ahn, Sungjun Han, Sangwon Jung

发布于 2026-07-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Hyunjin Seo, Hyeon Hwang, Gyubok Lee, Jay Shin, Jimin Park, Taesoo Kim, Sanghoon Lee, Hongjoon Ahn, Sungjun Han, Sangwon Jung

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

想象一下,生物学的世界就像一座巨大且混乱的图书馆,书本到处乱放。有些是微小的分子蓝图,有些是庞大的蛋白质说明书,还有些是关于细胞如何相互交流的复杂地图。问题在于?这些“书”是用成千上万种不同且令人困惑的语言编写的——有些只是数字列表,有些是图表,而许多还被锁定在某种格式中,导致超智能的计算机大脑(大语言模型)实际上无法读取。

于是,THEBIOCOLLECTION 出现了,这是一支数字图书管理员团队,他们决定清理这一乱象。他们不仅收集了这些散落的资源,还构建了一个庞大的、统一的训练集,包含 526 亿个标记(tokens)(可以将其理解为单个单词或信息碎片),将所有那些杂乱的格式转化为一种单一的、可读的语言。

伟大的翻译工作
该团队获取了来自微小分子、蛋白质、DNA 序列甚至整个细胞的数据,并做了一件聪明的事:他们并没有只是简单地复制粘贴数据。他们使用了特殊的“翻译工具”来计算新的事实并将其以自然句子的形式写出来。

  • 系统不再仅仅给出一个分子的化学代码,而是计算了它的重量、它有多少个环以及它的“类药性”,然后写出一个句子来描述所有这些特征。
  • 不再仅仅列出蛋白质的序列,他们还添加了关于其形状以及它在细胞中位置的细节。
  • 他们甚至为以前缺失的事物创建了新的“测验问题”(指令任务),比如要求计算机设计一个新的蛋白质结合剂,或在 DNA 链上寻找特定的位点。

实验:教导一个大脑
为了测试这个新图书馆是否真的有效,研究人员采用了一个名为 Gravity-16B-A3B 的基础计算机大脑(它此前从未见过生物学数据),并将这个全新的集合喂给它。他们保持了大脑的架构完全不变,以确保结果纯粹是因为新数据而非因为他们改变了大脑本身。

结果:两位数的飞跃
结果非常强劲,令人惊喜。在接受了这个新集合的训练后,该模型的生物学任务处理能力提升了一倍以上

  • 它的总分从 0.223 跳升至 0.499
  • 它在所有领域都变得显著更好:理解小分子、设计蛋白质、寻找 DNA 位点,甚至弄清楚细胞如何对变化做出反应。
  • 最显著的进步发生在那些由工具进行结构化和计算的数据领域,例如寻找特定的 DNA 调控位点(从 0.134 跳升至 0.516)和设计蛋白质结合剂(从 0.234 跳升至 0.645)。

它没做到的事(“禁区”)
值得注意的是,这篇论文并未发现什么。研究人员明确测试了添加所有这些生物学数据是否会导致计算机大脑“忘记”如何说人类语言或解决通用谜题。他们将他们的新模型与一个仅阅读通用科学文章和网络文本的模型进行了对比。

  • 结果显示:经过生物学训练的模型在通用语言任务上的表现,几乎与仅阅读网络文本的模型一样出色。
  • 该论文排除了这样一种观点,即你必须牺牲通用智能来换取生物学智能。该模型在学习生物学的同时,并没有失去其聊天或推理世界的能力。
  • 该论文还指出,仅仅阅读科学文章(如来自 PubMed 的文章)会有所帮助,但它也反对认为仅靠阅读文本就足够了的观点。由工具计算出的结构化数据提供的提升远大于单纯的文本数据,尤其是在需要精确、非文本事实的任务中。

跨领域的神奇之处
最酷的发现之一是,该模型不仅仅学会了擅长一件事,它开始连接不同领域之间的纽带。当被要求将蛋白质的功能与其所属的通路联系起来,或者将药物与其影响的基因联系起来时,模型的准确率从 0.313 跳升到了 0.507。这表明模型正在学习如何在不同的生物层级之间进行“思考”,而不仅仅是记忆事实。

核心结论
论文表明,构建一个具备生物学素养的 AI,其秘诀并不一定在于一种新的、复杂的脑架构。相反,关键在于拥有一个高质量的、统一的、且经过工具增强的数据库。通过将零散、混乱的生物学数据转化为一个连贯的、可读的故事,研究人员展示了你可以教会一个通用 AI 理解生命深邃且复杂的语言,同时又不破坏它理解世界其他部分的能力。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →