← 最新论文
🧬 biology

How Post-Training Shapes Biological Reasoning Models

本文表明,生物推理模型中的后训练阶段——具体包括持续预训练、监督微调和强化学习——会显著重塑泛化能力,揭示出最优性能需要平衡领域内增益与领域外鲁棒性,而非仅仅通过累积监督或计算量来实现。

原作者: Lukas Fesser, Hanlin Zhang, Michelle M. Li, Eric Wang, Bryan Perozzi, Shekoofeh Azizi, Sham M. Kakade, Marinka Zitnik

发布于 2026-06-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Lukas Fesser, Hanlin Zhang, Michelle M. Li, Eric Wang, Bryan Perozzi, Shekoofeh Azizi, Sham M. Kakade, Marinka Zitnik

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

想象一下,你正试图教一个非常聪明、通用的机器人如何成为一名生物学家。这个机器人已经了解了很多关于世界知识(一个“基础模型”),但它还不能流利地使用“生物学语言”。为了让它成为专家,你需要经历一个特定的训练过程。

这篇论文就像是一份详细的实验室报告,记录了如何训练这个机器人。研究人员测试了不同的训练方法,以观察哪些方法能让机器人在解决生物学问题时表现得更好,以及哪些方法会无意中让它在处理新的、陌生的情况时变得更差。

以下是他们研究结果的拆解,使用了简单的类比:

训练的三个阶段

研究人员测试了三个特定的训练阶段,并将它们与教导学生的方式进行对比:

  1. 持续预训练 (CPT):“学习语言”

    • 它是什么: 在教机器人特定任务之前,他们向它喂入了大量的生物学教科书、研究论文和 DNA 序列。
    • 结果: 这就像是在教学生生物学的词汇和语法。它不会让学生立刻成为解决特定谜题的专家,但它能确保他们理解该领域的“语言”。如果没有这一步,机器人在稍后理解问题时会感到吃力。
  2. 监督式微调 (SFT):“为考试而钻研”

    • 它是什么: 给机器人数千个带有正确答案的特定练习题。它学习完美地模仿这些答案。
    • 结果: 这就像是在为一场特定的考试进行突击复习。机器人会对它练习过的精确类型的问题(领域内)表现得非常出色
    • 陷阱: 机器人对这些特定问题钻研得越多,它就越开始“背诵”答案,而不是理解概念。如果你给它一个它从未见过的新类型生物学问题(领域外),它往往会失败。它变成了一个只会“应试”而无法跳出框架思考的学生。
  3. 强化学习 (RL):“从错误和奖励中学习”

    • 它是什么: 机器人不再只是复制答案,而是尝试自己解决问题。如果它得到了正确答案,它会获得“奖励”(高分)。如果失败了,它会学习进行调整。
    • 结果: 这就像是将学生置于一个真实的场景中,让他们必须自己去摸索。
    • 魔力: 当你在机器人已经掌握了基础知识 (CPT) 并完成了一些练习钻研 (SFT) 之后进行此步骤时,它实际上恢复了处理新的、陌生问题的能力。它不再仅仅是死记硬背,而是开始进行推理。

重大发现(训练的“规则”)

研究人员发现,增加训练时间并不总是会让机器人变得更聪明。事实上,它可能会让它在处理通用任务时变得更笨。以下是他们的关键规则:

  • 规则 1:“过度钻研”问题
    如果你让“监督式微调”(钻研练习题)持续太久,机器人会变成一个在通用生物学方面失败的专家。它在考试中表现极佳,但失去了适应新疾病或物种的能力。

    • 类比: 这就像一位厨师练习制作一种特定的蛋糕,练了一千遍。他们成为了制作那款蛋糕的世界冠军,但如果让你做一碗汤,他们却完全不知所措,因为他们忘记了如何进行通用的烹饪。
  • 规则 2:RL 是“泛化能力的助推器”
    强化学习是让机器人变得稳健的秘诀。如果你从一个已经完成了部分练习钻研(SFT)的机器人开始,然后转向强化学习(RL),机器人会变得更好地处理新情况,同时不会失去处理旧情况的能力。

    • 类比: 这就像是把那位厨师带进一个食材随机的厨房,并对他说:“做出美味的东西来。”他们必须运用他们的创造力和对风味的理解,而不仅仅是依靠食谱记忆。
  • 规则 3:“不对称”预算
    你拥有有限的“训练时间”(计算资源)。你应该如何分配它?

    • 不要把所有时间都花在钻研(SFT)上。
    • 应该花一点时间钻研以掌握基础,然后将大部分时间花在强化学习(RL)上。
    • 类比: 想想盖房子。你需要坚实的基础(CPT)和一些框架(SFT),但不应该把 90% 的预算仅仅花在粉刷前门上。你需要把剩下的预算花在实际的结构和管道上(RL),以使房子在不同的天气下都能居住。
  • 规则 4:规模大并不意味着不同
    他们测试了不同的“大脑容量”(模型骨干)。他们发现,更大的大脑(更强的模型)整体上确实更聪明,但它们仍然会遭受同样的“过度钻研”问题。你如何训练它们(阶段)比模型本身有多大更重要。

最终配方

论文得出结论,要构建最好的生物学推理 AI,你不应该只是投入更多的资料或时间。你需要一个特定的配方:

  1. 先教语言(持续预训练)。
  2. 进行少量的练习钻研(短时间的监督式微调)以学习格式。
  3. 切换到“在做中学”(强化学习),并将其作为主要训练时间。

这种方法创造出的模型不仅是一个过去生物学事实的记忆者,更是一个真正的“推理者”,能够应对未见的生物学挑战。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →