← 最新论文
🤖 AI

Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models

本文提出并验证了一种中期训练框架,该框架利用基于波利亚方法引导的自生成多样化解题变体,以增强后续强化学习的有效性,从而提升数学推理、代码生成和叙事任务的性能。

原作者: Aswin RRV, Jacob Dineen, Divij Handa, Mihir Parmar, Ben Zhou, Swaroop Mishra, Chitta Baral

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Aswin RRV, Jacob Dineen, Divij Handa, Mihir Parmar, Ben Zhou, Swaroop Mishra, Chitta Baral

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在训练一位才华横溢但略显僵化的学生去解决复杂的数学谜题。你希望他们成为精通解题的大师,而不仅仅是死记硬背某一种得出正确答案方法的人。

这篇论文描述了一种针对大型语言模型(LLM)——即 AI 聊天机器人背后的“大脑”——的新训练方法。研究人员发现,在教导 AI 从奖励中学习(这一过程称为强化学习)之前,他们应该首先教会它多种不同的方法来解决同一个问题。

以下是他们方法的分解,使用了简单的类比:

1. 问题:“单轨思维”

通常,当我们训练 AI 时,我们会给它展示一个问题以及唯一的“正确答案”。这就像给学生展示一道数学题,却只教他们一种特定的解法。

  • 问题所在: 当 AI 后来尝试从奖励中学习(即答对得分)时,它往往只是变得更擅长它已经知道的那一种特定方法。它并没有学会灵活思考。这就像一位只会用一种方法煮意大利面的厨师;如果食材变了,他们可能会束手无策。

2. 解决方案:“波利亚训练营”

研究人员引入了一个中间步骤,称为中期训练(Mid-Training)。在最终的奖励训练之前,他们给 AI 安排了一个特殊的训练营。

  • 教练: 他们利用了著名的**乔治·波利亚(George Pólya)**的解题规则(波利亚是一位撰写了《怎样解题》的数学家)。把波利亚想象成一位睿智的老教练,他教授不同的策略:“尝试倒推”、“画个图”、“分解成更小的部分”或“寻找一个相似的、更简单的问题”。
  • 训练: 对于每一个数学问题,AI 被要求生成多个不同的正确答案,每个答案都使用不同的波利亚策略。
    • 类比: 教练不是只给学生看答案,而是说:“好的,用地图解这道题。现在,用指南针解。现在,倒着走解。”
  • 自我生成: AI 完全靠自己完成这一切。它不需要人类教师或超级聪明的 AI 来展示答案。它自己生成了多样化的练习题。

3. 魔法步骤:强化学习(RL)

在这个训练营之后,他们让 AI 接受标准的强化学习(即尝试各种方法,答对得分,并学会重复有效的做法)。

  • 结果: 由于 AI 在训练营期间已经练习过许多不同的“招数”,RL 训练现在可以混合搭配这些招数。
  • 类比: 想象一位爵士乐手。如果他们只练习了一个音阶,他们只能演奏一首曲子。但如果他们分别练习了音阶、和弦和节奏(中期训练),当他们开始即兴演奏(强化学习)时,他们就能突然将音阶与节奏结合,创造出新颖而精彩的作品。AI 学会了将不同的解题策略组合成一个强大的答案。

4. 他们的发现

研究人员在困难的数学竞赛(如 AIME 和奥林匹克竞赛)上测试了这种方法。

  • 更高的分数: 经过“多样化训练营”的 AI 得分显著高于那些只学习一种方法或从标准教师那里学习的 AI。
  • "Pass@K"效应: 在 AI 术语中,"Pass@K"意味着:“如果我们让 AI 尝试 64 次,它有多少次能答对?”经过训练营的 AI 在拥有多次机会时,答对的概率要高得多。它更灵活,更不容易陷入死胡同。
  • 超越数学: 尽管训练是基于数学规则的,但 AI 在其他方面也变得更擅长,比如编写代码和解决故事中的逻辑谜题。似乎这种灵活思考的习惯已经转移到了其他任务中。

5. 关键要点

这篇论文认为,多样性是秘密武器

  • 如果你教 AI 用 64 种不同的方法解决一个问题,它就学会了一个策略“库”。
  • 当它后来尝试从奖励中学习时,它不会只选择一种策略;而是学会组合它们,挑选不同策略中最好的部分来解决问题。
  • 教学生用 10 种方法解决 100 个问题,比教他们用 1 种方法解决 1000 个问题要好得多。

简而言之: 通过在最终考试前强迫 AI 练习通往解决方案的许多不同“路径”,AI 变成了一个更聪明、更具适应性的思考者,能够结合旧技巧来解决新的、困难的问题。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →