← 最新论文
🤖 machine learning

Complementing reinforcement learning with SFT through logit averaging in the post training of LLMs

本文提出了一种用于大语言模型的 novel 后训练方法,该方法通过平均冻结的 SFT 参考策略与可训练策略的 logits 来增强组相对策略优化(GRPO),从而在有效结合强化学习的推理能力与监督微调的格式稳定性的同时,消除了对 KL 正则化或评论家的需求。

原作者: Xingwei Gan, Ying Zhu

发布于 2026-05-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Xingwei Gan, Ying Zhu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用通俗易懂的语言和富有创意的类比对这篇论文的解释。

大局观:两位老师,一位学生

想象一下,你正在训练一个大型语言模型(AI)来解决数学问题。你有两位截然不同的“老师”试图教导它:

  1. 格式老师(SFT): 这位老师非常擅长教导 AI 如何整洁地书写答案、使用正确的符号,并严格遵守规则(例如将最终答案框起来)。然而,这位老师有时会在实际的数学逻辑上犯错。
  2. 推理老师(RL): 这位老师是数学天才,能够完美地解决复杂的方程。但是,这位老师很随性;他们经常忘记给答案加框、跳过步骤,或者以不符合考试要求的奇怪格式书写。

问题所在:
传统上,当你试图结合这两位老师时,你会使用一种称为"KL 正则化”的方法。这就像用一根橡皮筋将推理老师系在格式老师身上。这根橡皮筋迫使推理老师保持与格式老师的风格相近。

  • 弊端: 如果格式老师在数学上犯了错,橡皮筋就会把推理老师拉向同样的错误。AI 会陷入试图保持“整洁”却未能变得“聪明”的困境。

新方案:Logit 平均
这篇论文的作者提出了一种结合这两位老师的新方法。他们不是用橡皮筋将两者绑在一起,而是创造了一个融合的声音

想象 AI 是一个合唱团。新方法不是在唱歌前强迫歌手们保持完美的齐唱(这会限制他们的音域),而是在他们开口唱歌之前,先将他们的声音混合起来。

  • 如果格式老师说“给答案加框”,而推理老师说“答案是 5",那么融合的声音会说:“给答案加框:5"。
  • 如果格式老师在数学上犯了错(说答案是 6),但推理老师知道答案是 5,那么融合的声音会 heavily 依赖推理老师的数学判断,同时保留格式老师“加框”的指令。

工作原理("Logit"的魔力)

在 AI 术语中,模型的“声音”由称为logits的数字组成(这些数字代表模型接下来选择特定单词或数字的可能性)。

  1. 混合: 研究人员将格式老师和推理老师的数字在数学上进行平均。
  2. 结果: 这创造了一个新的、临时的“融合策略”。
  3. 训练: AI 通过在这个融合策略上进行练习来学习。如果最终答案正确,它就会获得奖励(分数)。
    • 因为格式老师是混合的一部分,AI 永远不会忘记如何整洁地书写。
    • 因为推理老师是混合的一部分,AI 可以自由地纠正格式老师的数学错误。

为什么这更好(“专家乘积”)

这篇论文使用了一个称为“专家乘积”的概念。这就像委员会的决策:

  • 如果专家 A(格式)对风格很确定,而专家 B(推理)对数学很确定,那么最终决定在两方面都很强。
  • 如果专家 A 在数学上错了,专家 B 的信心会覆盖它,但专家 A 在风格上的信心依然保留。

论文发现,这种“融合声音”的方法比旧的“橡皮筋”方法效果更好。AI 学会了正确解决数学问题,同时保持了整洁的格式,而旧方法往往会让 AI 忘记如何正确格式化,或者陷入格式老师的数学错误中。

实验

研究人员在三个不同的“考试”(数据集)上测试了这种方法:

  1. MATH: 高难度数学问题。
  2. cn-k12: 中国初中/高中数学。
  3. MMLU: 通用知识和推理。

他们在三种不同规模的 AI 模型(小、中、大)上进行了测试。

结果:

  • 在几乎所有情况下,新的“融合声音”方法都比传统方法获得了更高的分数。
  • 它在解决一个特定问题上尤其出色:传统方法往往会让 AI 在学习解决更难的数学问题时“忘记”如何格式化答案。而新方法在提高数学技能的同时,保持了格式化技能完好无损。

论文中的一个具体例子

论文给出了一个几何问题的具体示例:

  • 格式老师(SFT): 正确建立了方程,但在数学上犯了错,得出结论半径是6。它整洁地将答案框了起来。
  • 推理老师(RL): 正确计算了数学,发现半径是5,但忘记给答案加框或以最终格式书写。
  • 融合声音: 它从推理老师那里获取正确的数学(5),并从格式老师那里获取整洁加框的指令。最终输出是一个整洁加框的5

总结

这篇论文介绍了一种训练 AI 模型的方法,它像一个协作团队,而不是严格的等级制度。通过数学上平均“整洁但随性”的老师与“聪明但随性”的老师的“思想”(logits),AI 学会了既聪明又整洁,避免了强迫一方严格遵循另一方的陷阱。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →