← 最新论文
🤖 machine learning

Beyond GRPO and On-Policy Distillation: An Empirical Sparse-to-Dense Reward Principle for Language-Model Post-Training

本文提出并实证验证了一种用于语言模型后训练的“从稀疏到稠密”奖励原则,表明将稀缺的可验证数据用于以稀疏奖励训练一个强大的教师模型,随后通过稠密监督将其行为迁移至较小的学生模型,其效果优于直接对学生模型进行稀疏强化学习。

原作者: Yuanda Xu, Hejian Sang, Zhengze Zhou, Ran He, Zhipeng Wang, Alborz Geramifard

发布于 2026-05-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Yuanda Xu, Hejian Sang, Zhengze Zhou, Ran He, Zhipeng Wang, Alborz Geramifard

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用通俗语言和日常类比对该论文的解读。

核心问题:稀缺资源

想象你是运动队的主教练,但你只有一套独一无二、完美的战术手册(即训练数据),它精确展示了如何赢得某场特定比赛。这套手册非常稀有,且制作成本高昂。

你有两名球员:

  1. 新秀(学生模型):一名体型小、速度快、成本低球员,需要在明天的大赛中立即上场。
  2. 老将(教师模型):一名体型庞大、实力强劲、经验丰富的球员,擅长学习,但并非最终比赛的上场人选。

旧方法(标准做法):
传统上,教练会将那本珍贵的手册直接交给新秀。他们会说:“拿着,研究一下,试着找出获胜的招数。”

  • 问题所在:新秀经验不足。他们可能根本看不懂手册,或者在学习过程中犯下太多错误,导致从未真正学会正确的招数。这就像把一本复杂的物理教科书交给一个幼儿;由于学生尚未准备好,资源被浪费了。

新想法:“奖励密度”原则

本文作者提出了一种更聪明的方式来使用那本珍贵的手册。他们认为,不应首先将手册交给新秀,而应遵循一个三步“桥梁”流程:

第一步:让老将先学习(教师端发现)

首先将珍贵的手册交给老将

  • 原因:老将足够聪明,能够阅读手册,理解复杂的策略,并弄明白为什么某些招数能赢。他们能将那种稀疏的、难以理解的“胜/负”信号,转化为对比赛深刻而丰富的理解。
  • 结果:老将成为了一位“奖励塑形”专家。他们不仅知道答案,还知道最佳达成路径。

第二步:“桥梁”(稠密传递)

现在,与其把原始手册给新秀,不如让老将教导新秀。

  • 类比:想象老将不只是说“赢或输”(这是稀疏的),而是对新秀采取的每一个步骤都低声给出具体指令。“向左迈一步”、“现在传球”、“躲过那个障碍”。
  • 论文术语:这被称为**“稠密桥梁”**。它将那一个巨大的“赢”信号转化为成千上万个微小且有用的“下一步这样做”信号。
  • 两阶段技巧:论文发现,不能直接跳到低声指令阶段。首先,需要一个“热身”阶段,让新秀模仿老将的整体风格(前向 KL)。然后再开始详细的低声指令(OPD)。这能防止新秀感到困惑,或试图学习他们尚未准备好的招数。

第三步:新秀获得第二次机会(桥后强化学习)

一旦新秀通过“桥梁”从老将那里学到了东西,他们就变得更聪明了。此时,如果你还有任何剩余的手册副本,就可以交给新秀进行自主练习。

  • 结果:因为新秀已经通过“桥梁”进行了“预训练”,他们实际上能够有效地利用那本稀疏的手册。他们能够从自己的错误中学习,因为他们已经有了坚实的基础。

实验结果

研究人员在数学问题(如解复杂方程)上测试了这种方法。他们比较了三种场景:

  1. 直接训练:将手册直接交给小模型。
    • 结果:模型表现挣扎。在困难数学测试中,正确率约为75.9%
  2. 先教师(新方法):让大模型先学习,然后教导小模型。
    • 结果:小模型的正确率达到79.3%。这是一个显著的飞跃!
  3. “桥梁”至关重要:他们尝试跳过“桥梁”中的“热身”步骤。
    • 结果:模型表现更差。两步走的“桥梁”对于实现有效传递至关重要。

核心启示

本文的主要教训在于分配。不要将你最好、最稀缺的数据浪费在最弱的球员身上。

  • 将稀缺数据用于最强的球员(教师),以发现最佳策略。
  • 将这些策略转化为一份详尽的、循序渐进的指南(桥梁)。
  • 将该指南交给较弱的球员(学生)。
  • 只有在此之后,才让较弱的球员利用任何剩余数据自主练习。

这就像说:“不要让学徒直接阅读大师的日记。让大师先阅读,据此编写一本简化手册,然后再将手册交给学徒。”这种顺序上的简单改变,使得小模型在解决数学问题上的能力得到了显著提升。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →