← 最新论文
🤖 machine learning

Rethinking the Divergence Regularization in LLM RL

本文提出了散度正则化策略优化(Divergence Regularized Policy Optimization, DRPO),这是一种针对大语言模型的新型强化学习方法,它通过使用平滑的、基于优势加权的二次正则项来取代先前基于散度的方法中所使用的硬梯度掩码,从而提供连续的修正信号并提高训练稳定性。

原作者: Jiarui Yao, Xiangxin Zhou, Penghui Qi, Wee Sun Lee, Liefeng Bo, Tianyu Pang

发布于 2026-06-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Jiarui Yao, Xiangxin Zhou, Penghui Qi, Wee Sun Lee, Liefeng Bo, Tianyu Pang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个非常有天赋但有点小混乱的学生(即 AI)去参加一场高难度的考试。这个学生已经掌握了基础知识,但现在你想教他如何更好地解决那些特定的、棘手的难题。你通过给出练习题,让他回答,然后根据他的表现告诉他“做得好!”或“再试一次!”。这个过程被称为强化学习 (Reinforcement Learning, RL)

然而,这里有一个陷阱:学生是在安静的图书馆里进行练习(训练),但在实际考试时却是在嘈杂、混乱的考场里(推理)。因为环境略有不同,学生可能会感到困惑,或者过度改变自己的习惯,从而导致崩溃,甚至忘掉之前学过的所有知识。

为了防止这种情况,老师们使用了一个“安全区”(信任区域/Trust Region)。这个区域规定:“你可以通过改变答案来做得更好,但不要改变得太剧烈,否则你会失去平衡。”

问题所在:旧规则过于僵化

长期以来,老师们一直使用一种名为 PPO(近端策略优化)的方法。把 PPO 想象成一本严格的规则手册:“如果你的答案变化超过 20%,就停止!切断该答案的所有信用。”

该论文指出了这种方法的两个重大缺陷:

  1. “比例”陷阱 (The "Ratio" Trap): PPO 通过观察答案的“概率比率”变化来衡量变化。在一个拥有数百万种可能单词的世界里(比如一个拥有 50,000+ 词汇量的字典),一个极罕见的词(比如“xylophone/木琴”)可能从 0.0001% 的概率跳到了 0.001%。虽然这在宏观层面几乎微不足道,但其“比例”变化却是巨大的(10 倍!)。与此同时,一个常见的词(比如“the/这”)可能从 90% 降到了 80%,虽然比例变化很小,但其含义发生了巨大的偏移。PPO 会因此感到困惑:它会对罕见词进行过度的惩罚,却任由常见词肆意妄为。

  2. “硬截断”问题 (The "Hard Cut" Problem): 更新的方法(如 DPPO)试图通过测量概率变化的“实际数值”(比如测量移动的距离而非百分比)来修复这个问题。但它们使用了“硬掩码 (Hard Mask)”。想象一堵墙:如果你跨出一步,老师会立刻拍打你的手并说:“停!这一步不再给予任何学分。”这是一个二进制开关:要么获得全额学分,要么获得零分。这导致学习过程变得生硬且不稳定。如果你只是稍微跨过了那道墙,老师不会给你任何引导让你走回正轨,而是直接忽略了你。

解决方案:DRPO(平滑的向导)

作者提出了一种新方法叫做 DRPO(散度正则化策略优化)。

DRPO 不再使用硬性的墙或严格的比例规则,而是像一个智能、有弹性的蹦床,环绕在安全区域周围。

  • 在区域内: 如果学生在安全区域内做出良好的改变,蹦床会轻轻地推动他们前进,鼓励他们继续改进。
  • 在边缘处: 当学生接近边缘时,蹦床会变得越来越软。它不会突然停止他们,而是会温柔地减缓他们的速度。
  • 在区域外: 如果学生不小心走得太远(做了一个“坏”动作),蹦床并不会直接切断联系。相反,它会产生一种反弹力。它会施加一种温和的纠正力量,说:“哎呀,你走得太远了。让我们把你拉回到中心位置。”

为什么这效果更好

论文声称,DRPO 就像是一个平滑、连续的向导,而不是一个脆弱的、开/关式的开关。

  1. 它能更好地处理“长尾”问题: 在 AI 的世界里,有成千上万个罕见词。DRPO 测量的是一个词移动的实际“距离”,而不是“比例”。这意味着它不会因为罕见词从接近于零跳到一个微小的数字而感到困惑。无论这个词多么常见,它都能公平地对待每一次变化。
  2. 它永不停歇地学习: 即使学生犯了错误并踏出了安全区域,DRPO 也不会丢弃这次教训。它利用这次错误来温柔地引导学生回到正轨。这防止了训练变得不稳定或“崩溃”。
  3. 它无处不在: 作者在不同规模的 AI 模型(从小型到大型)、不同的计算机芯片,甚至在计算机以较低精度运行(比如使用略微模糊的镜头)的情况下测试了 DRPO。在每种情况下,DR-PO 都表现得更加稳定,并且比旧方法能更快、更好地帮助 AI 学习。

总结

把旧的方法想象成一位老师:一旦你犯了微小的错误,他就会大喊“停!”,或者如果你稍微偏离轨道,他就完全忽视你。

DRPO 则是一位睿智的教练,他会说:“你做得很好,但你离中心有点远了。让我们慢一点。如果你走得太远,我会轻轻把你拉回来,这样你就不会摔倒。”这种平滑、连续的纠正让整个学习过程变得更加安全、快速且可靠。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →