← 最新论文
💻 computer science

Selective-Advantage Entropy-Adaptive Horizon GRPO: Asymmetric Token-Level Discounting for Efficient Reinforcement Learning of Language Models

本文引入了选择性优势熵自适应时界 GRPO(SA-AH-GRPO),这是一种强化学习算法,它通过对负优势展开进行基于熵的折扣处理,同时为成功的轨迹保留完整的梯度信号,从而在数学推理基准测试中,与标准 GRPO 相比显著稳定了训练并提升了性能。

原作者: Chirag Chawla, Rohan Charudatt Salvi, Madhav S. Baidya

发布于 2026-06-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Chirag Chawla, Rohan Charudatt Salvi, Madhav S. Baidya

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在教一名学生(一个人工智能语言模型)如何解决数学问题。这个学生试图通过练习、获取反馈并调整学习习惯来进行学习。这篇论文介绍了一种更聪明的提供反馈的方式,使学习过程更快、更稳定且更不容易产生困惑。

以下是使用简单类比对该论文思想进行的拆解:

问题所在:“一刀切”的导师

目前训练这些 AI 模型的主流方法被称为 GRPO。你可以把 GRPO 想象成一个严厉的导师,他对待学生写的每一个字都一视同仁。

  • 问题在于: 如果学生很自信并写出了一个清晰、正确的句子,导师会给他一个击掌鼓励。但如果学生感到困惑、结结巴巴或胡乱猜测(即具有高“熵”或不确定性),导师给予的关注度也是完全一样的——有时甚至会像惩罚那些自信犯错的行为一样,同样严厉地惩罚那些由于困惑而产生的行为。
  • 结果: 这会让学生感到困惑。当学生已经在瞎猜时,受到严厉的惩罚可能会让他们陷入恐慌,并导致学到错误的东西。反之,如果学生做对了题目,但在过程中有过几次犹豫不定的猜测,导师可能会在无意中惩罚了这些犹豫,从而削弱了“这条路径能导向正确答案”这一教训。

解决方案:两种新的教学策略

作者提出了对这种教学系统的两种升级方案,他们称之为 AH-GRPOSA-AH-GRPO

1. “不确定性折扣”(AH-GRPO)

想象一下,导师有一条特殊的规则:“如果学生明显处于困惑状态,我们就调低反馈的音量。”

  • 运作方式: 导师会在每一个词处检查学生的不确定程度。如果学生的猜测非常随机(高熵),导师会说:“好吧,这部分很混乱,所以我不把它作为主要的惩罚依据。”
  • 益处: 这可以防止学生在挣扎时被噪声淹没。它缩短了“学习视野”,只关注答案中清晰的部分。

2. “选择性优势”规则(SA-AH-GRPO)—— 全场焦点

这是该论文的核心创新。它为上述规则增加了一个至关重要的转折:“只有当学生把整个答案都做错时,才调低音量。”

  • 场景 A:学生做对了(正向优势)
    即使学生在过程中磕磕绊绊或猜错了几个词,但只要他们最终正确解决了问题,导师就会说:“做得好!你写的每一个字,即使是那些犹豫不定的部分,都帮助你达到了目标。我们将所有的内容都计入奖励!”

    • 为什么? 因为最终结果是成功的。我们要强化通往胜利的整条路径。
  • 场景 B:学生做错了(负向优势)
    如果学生未能解决问题,导师会说:“你做错了。现在,让我们看看你在哪里感到困惑。我们会忽略那些你只是在胡乱猜测的部分,这样我们就不会因为那些猜测而误导你学到错误的教训。我们只关注那些清晰的错误。”

    • 为什么? 当你做错且同时感到困惑时,你的猜测只是噪声。过度惩罚这些噪声会产生混乱的学习信号。

结果:更平稳的体验

作者在数学问题上测试了这种新方法,使用了两种不同规模的 AI 模型(较小的 1.5B 模型和较大的 3B 模型)。

  • 对于较大的模型 (3B): 新方法并没有让模型变得比以前更聪明(因为它本身已经相当聪明了),但它让训练变得更加稳定。想象一下在开车:旧方法就像是在颠簸的路上行驶,车子会左右摇晃;新方法则平滑了道路。这种“摇晃”(方差)减少了 3.6 倍。车子到达了相同的目的地,但行驶过程要平稳得多。
  • 对于较小的模型 (1.5B): 新方法实际上帮助模型学得更好。与从零开始相比,它将最终得分提高了近 5 个百分点。看来较小的模型确实需要这种额外的稳定性来有效地学习。

“秘诀”所在:为什么有效

论文认为,这种方法尊重了**探索(Exploration)利用(Exploitation)**之间的区别:

  • 当模型在进行探索(猜测)时,存在不确定性是可以接受的。
  • 当模型成功时,我们应该奖励整个过程,包括那些不确定的部分。
  • 当模型失败时,我们应该小心,不要过度惩罚“不确定性”带来的噪声,否则会干扰学习信号。

总结

SA-AH-GRPO 想象成一位明智的教练,他知道什么时候该严格,什么时候该宽容。

  • 如果你赢了比赛,教练会为你做的每一个动作喝彩,哪怕是那些冒险的动作。
  • 如果你输了比赛,教练会忽略那些你只是在瞎猜的时刻,而只专注于那些清晰的错误,这样你就不会感到沮丧或困惑。

这种改变反馈权重的方式,使得 AI 训练过程变得更快、更稳定且更有效,尤其是对于那些需要额外帮助来站稳脚跟的小型模型。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →