← 最新论文
🤖 machine learning

CE-GPPO: Coordinating Entropy via Gradient-Preserving Clipping Policy Optimization in Reinforcement Learning

该论文提出了一种名为 CE-GPPO 的新算法,通过以温和且有界的方式重新引入被传统 PPO 截断机制丢弃的低概率 token 梯度,有效协调了熵的动态变化并解决了强化学习中的熵不稳定性问题,从而在数学推理基准测试中显著提升了大语言模型的性能。

原作者: Zhenpeng Su, Leiyu Pan, Minxuan Lv, Yuntao Li, Wenping Hu, Fuzheng Zhang, Kun Gai, Guorui Zhou

发布于 2026-04-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhenpeng Su, Leiyu Pan, Minxuan Lv, Yuntao Li, Wenping Hu, Fuzheng Zhang, Kun Gai, Guorui Zhou

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文提出了一种名为 CE-GPPO 的新方法,旨在解决大语言模型(LLM)在通过“强化学习”进行自我提升时遇到的一个核心难题:如何平衡“大胆尝试”和“保守利用”

为了让你轻松理解,我们可以把训练 AI 的过程想象成教一个学生(AI)参加数学竞赛

1. 背景:学生是如何学习的?

在传统的强化学习(比如 PPO 算法)中,老师(算法)会给学生出题,学生回答后,老师会根据答案的对错给一个“分数”(奖励)。

  • 如果学生答对了,老师会鼓励他:“做得好,下次继续这么答!”(利用/Exploitation
  • 如果学生答错了,老师会告诉他:“别这么答,换个思路。”(探索/Exploration

在这个过程中,“熵”(Entropy) 就像是一个**“好奇心指数”**。

  • 高熵 = 学生充满好奇心,愿意尝试各种解题思路,哪怕有些看起来很荒谬。
  • 低熵 = 学生变得死板,只敢用一种他最确定的方法,不再尝试新东西。

2. 问题出在哪里?(旧方法的缺陷)

现有的主流方法(如 PPO)有一个**“安全护栏”**机制。

  • 规则:如果学生提出的新答案和之前的习惯差别太大(概率太低),老师就会认为这个答案“太离谱了”,直接忽略它的反馈,只关注那些“稍微有点新意但还在安全范围内”的答案。
  • 后果
    1. 过早放弃探索(熵崩溃):那些虽然概率低、但可能包含绝妙创意(高熵)的答案被直接切断了。学生不敢尝试新招,很快变得死板,解题思路枯竭,成绩反而下降。
    2. 过度探索(熵爆炸):反过来,如果学生一直用一种很笨但很稳的方法(概率高),老师却强行让他去尝试那些“完全没用”的笨办法(概率低且负分),学生就会陷入混乱,一直在乱试,永远学不会。

简单比喻
这就好比老师教学生骑车。

  • 旧方法:学生只要稍微偏离一点点路线,老师就立刻把车刹停,说“不行,重来”。结果学生永远学不会在复杂路况下灵活变通(熵崩溃)。
  • 或者,老师为了鼓励创新,让学生去尝试在悬崖边骑车,结果学生摔得鼻青脸肿,完全无法进步(熵爆炸)。

3. CE-GPPO 的解决方案:聪明的“缓冲带”

这篇论文提出的 CE-GPPO 就像是一位更懂心理学的金牌教练

它不再简单地“一刀切”地忽略那些偏离轨道的答案,而是给这些答案加上了**“缓冲带”“调节器”**:

  • 核心创新:它保留了对那些“被切掉”的极端答案的反馈,但是控制反馈的力度
    • 对于“有创意但风险大”的答案(PA&LP):教练会温和地鼓励(放大一点点梯度),告诉学生:“这个想法很有潜力,虽然有点冒险,但值得再试试!”这能防止学生变得死板(防止熵崩溃)。
    • 对于“太笨拙且没用”的答案(NA&LP):教练会温和地纠正(控制梯度大小),告诉学生:“这个方向确实不对,但别太灰心,我们慢慢调整。”这能防止学生乱试(防止熵爆炸)。

比喻
想象你在玩一个**“走钢丝”**的游戏。

  • 旧方法:只要你稍微晃一下,系统就判定你失败,直接把你踢出局。
  • CE-GPPO:当你晃得太厉害时,系统不会直接踢你出局,而是给你系上一根有弹性的安全绳。这根绳子会把你拉回来,但不会让你摔得太狠,也不会让你完全动不了。它让你能在钢丝上安全地摇摆,找到最稳的平衡点。

4. 为什么这个方法有效?

论文通过实验发现,CE-GPPO 做到了以下几点:

  1. 动态平衡:它像是一个自动调温器。在训练初期,它鼓励学生多尝试(保持高熵,多探索);在训练后期,它引导学生收敛到最优解(降低熵,多利用)。
  2. 稳定性:它不会让 AI 学“疯”了(熵爆炸),也不会让 AI 学“傻”了(熵崩溃)。
  3. 效果显著:在数学推理(如 AIME 竞赛题)和代码生成等任务上,使用 CE-GPPO 训练的模型,比使用传统方法的模型成绩更好,而且模型越大,提升越明显。

5. 总结

一句话总结
以前的 AI 训练方法像是一个严厉且僵化的教练,要么把学生管得太死,要么放得太松;而 CE-GPPO 像是一个智慧的教练,它懂得在“大胆尝试”和“稳妥执行”之间找到完美的平衡点,通过精细调节那些被忽略的“边缘反馈”,让 AI 既能保持好奇心,又能稳步进步。

它的核心贡献

  • 发现了被旧方法丢弃的“边缘答案”其实对保持 AI 的“好奇心”至关重要。
  • 发明了一种新算法(CE-GPPO),用**“温和的弹性绳”**代替了“生硬的剪刀”,让 AI 在探索未知时更安全、更高效。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →