← 最新论文
💬 NLP

GTPO and GRPO-S: Token and Sequence-Level Reward Shaping with Policy Entropy

本文介绍了 GTPO 和 GRPO-S,这两种新型强化学习算法通过实现基于动态熵的奖励塑造,以实现细粒度的、标记级和序列级的信用分配,从而增强了大语言模型的推理能力,进而克服了现有方法(如 GRPO 和 DAPO)存在的粗粒度局限性。

原作者: Hongze Tan, Zihan Wang, Jianfei Pan, Jinghao Lin, Hao Wang, Yifan Wu, Tao Chen, Zhihang Zheng, Zhihao Tang, Haihua Yang

发布于 2026-02-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Hongze Tan, Zihan Wang, Jianfei Pan, Jinghao Lin, Hao Wang, Yifan Wu, Tao Chen, Zhihang Zheng, Zhihao Tang, Haihua Yang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是关于论文 "GTPO and GRPO-S: Token and Sequence-Level Reward Shaping with Policy Entropy" 的解释,采用了通俗易懂的语言和富有创意的类比。

核心问题: “全对或全错” 的评分制

想象你正在教一名学生(AI)解决一道非常长且复杂的数学题。这个学生写出了一个包含 50 个步骤的解题过程。

  • 第 1 到第 4 步 非常出色,逻辑严密且正确。
  • 第 50 步(最终答案)因为一个微小的计算错误而错了。

在目前主流的方法(如 GRPO)中,老师只看最终结果,发现错了,就会给这篇 50 步的“论文”打一个不及格的分数(0 分)。

  • 结果: 学生会想:“噢,看来第 1 到第 49 步也全都毫无用处。” 他们会忘掉那些优秀的步骤,并在下次尝试时转向完全随机的其他方法。
  • 缺陷: 这被称为粗粒度的信用分配(coarse-grained credit assignment)。它将整个思维链视为一个单一的整体,忽略了其中大部分其实是非常完美的。

解决方案: “熵” 指南针

论文作者提出了一种新的评分方式。他们引入了**策略熵(Policy Entropy)**的概念。

可以将**熵(Entropy)理解为衡量“思考深度”“不确定性”**的指标。

  • 低熵: 学生非常自信。他们只是在机械地输入已知内容(例如:“1 + 1 = 2”)。
  • 高熵: 学生正在停顿、权衡多个选项,并努力应对一个困难的选择。他们正在探索不同的路径。

论文认为,当结果正确时,高熵是好事(意味着你仔细探索了正确的路径);但当结果错误时,高熵是坏事(意味着你在错误的道路上盲目自信地猜测)。

两种新算法

论文介绍了两种使用“熵”指南针来提供更好反馈的新型“老师”(算法)。

1. GTPO (Group Token Policy Optimization,组内 Token 策略优化)

类比: “荧光笔”老师
GTPO 不再是一次性给整篇文章评分,而是对每一个单词(Token)进行单独评分。

  • 如果文章正确: 老师会通过“荧光笔”标出学生犹豫或探索不同选项的地方(高熵),并给予额外的加分。这告诉学生:“你在那个特定步骤上思考得很深入,做得好!”
  • 如果文章错误: 老师会寻找那些学生表现得过于自信但实际却错了的单词(低熵)。他们会对这些单词给予严厉的惩罚。这告诉学生:“你在这里太自以为是了,而且你错了。下次别这么自信。”

为什么有效: 它保留了推理过程中的优秀部分,并惩罚了导致失败的特定过度自信时刻。

2. GRPO-S (Sequence-Level GRPO,序列级 GRPO)

类比: “成绩单”老师
有时,对每个单词进行评分速度太慢或计算量太大。GRPO-S 是一个更轻量级的版本。

  • 它不再关注单个单词,而是观察整篇文章的平均“思考强度”
  • 如果文章正确: 它会检查:“学生整体上是否进行了深入思考和探索?”如果是,整篇文章都会获得提升。
  • 如果文章错误: 它会检查:“学生是否在盲目自信地犯错?”如果是,整篇文章会受到更大的惩罚。

为什么有效: 它虽然速度更快,但仍然比传统的“全对或全错”方法更聪明。它特别擅长在极长的推理任务中保持模型的稳定性。

实验结果:发生了什么?

作者在困难的数学基准测试(如 AIME 和 MATH)上测试了这些新老师。

  • 旧方法 (GRPO/DAPO): 学生经常陷入困境。他们要么过快地放弃,要么陷入“自信但错误”的循环中(策略崩溃/Policy Collapse)。
  • 新方法 (GTPO/GRPO-S):
    • 探索能力: 学生能更持久地尝试不同的路径,因为当他们做对时,会因为“思考深入”(高熵)而获得奖励。
    • 精准度: 他们学会了不再盲目自信地犯错。
    • 表现: 他们在困难数学问题上的得分显著提高,能够解决比以前更复杂的推理链。

一句话总结

这篇论文教会了 AI 模型不要再把长串的思维链看作是一个单一的“通过或失败”的等级,而是给它们一份详细的成绩单,奖励它们在正确时深入思考,并在错误时保持谦逊,从而实现更智能的推理。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →