Group Entropy-Controlled Policy Optimization
本文介绍了组熵控制策略优化(GEPO),这是对 GRPO 的一种轻量级扩展,通过利用组级熵估计来进行非对称优势塑造,从而解决了异构强化学习任务中全局熵调节的局限性,进而平衡探索与利用,以实现卓越的跨任务性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
技术摘要:组熵控制策略优化 (GEPO)
1. 问题陈述
强化学习 (RL) 已成为大语言模型 (LLM) 后训练阶段增强对齐与推理能力的支配性范式。然而,平衡探索与利用(exploration-exploitation)之间的权衡仍然是一个关键挑战,特别是在处理异构任务混合体(例如结合数学、编程、物理和指令遵循任务)时。
目前的熵控制 RL 方法主要在两个粒度上运行:
- 策略级 (Policy-level): 在整个 Batch 上计算熵并应用统一的调节信号(图 1a)。
- Token 级 (Token-level): 计算 Token 协方差并调节单个 Token(图 1b)。
本文指出,当这些方法应用于组相对策略优化 (GRPO) 时存在一个根本性的缺陷:熵异构性 (Entropy Heterogeneity)。不同的任务领域在同一策略下表现出截然不同的熵状态。例如,物理提示词可能天然地集中在低熵状态,而指令遵循类提示词则表现出高熵状态。
这种异构性导致了标准 GRPO 中的两种特定病态现象:
- 熵依赖性偏差 (Entropy-Dependent Bias): 在组内进行优势函数 (Advantage) 归一化会产生在不同熵水平的组之间统计上不可比的信号。低熵组(通常是高准确度任务)会产生强且一致的梯度信号,而高熵组(通常是低准确度任务)则产生微弱且多噪的信号。
- 优化失衡 (Optimization Imbalance): Batch 级的优化会被低熵任务主导,导致高熵任务接收到的学习信号递减。这形成了一个自我强化的循环:低熵任务过早收敛,而高熵任务则无法有效探索,或遭受“熵失控”导致输出退化。
2. 方法论:GEPO
作者提出了组熵控制策略优化 (GEPO),这是一种轻量级、与模型无关的 GRPO 扩展方案,它在组级别执行熵调节的非对称优势塑造 (entropy-conditioned asymmetric advantage shaping)。
核心机制
GEPO 利用从现有提示词组样本中估计出的组熵 () 作为诊断信号。GEPO 并非应用全局熵目标,而是根据组的熵状态来塑造每个响应的优势信号 ():
该塑造函数应用非对称缩放系数 ():
- 低熵组 (): 正向优势被 衰减。这防止了在模型已经具备高置信度的任务中出现过度利用和过早收敛。
- 高熵组 (): 负向优势被 衰减。这防止了在模型尚不确定性的任务中过早抑制探索,允许策略发现正确的推理路径。
- 其他情况: 优势保持不变。
关键设计选择
- 非对称塑造 (): 作者通过实验观察到,低熵组更为脆弱;对这些组中的负向优势进行激进惩罚可能会触发“长度坍缩”(即模型通过缩短回复来减少不确定性)。因此,相比于对高熵组应用更强的衰减 ( 更低),GEPO 对低熵组应用更温和的推动 ( 更高)。
- 自适应阈值: 固定熵阈值对于不同的基座模型和训练阶段来说过于僵化。GEPO 从 Batch 的熵分布(均值和标准差)中动态导出阈值 (),并使用指数移动平均 (EMA) 进行平滑。这使得该方法能够自动适配特定基座模型的熵尺度,而无需针对特定任务进行调优。
3. 核心贡献
- 理论洞察: 本文提供了理论分析(命题 2.1 和 2.2),证明了 GRPO 中的归一化优势函数在结构上受到组熵的偏置。研究证明,策略加权分布与参考奖励分布之间的差异是依赖于熵的,这导致了异构任务间优势信号的不可比性。
- 算法创新: GEPO 引入了首个在组级别进行熵控制的机制,执行非对称优势塑造。不同于以往将熵视为全局或 Token 属性的方法,GEPO 将其视为一种提示词组的诊断工具,用以重新平衡优化压力。
- 零成本实现: 该方法不需要额外的采样或价值函数估计。它利用了 GRPO 中现有的分组样本,增加的计算开销微乎其微。
4. 实验结果
作者在两个基座模型 (Intern-S1-mini 和 Qwen3.5-9B) 上,针对涵盖数学、物理、科学、代码生成和指令遵循的 13 个基准测试进行了评估。
- 性能表现: GEPO 一致优于 GRPO 以及近期的熵控制基线(AEPO, Clip-Cov, KL-Cov)。
- 在 Intern-S1-mini 上,GEPO 取得了最佳平均分 (54.2),并在 13 个基准测试中的 7 个上胜出,包括在 AIME25、IMO-Bench 和 GPQA 上的显著提升。
- 在 Qwen3.5-9B 上,GEPO 取得了最高平均分 (71.2),超越了强力的基线模型如 Clip-Cov (70.9) 和 KL-Cov (69.9)。
- 稳定性: GEPO 展示了卓越的训练稳定性。由于熵增长不受控,GRPO 在 Qwen3.5-9B 上出现了灾难性的性能崩溃(约在第 170 步);而 AEPO 则表现出持续的震荡;相比之下,GEPO 保持了平滑且单调递增的验证曲线。
- 熵动力学: 对训练动力学的分析表明,GEPO 保留了差异化的探索水平。不同于 AEPO 强制要求统一的熵模式,GEPO 允许需要广泛探索的任务维持较高的熵,同时让确定性任务稳定在较低的熵,从而防止了过早坍缩或熵失控。
5. 意义与主张
论文声称 GEPO 解决了多任务 RL 后训练中的一个关键空白:即现有方法无法处理由熵异构性在多样化任务间引入的结构性偏差。
作者断言:
- 任务特定调节至关重要: 将异构任务驱动向统一的熵模式是次优的。有效的多任务学习需要保留任务特定的探索机制。
- 非对称性是关键: 低熵组的脆弱性决定了必须采用非对称的优势塑造方法,以避免长度坍缩,同时仍能鼓励探索。
- 可扩展性: 通过依赖从现有 Rollout 中估计的组熵和自适应阈值,GEPO 提供了一种可扩展且与模型无关的解决方案,在无需显式任务标注或额外采样成本的情况下,提升了平均性能和任务间的平衡。
总之,本文将 GEPO 定位为一个鲁棒的框架,用于在复杂的多领域 LLM 后训练场景中稳定 RL 训练,确保优化过程尊重不同任务类型固有的不确定性和多样性。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。