← 最新论文
💬 NLP

Future-KL Regularized GRPO: Process-Level Credit Assignment from ff-Divergence Regularization

本文介绍了未来 KL 正则化策略优化(FRPO),这是一种无需价值函数的方法,它通过引入基于 ff-散度导出的因果未来正则化回报值来修正 GRPO 的 token 级 KL 正则化,从而在保持更高熵值和更低策略漂移的同时提升数学推理性能。

原作者: Jiarui Yao, Ruida Wang, Hao Bai, Tong Zhang

发布于 2026-05-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Jiarui Yao, Ruida Wang, Hao Bai, Tong Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用通俗语言和日常类比对论文《Future-KL Regularized GRPO》的解释。

宏观图景:教导机器人思考

想象你正在教一个机器人(人工智能)解决数学问题。你给它一个问题,它尝试写出一段长长的、分步的解答。为了确保它不会只是随机猜测或偏离正轨,你会使用一位“老师”(参考模型)来检查它的工作。

这篇论文聚焦于一种特定的训练方法,称为GRPO(组相对策略优化)。可以将 GRPO 想象成一个课堂环境:

  1. 机器人针对同一个数学问题生成多个答案(一个“组”)。
  2. 一个验证器进行检查:“你得到正确的最终数字了吗?”(是/否)。
  3. 机器人通过将自己的答案与“同学”进行比较来学习。如果一个答案比其他答案更好,机器人就会得到“击掌”(奖励);如果更差,就会得到“竖起大拇指表示反对”。

问题:“局部”惩罚与“未来”成本

在标准训练中,有一条规则旨在防止机器人过度改变其“个性”。这被称为KL 正则化。它就像一条“保持在车道内”的规则。如果机器人开始写出与原始老师截然不同的内容,它就会受到惩罚。

旧方法(错误所在):
目前,大多数系统以逐词(token-by-token)的方式应用这种惩罚,将其作为句子末尾的一笔简单“罚款”。

  • 类比: 想象一位司机正在进行长途旅行。旧系统只检查司机在经过警车的那一刻是否超速。它忽略了这样一个事实:如果司机在 10 英里前拐错了弯,那么他现在就已经偏离路线 10 英里了。旧系统将每一英里都视为孤立事件。

论文的洞见:
作者们意识到,在一条长长的推理链中(如数学证明),你写下的每一个字都会改变后续所有字的“路径”。

  • “未来”成本: 如果机器人在句子早期出现轻微偏差,它迫使所有未来的字也必须随之偏离才能讲得通。那个早期错误的“成本”不仅仅是错误本身,而是所有必须跟随这条错误路径的未来字的累积成本
  • 缺失的信号: 旧系统忽略了这种“未来成本”。它只惩罚当前的字,而不惩罚它产生的连锁反应。

复杂性:为何不能简单混合

论文还指出了 GRPO 运作方式中存在的一个棘手数学问题。

  • 非线性分数: GRPO 不仅仅看原始分数(0 或 1)。它会对组内的分数进行归一化(就像给班级里的学生排名)。这使得分数与奖励之间形成了一种奇怪的、弯曲的关系。
  • 冲突: 如果你试图在对学生排名之前,直接将“保持在车道内”的惩罚混入分数中,就会破坏数学逻辑。这就像在计算班级排名之前,试图将“迟到惩罚”加到学生的成绩上。这会扭曲排名系统并破坏学习信号。

解决方案:FRPO(未来 KL 正则化策略优化)

作者提出了一种名为FRPO的新方法。其工作原理分步如下:

  1. 步骤 1:对答案进行排名(优势)。 首先,仅根据最终的数学答案计算奖励。对一组答案进行排名,以区分哪些是好的,哪些是坏的。这就是“组优势”。
  2. 步骤 2:添加未来惩罚(修正)。 在排名完成后,回过头去查看获胜答案和失败答案中的每一个字。
    • 对于每一个字,不仅要计算其自身的惩罚,还要计算所有后续字的惩罚之和
    • 类比: 想象一场接力赛。旧系统只惩罚那个掉棒的选手。新系统不仅惩罚掉棒的选手,还惩罚“接下来三位选手不得不放慢速度追赶”这一事实。它根据当前字所开启的整个未来旅程来分配功劳(或责任)。
  3. 步骤 3:更新。 将“组排名”与这种新的“未来惩罚”结合,以更新机器人的“大脑”。

为何重要(结果)

该论文在解决高难度数学问题(如高中竞赛题)的大型语言模型上测试了这种方法。

  • 更高的分数: 新方法(FRPO)比旧方法解决了更多的问题。
  • 更少的漂移: 机器人更紧密地保持了其原始的“老师”个性。它没有发疯,也没有为了获得高分而开始胡言乱语。
  • 更多的创造力: 机器人保持了健康的“熵”(思维的多样性)。它没有变成一个枯燥、重复的机器人,但也没有偏离正轨。

总结

该论文认为,在训练 AI 进行推理时,不能仅仅惩罚它此刻正在说的字。你必须惩罚该字所创造的未来路径。通过在训练过程中加入“未来成本”计算,AI 能够学会更连贯地思考,解决更难的问题,并在不需要复杂的“评论家”模型监督的情况下保持稳定。

简而言之: 不要只惩罚司机此刻的超速行为;要惩罚他们 10 英里前那个错误的转弯,正是那个错误迫使他们加速以重新回到正轨。这就是“未来 KL"的洞见。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →