← 最新论文
🤖 machine learning

Gradient Extrapolation-Based Policy Optimization

本文提出了一种基于梯度外推的策略优化方法(GXPO),这是一种适用于 GRPO 风格推理强化学习的即插即用型方法,该方法仅需三次反向传播即可近似昂贵的多步前瞻,从而在不生成新轨迹的情况下显著提升 pass@1 性能与训练效率。

原作者: Ismam Nur Swapnil, Aranya Saha, Tanvir Ahmed Khan, Mohammad Ariful Haque, Ser-Nam Lim

发布于 2026-05-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Ismam Nur Swapnil, Aranya Saha, Tanvir Ahmed Khan, Mohammad Ariful Haque, Ser-Nam Lim

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用通俗语言和日常类比对论文《基于梯度外推的策略优化(GXPO)》的解释。

宏观视角:“前瞻”难题

想象你正在教一位非常聪明的学生(一个大语言模型)如何解决复杂的数学问题。你给他一个题目,他尝试解答,如果做对了,你就给他一个击掌(奖励);如果做错了,你就让他再试一次。

在当前的标准方法(称为GRPO)中,学生走一步,获得反馈,然后仅基于这单一步骤立即调整思路。这就像在黑暗的森林里行走,只盯着脚正下方的地面。这样既安全又快速,但你可能会错过前方几步之外的一条更好的路径。

为了看得更远,你可以让学生先探索前方 10 步,然后再决定往哪个方向转弯。这被称为“前瞻”。然而,在人工智能的世界里,探索前方 10 步极其昂贵。这意味着计算机每上一课都要多承担 10 倍的繁重工作(数学计算),这不仅拖慢了一切,还耗费了巨额电费。

解决方案:GXPO(“水晶球”技巧)

作者提出了一种名为GXPO的新方法。可以将 GXPO 视为一种巧妙的捷径,它让学生无需真正走完整个距离,就能“窥探”未来。

GXPO 的工作原理如下,分为三个简单步骤:

1. “探测”(快速迈出两步)

学生不再只盯着脚底,而是快速迈出两个微小的步伐,并立即检查地面。

  • 步骤 A:他们迈出一小步。
  • 步骤 B:他们再迈出一小步。
  • 检查:他们比较起点、步骤 A 之后以及步骤 B 之后的地面感觉。

2. “外推”(预测未来)

通过比较这两个微小步骤,学生可以推测出一个模式。

  • 类比:想象你在开车。如果你将方向盘稍微向左转,车就向左转了一点点;如果你再转一次,车又转得更多了一点,那么你可以推测,如果你继续转动,车最终会划出一个大弯。
  • GXPO 利用这种模式,在数学上预测学生如果迈出10 步(或任意步数 KK,而不仅仅是两步)会到达哪里。它创造了一个“虚拟”的目的地。

3. “修正”(安全网)

这是最重要的一部分。学生不会盲目地直接跳到那个预测的 10 步目的地。那样做很危险,因为预测可能略有偏差。

  • 相反,学生向那个预测点移动一部分距离。
  • 然后,他们停下来,在这个新位置真正、仔细地观察地面。
  • 他们利用这些真实的信息来做出最终决定。

为什么这很重要?

论文声称,GXPO 实现了前瞻带来的好处(更好的推理能力),却无需付出巨大的代价。

  • 标准前瞻:要向前看 10 步,通常需要进行11 次计算(1 次用于起点 + 10 次用于步骤)。
  • GXPO:要向前看 10 步,GXPO 只需进行3 次计算(2 次用于快速探测 + 1 次用于最终修正)。

这就像拥有一个能让你看到未来 10 步的水晶球,但你只需支付观察 3 步的代价。

“安全开关”

作者还构建了一种安全机制。有时,“水晶球”(预测)可能会变得不稳定或不可靠,特别是当学生正在学习非常新或非常困难的内容时。

  • GXPO 内置了一个"Z 分数门控”(监控系统)。如果它察觉到预测变得过于狂野或不稳定,它会自动关闭水晶球。
  • 当这种情况发生时,系统会立即切换回标准的、安全的方法(只观察脚底的地面),直到局势稳定下来。这确保了学生永远不会因为错误的猜测而“撞车”。

结果

论文在数学推理任务(如解决代数和几何问题)上测试了该方法,使用了 Qwen 和 Llama 等模型。

  • 分数更高:GXPO 模型比标准方法正确解决了更多问题。
  • 学习更快:它们以更快的速度(更少的步数和更短的时间)达到了性能峰值。
  • 成本相同:尽管它们“看得更远”,但并未比标准方法消耗更多的计算能力,因为它们每一步只进行了那 3 次计算。

总结

GXPO 是一种针对人工智能的智能训练技巧。它让 AI“猜测”如果进行长时间练习会发生什么,检查该猜测是否安全,然后利用这一洞察来加速学习。它获得了深度规划的好处,却无需承担实际执行所有规划所带来的沉重代价。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →