← 最新论文
📊 statistics

Slow-Fast Policy Optimization: Reposition-Before-Update for LLM Reasoning

本文提出了慢快策略优化(SFPO)框架,通过“重定位后更新”机制将训练步骤分解为快速内步、漂移控制重定位和慢速修正三个阶段,在保持与现有策略梯度流程兼容的同时,显著提升了大语言模型推理强化学习的训练稳定性、样本效率及收敛速度。

原作者: Ziyan Wang, Zheng Wang, Jie Fu, Xingwei Qu, Qi Cheng, Shengpu Tang, Minjia Zhang, Xiaoming Huo

发布于 2026-03-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Ziyan Wang, Zheng Wang, Jie Fu, Xingwei Qu, Qi Cheng, Shengpu Tang, Minjia Zhang, Xiaoming Huo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一种名为 SFPO(慢快策略优化) 的新方法,旨在解决大型语言模型(LLM)在“学习推理”(比如做数学题)时遇到的一个核心痛点:学得太快容易走火入魔,学得太慢又效率低下。

为了让你轻松理解,我们可以把训练一个会做数学题的 AI 模型,想象成教一个学生参加奥数竞赛

1. 现在的困境:传统的“一步一换”法(GRPO)

目前主流的方法(叫 GRPO)就像这样教学生:

  • 出题: 老师给学生出一道题。
  • 试错: 学生尝试写出解题步骤(生成回答)。
  • 打分: 老师看一眼,如果做对了给高分,做错了给低分。
  • 改错: 老师根据这个分数,立刻给学生讲一遍,学生马上改一次笔记。
  • 下一题: 马上出下一道题,重复上述过程。

问题出在哪?
在训练初期,学生的水平很低,写的解题步骤往往是一团乱麻(低质量)。这时候老师给的分数(奖励)也很随机、很嘈杂。

  • 如果学生因为一次运气好做对了,就立刻大改笔记,可能会把原本正确的思路改歪。
  • 如果因为一次运气差做错了,就立刻否定自己,可能会变得不敢思考。
    这就好比学生刚学走路,每走一步都要立刻调整姿势,结果就是摇摇晃晃,甚至摔跟头,学习效率极低,需要大量的题目(数据)才能学会。

2. SFPO 的解决方案:三步走的“慢 - 快 - 慢”策略

SFPO 提出了一种更聪明的教学法,把每一次“出题 - 改错”的过程拆成了三个阶段,就像**“先快速试跑,再调整站位,最后稳步冲刺”**。

第一阶段:快跑(Fast Trajectory)—— “在同一个题目上多试几次”

  • 做法: 老师还是出同一道题,但这次不急着改笔记。让学生基于这道题,连续快速思考 3 到 7 次(论文中的 K 次),每次都在前一次的基础上微调思路。
  • 比喻: 就像学生拿到一道难题,先快速在草稿纸上画了 3 种不同的解法草图。虽然每张草图可能都有点瑕疵,但把它们连起来看,就能发现真正的解题方向,而不是被某一次偶然的错误带偏。
  • 作用: 把“噪音”过滤掉,找到更稳定的方向。

第二阶段:复位(Reposition)—— “别跑太远,回到原点附近”

  • 做法: 经过刚才的“快跑”,学生的思路可能已经跑得太远,偏离了老师最初出题时的语境(这就叫“策略漂移”)。这时候,SFPO 会让学生往回走一点,回到一个比较稳妥的位置。
  • 比喻: 学生刚才在草稿纸上画得太嗨,思路有点飘了。老师拍拍他肩膀说:“刚才那几笔很有用,但别跑太偏,咱们回到刚才那个稳妥的起点附近,把刚才的精华留下来。”
  • 作用: 防止学生因为过度自信或过度修正而彻底“跑偏”,保证学习是稳健的。

第三阶段:慢修(Slow Correction)—— “最后一步,稳扎稳打”

  • 做法: 在调整回稳妥位置后,老师再给学生最后一次正式的指导,把笔记彻底改好,准备迎接下一道题。
  • 比喻: 学生现在思路清晰了,位置也站对了,老师最后再帮他梳理一遍核心逻辑,确保这次修改是精准且有效的。
  • 作用: 确保最终的学习成果是扎实、准确的。

3. 为什么要加个“智能开关”?(熵控制)

论文还设计了一个聪明的“开关”。

  • 刚开始学的时候: 学生需要大胆尝试,所以“快跑”和“复位”的幅度可以大一点,多利用那些草稿纸上的灵感。
  • 快学会的时候: 学生已经比较稳定了,这时候如果还让他乱跑,反而会破坏已有的知识。
  • 机制: 系统会监测学生的“思考混乱度”(熵)。如果学生已经学得很稳了(混乱度低),系统就自动关闭“快跑”模式,退回到传统的“一步一换”模式,防止画蛇添足。

4. 效果如何?

通过这种“先快后慢、中间复位”的策略,SFPO 带来了惊人的效果:

  • 更稳: 学生不再因为一次运气差就崩溃,训练过程非常平稳。
  • 更快: 以前需要刷 100 道题才能学会,现在可能刷 20 道就够了(减少了 4 倍多的题目量)。
  • 更省时间: 虽然每次做题时多思考了几遍(增加了计算量),但因为不需要刷那么多题,总训练时间反而缩短了 4 倍多
  • 成绩更好: 在数学推理 benchmarks 上,平均分比传统方法提高了 2.8 分,这在 AI 领域是非常巨大的提升。

总结

简单来说,SFPO 就是给 AI 学习推理过程加了一个“缓冲器”和“导航仪”

它不再让 AI 像无头苍蝇一样,每走一步都立刻根据随机反馈调整方向;而是让 AI 先在一个小范围内多试几次(快)把稳方向(复位),最后再精准修正(慢)

这种方法不需要改变 AI 原本的学习目标,就像给现有的赛车引擎加了一个更聪明的变速箱,让它在复杂的数学推理赛道上,跑得既稳又快。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →