← 最新论文
🤖 machine learning

Single-Rollout Asynchronous Optimization for Agentic Reinforcement Learning

本文介绍了单次采样异步优化(Single-rollout Asynchronous Optimization, SAO),这是一种稳定且高效的异步强化学习框架,它通过将分组采样替换为单次采样策略,并采用严格的 Token 级裁剪,成功地在复杂的编程和推理基准测试上训练了如 GLM-5.2 之类的大规模智能体模型。

原作者: Zhenyu Hou, Yujiang Li, Jie Tang, Yuxiao Dong

发布于 2026-07-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhenyu Hou, Yujiang Li, Jie Tang, Yuxiao Dong

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在训练一支学生厨师团队来烹饪完美的佳肴。在旧的做事方式中(论文称之为同步强化学习/Synchronous RL),主厨会大喊:“所有人,开始做菜!”然后等待。学生们都会开始制作各自的菜肴。但问题在于:有些学生很快,而有些学生很慢。快学生做完菜后就会站在那里盯着墙看,等待最慢的学生完成。只有当所有人都完成后,主厨才能品尝食物、给出反馈并告诉大家下一步该做什么。这极其低效;厨房里充满了闲置时间。

为了解决这个问题,研究人员尝试了异步强化学习/Asynchronous RL。在这个版本中,一旦一名学生完成了一道菜,主厨会立即品尝并给出反馈。该学生可以立刻开始下一道菜。厨房从未停止运转。这要快得多。

然而,这里有一个巨大的陷阱。 因为主厨在品尝来自不同开始时间的学生的菜肴,学生们遵循的“食谱”一直在变化。有些学生是根据旧食谱在烹饪,而另一些人则在使用新食谱。这种混乱导致训练变得不稳定,学生们往往不仅没有进步,反而退步了。此外,用来给这些学生评分的流行方法(称为 GRPO)要求主厨等待一学生完成之后才能给出评分,这又带回了等待的问题。

作者们引入了一种新方法,称为 SAO(单次采样异步优化/Single-Rollout Asynchronous Optimization)。他们通过三个聪明的技巧解决了这些混乱:

1. “即时反馈”规则(单次采样/Single-Rollout)

与其等待一组学生完成一批菜肴,SAO 要求:“只要一个学生完成了一道菜,就立即评分。”

  • 比喻: 想象一款电子游戏,你在完成关卡的那一秒就能得到分数,而不是等待你的整个小队完成。这消除了“等待最慢成员”的延迟。
  • 解决的问题: 它阻止了“小组”因为等待最慢的成员而停滞,让训练以全速运行。

2. “严格的安全网”(双向裁剪/Double-Sided Clipping)

由于学生们工作得非常快,且食谱不断变化,存在一种风险,即他们可能会变得疯狂,尝试一些完全离谱且危险的操作。

  • 比喻: 作者在训练周围设置了一个“围栏”。如果一个学生的想法与老师的预期过于不同(太偏左或太偏右),系统不仅会忽略它,还会完全阻止学生从这个特定的错误中学习。这就像一位严厉的教练说:“如果你试图倒着跑,我根本不会让你从那次奔跑中学习任何东西。”
  • 解决的问题: 这防止了当学生因快速变化的节奏而感到困惑时,训练变得不稳定或“爆炸”。

3. “超级教练”(更好的价值模型/Better Value Model)

在旧的“小组”方法中,教练可以通过将一个学生的菜肴与同学们的菜肴进行比较,来判断其好坏。但在这种“一个接一个”的方法中,没有同学可以比较。教练需要极其聪明,才能知道单道菜肴本身是好是坏。

  • 比喻: 作者训练了一个特殊的“价值教练”(评论家/Critic),这位教练比学生厨师聪明得多,并且更新知识的速度比学生快两倍。他们还冻结了教练的“直觉”(注意力层),以免教练感到困惑,只让教练学习具体的食谱细节。
  • 解决的问题: 这确保了即使在学生独自工作时,教练也能准确地告诉他们:“是的,那步走得很棒,”或者“不,那步很糟,”而不需要通过与小组对比来进行判断。

结果

论文在两个非常困难的任务上测试了这种新方法:

  1. 编程: 要求 AI 修复软件中的漏洞(就像机械师修理汽车)。
  2. 数学推理: 要求 AI 解决复杂的数学问题(就像学生参加一场高难度的考试)。

结果是:

  • 旧方法(GRPO)起初表现良好,但由于过于困惑,运行一段时间后就会崩溃并失败。
  • 新的 SAO 方法可以让训练平稳持续很长时间(高达 1,000 步),并持续获得更高的分数。
  • 它还证明了这种方法非常适合在线学习(Online Learning),即在玩游戏的过程中规则也在发生变化。例如,如果老师突然说:“现在我想要可爱的小故事,”经过 SAO 训练的 AI 可以迅速切换风格,而其他方法则反应太慢,无法适应。

简而言之,论文指出:“不要再等待小组了。让每个人按自己的节奏工作,但给他们一个严格的安全网和一个能瞬间更新知识的超级聪明的教练。这使得 AI 训练更快、更稳定,并且更擅长解决困难且不断变化的问题。”

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →