← 最新论文
🤖 machine learning

Faster Synchronous On-Policy RL via Straggler-Aware Group Sizing

本文介绍了滞后感知组控制(Straggler-Aware Group Control, SAGC),这是一种动态组大小控制器,通过自适应调整组大小来缓解滞后延迟,从而在不牺牲训练稳定性的前提下,优化同步同策略强化学习的墙钟效率和模型性能。

原作者: Azal Ahmad Khan, Ammar Ahmed, Zeshan Fayyaz, Sheng Di, Mingyi Hong, Ali Anwar

发布于 2026-06-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Azal Ahmad Khan, Ammar Ahmed, Zeshan Fayyaz, Sheng Di, Mingyi Hong, Ali Anwar

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一名正在带领团队准备接力赛的教练。你的目标是训练他们通过跑完一段特定的路线(生成一个答案)并根据表现获得评分,从而学会解决复杂的谜题(如数学题)。

在本文描述的 AI 训练世界中,“跑步者”就是 AI 模型,而“路线”则是它为了回答问题而生成的文本。

问题所在:“最慢的跑步者”规则

研究人员正在使用一种特定的训练方法,称为同步在线策略强化学习(Synchronous On-Policy RL)。你可以把它想象成一条严格的规则:整个团队必须跑完全程、停下,并等待最慢的那个人结束后,教练才能给出反馈或进入下一轮。

但问题在于:在这些 AI 比赛中,有些答案很短且很快,而有些答案则冗长、啰嗦,需要花费很长时间来生成。

  • 掉队者: 如果一名跑步者完成一个谜题需要 10 分钟,而其他跑步者只需 2 分钟,那么其他 7 名跑步者就必须原地待命 8 分钟。
  • 代价: 这种等待时间被称为“计算浪费”。论文显示,当你增加团队规模(即增加“组大小”)以获取更好的统计数据时,出现一个极其缓慢的跑步者的概率也会随之增加。这造成了一个巨大的瓶颈,使得昂贵的计算机硬件在等待最慢的输出时处于闲置状态。

解决方案:“聪明教练”(SAGC)

作者提出了一种新的系统,称为感知掉队者组控制(Stragacter-Aware Group Control, SAGC)。SAGC 不再固守僵化的团队规模(例如,“我们始终由 16 人组成团队”),而是像一位聪明的、具有适应能力的教练,实时观察比赛。

SAGC 的运作方式如下(使用一个简单的类比):

  1. 观察节奏: 教练不断监测跑步者所花费的时间。如果团队运行顺畅,且每个人几乎同时结束,教练会说:“太棒了!让我们增加更多跑步者加入团队,以获取更好的数据。”
  2. 检测掉队者: 如果教练注意到某一名跑步者比其他人慢得多(即发生“掉队事件”),他们就知道团队正在浪费时间等待。
  3. 调整团队规模: 教练会立即缩小下一轮的团队规模。“好吧,这次我们只跑 4 个人,这样我们就不用浪费时间等待了。”
  4. 平衡之道: 该系统使用一种数学上的“拉锯战”。它既想要大团队(为了更好的学习效果),又讨厌等待(为了效率)。它不断调整团队规模,以寻找那个既能获得最大化学习效果、又不会产生长时间等待的平衡点。

研究发现

研究人员在两种不同的 AI 模型(Qwen 和 Llama)以及两种不同的训练风格(GRPO 和 DAPO)上测试了这个“聪明教练”。结果如下:

  • 减少等待,增加奔跑: SAGC 显著减少了计算机处于闲置状态的时间。它大幅降低了“掉队者事件”(即一个慢速答案拖累整个小组的情况)的发生率。
  • 更好的结果: 尽管团队规模在不断变化,AI 模型的学习效果依然与使用固定大规模团队训练的模型一样好,甚至更好。
  • 更短的答案: 有趣的是,使用 SAGC 训练的模型倾向于给出更短、更简洁的答案。论文指出,由于该系统会对漫长且多变的等待进行惩罚,AI 在潜移默化中学会了更加高效、不再啰嗦,而无需教练明确要求它“要简练”。

核心结论

论文认为,在 AI 训练的世界里,灵活性优于僵化性。通过将团队规模视为一个动态工具而非固定设置,使其能够根据 AI 的行为进行调整,我们可以让训练变得更快、更便宜、更稳健。它将一个经常需要等待最慢跑步者的系统,变成了一个能让整个团队高效运转的系统。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →