← 最新论文
🤖 machine learning

Sparrow: Sparse Rollout for Stable and Efficient Long-context RL of Large Language Models

本文介绍了 Sparrow,一种动态稀疏调度方法,它通过维持稀疏到稠密策略失配的关键阈值,稳定了高效的长文本强化学习,在各种 Qwen3 模型和领域中实现了显著的生成速度提升,并通过一种轻量级的 DistillSparse 蒸馏技术进一步增强了性能。

原作者: Yang Zhou, Ranajoy Sadhukhan, Zhaofeng Sun, Zhuoming Chen, Souvik Kundu, Saket Dingliwal, Sai Muralidhar Jayanthi, Aram Galstyan, Haizhong Zheng, Beidi Chen

发布于 2026-06-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Yang Zhou, Ranajoy Sadhukhan, Zhaofeng Sun, Zhuoming Chen, Souvik Kundu, Saket Dingliwal, Sai Muralidhar Jayanthi, Aram Galstyan, Haizhong Zheng, Beidi Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是使用简单语言和创意类比对“Sparrow”论文进行的解释。

核心问题: “过度思考者”的瓶颈

想象你正在训练一名天才学生(大语言模型)来解决极其困难的数学题。为了变得真正优秀,这个学生需要为每一个问题练习“大声思考”(生成长链条推理过程)。

论文指出一个主要的瓶颈:这种练习极其昂贵且缓慢。

  • 成本: 超过 70% 的计算时间和金钱都花在了学生“思考”(生成长答案)的过程上,而不是实际的学习环节。
  • 目前的解决方法: 为了提高速度,工程师们尝试让学生通过 稀疏注意力(Sparse Attention) 来“略读”他们的想法。这就像是告诉学生:“不要读整页,只需要看每段的第一句和最后一句。”
  • 代价: 如果略读得过于激进,学生会感到困惑、开始产生幻觉,整个训练过程就会崩溃。如果略读得太少,则无法节省时间。直到现在,寻找那个“金发姑娘原则”下的平衡点(既不过度,也不不足)几乎是不可能的。

发现:问题的关键不在于平均值

研究人员发现了一个关于训练为何崩溃的惊人事实。

旧的思维方式:
过去,我们通过观察学生生成的每个词的平均准确率来衡量其表现。我们认为:“如果平均值很高,我们就是安全的。”

新的洞察(“坏苹果”理论):
论文表明,平均值是一个骗子。

  • 想象一个装有 1,000 个苹果的篮子。其中 990 个完美、光亮且美味。
  • 但有 10 个是腐烂、发霉且有毒的。
  • 如果你品尝“平均”后的苹果,味道很好。但如果你把这篮苹果喂给一个敏感的胃(AI 训练过程),那 10 个腐烂的苹果会让整个系统“生病”。
  • 在 AI 世界中,即使使用非常激进的“略读”(稀疏注意力),大多数词的生成也是完美的。问题在于那一小部分、肉眼难见的错误词汇(tokens)完全破坏了逻辑。训练崩溃并不是因为学生整体水平差,而是因为那些破坏逻辑的少数“腐烂”词汇。

解决方案: “Sparrow”策略

团队开发了一种名为 Sparrow(用于稳定且高效长上下文强化学习的稀疏展开)的方法。他们不再试图让“平均值”完美,而是专注于确保“最差”的词保持在一条安全线之上。

以下是他们的具体步骤:

1. “动态限速器” (动态稀疏度调度)

想象你在进行一次长途公路旅行。

  • 问题: 如果你在 100 英里内一直以恒定的高速行驶(固定稀速度),你可能会在快到终点时耗尽燃油或发生车祸,因为路况变得复杂了。
  • 解决方法: Sparrow 就像一个智能定速巡航系统。随着学生的“思考过程”变得越来越长,系统会自动放宽规则。它会说:“好吧,对于前 1,000 个词,你可以大量略读。但对于接下来的 1,000 个词,你需要看得更仔细一点。”
  • 结果: 这确保了整个长篇故事中,词汇的“最差情况”质量(第 5 百分位数)始终保持稳定,从而防止了崩溃。

2. 魔法数字 (阈值)

研究人员测试了许多不同规模的 AI 模型(从 1.7B 到 8B 和 14B)。他们找到了安全线的“魔法数字”。

  • 他们发现,只要“最差”的 5% 的词保持在一定的质量分数之上(在他们的量表中约为 0.86),训练就能保持稳定。
  • 酷炫之处: 这个数字对小型模型和巨型模型同样有效。它是这类“思考型 AI”的一条通用法则。

3. 速度提升

通过使用这种智能调度来保持在安全线之上(而不是过度谨慎),他们实现了巨大的加速:

  • 小型模型快了 2.2 倍
  • 中型模型快了 2.4 倍
  • 大型模型快了 2.0 倍
  • 这意味着 AI 可以用不到一半的时间和成本,学到同样数量的数学题。

4. “DistillSparse” 技巧 (导师)

最后,他们增加了一个名为 DistillSparse 的加分技术。

  • 类比: 想象学生正试图通过略读(稀疏模式)来学习。通常,略读会让他们变差。但如果有一个“导师”(完整的、缓慢的、稠密的模型)在他们略读时,在耳边低语正确的答案呢?
  • 运作方式: 他们使用一种轻量化方法(LoRA)来教导“略读型”学生去模仿“慢速型”老师。
  • 结果: 因为学生现在有了教练,他们可以更激进地略读(跳过更多词汇)而不会崩溃。这进一步推高了加速效果(在某些情况下高达 2.5 倍)。

总结

该论文通过意识到少数坏词会毁掉整个批次,解决了训练处理长复杂任务的 AI 问题。他们没有试图让一切都完美,而是构建了一个系统,能够:

  1. 监控最差的词,确保它们不会变得太差。
  2. 动态调整“略读”规则,随着任务变长而自动调整。
  3. 使用“导师”,让 AI 即使在略读时也能更快,而不至于失去理智。

其结果是,这种方法训练强大的“思考型 AI”的速度快了 2 到 2.5 倍,成本更低,且不会牺牲最终答案的质量。他们在数学问题和编程任务上进行了测试,效果非常完美。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →