✨ 要点🔬 技术摘要
想象一下你正在举办一场大规模的烹饪比赛,旨在训练一个机器人厨师。目标是通过让它尝试数千个食谱,并针对每次尝试得到一个简单的“是的,成功了!”或“不,失败了!”的反馈,来教会机器人如何解决复杂的谜题,比如数学问题或规划旅行。这个过程被称为具有可验证奖励的强化学习(Reinforcement Learning with Verifiable Rewards)。难点在于,这个机器人的运行速度慢且成本高昂。它每尝试一个食谱,都会消耗大量的计算资源(称为“展开”,rollouts)。
这里有一个问题:机器人经常陷入循环。有时,它会尝试一个非常简单的食谱,并且每次都能成功;其他时候,它会尝试一个超级困难的食谱,并且每次都失败。在这两种情况下,结果都是枯燥且可预测的。如果一批尝试中的每一次都是成功的,或者每一次都是失败的,机器人就学不到新东西,因为没有可以分析的“惊喜”。这就像一位老师在给考试评分,如果每个学生都得了100分或0分,老师就无法判断谁需要帮助,或者谁已经准备好进入下一阶段了。目前解决这个问题的方法是不断烹饪,直到找到足够多的“混合型”批次(即既有对也有错的批次),但这在处理那些枯燥、可预测的批次时浪费了大量的能量。
这篇论文介绍了一种聪明的新策略,叫做 SARA (顺序自适应展开分配,Sequential Adaptive Rollout Allocation),旨在停止这种能量浪费。SARA 不再盲目地烹饪完整的食谱批次并寄希望于好运,而是像一位聪明的副厨,在尝了几口菜后就能判断出味道。如果主厨很早就意识到某个食谱注定会彻底失败(全错)或注定会稳赢(全对),SARA 就会立即停止烹饪该食谱。它会扔掉该特定菜肴剩余的食材,并将节省下来的能量用于开始烹饪一个新的、未知的食谱。
作者在数学和规划问题上,使用单张显卡上的小型 AI 模型测试了该方法。他们发现 SARA 的效率极高。它能以与旧的、浪费的方法相当的效果训练机器人,但减少了 22% 的烹饪尝试(展开次数)。更棒的是,当他们将 SARA 与一种能够预测哪些食谱可能具有趣味性的方法结合时,得到了最高的准确率,且比标准的“尝试一切”方法减少了 67% 的尝试次数。这篇论文从数学上证明了这种提前停止机制是可靠的,并且不会意外丢弃好的学习机会。简而言之,SARA 教会了机器人如何在领先(或落后)时见好就收,并将精力仅投入到那些真正能让它变得更聪明的谜题上。
技术摘要:SARA (顺序自适应展开分配)
问题陈述
带有可验证奖励的强化学习 (RLVR) 目前受限于展开生成 (rollout generation) 的成本。在像组相对策略优化 (GRPO) 这样的基于组的估计器中,一个提示词 (prompt) 对策略梯度的贡献取决于其采样组内的奖励方差。如果一个组处于“饱和”状态(所有响应均为正确或均为错误),则奖励方差为零,导致归一化优势 (normalized advantage) 消失,从而无法产生学习信号。
现有的缓解此类浪费的方法面临着权衡:
先评估后过滤(例如动态采样/DS): 这些方法对大量的候选池进行过采样,生成所有候选的完整组,并丢弃饱和的组。虽然这保证了获得一组高质量的有效组,但会产生巨大的展开成本(通常比均匀采样高出 4 倍或更多),因为它为最终被丢弃的提示词支付了完整的生成费用。
先预测后选择: 这些方法在采样前估计提示词难度,以优先处理有潜力的提示词。虽然它们避免了额外的展开,但依赖于预测模型,而当策略快速变化时,这些预测可能变得脆弱,导致训练批次受到污染。
这两种方法都是在观察到组内部动态之前 ,在提示词层面 做出决策。然而,本文观察到,一个组的有效性通常在它自身序列的早期阶段就已经确定。为一个已经显露出即将饱和迹象的提示词投入完整的组预算,在计算上是极其浪费的。
方法论:SARA
作者提出了 SARA (Sequential Adaptive Rollout Allocation,顺序自适应展开分配) ,将每步展开收集重新定义为一个受预算约束的顺序分配(最优停止)问题。SARA 不再为每个提示词生成固定数量的展开 (k k k ),而是通过分批轮次探测提示词,根据观察到的结果更新信念并做出决策。
核心机制
贝叶斯建模: 对于每个提示词 q q q ,SARA 维护一个关于其潜在成功率 γ q \gamma_q γ q 的 Beta 后验分布。最初使用均匀先验。在观察到 n n n 次展开且包含 s s s 次成功后,后验分布更新为 Beta ( α 0 + s , β 0 + n − s ) \text{Beta}(\alpha_0 + s, \beta_0 + n - s) Beta ( α 0 + s , β 0 + n − s ) 。
闭式有效性预测器: SARA 计算给定当前前缀的情况下,规模为 k k k 的组是“有效”的(即结果混合)的后验预测概率 (p eff p_{\text{eff}} p eff )。
如果前缀已经是混合的(1 ≤ s ≤ n − 1 1 \le s \le n-1 1 ≤ s ≤ n − 1 ),则 p eff = 1 p_{\text{eff}} = 1 p eff = 1 。
如果前缀全为失败或全为成功,则使用 Beta 函数进行解析计算。对于均匀先验且全失败的前缀,这可以简化为 p eff ( n , 0 ) = k − n k + 1 p_{\text{eff}}(n, 0) = \frac{k-n}{k+1} p eff ( n , 0 ) = k + 1 k − n 。
双阈值停止规则: 基于 p eff p_{\text{eff}} p eff ,SARA 应用了一种类似于 Wald 顺序概率比检验 (SPRT) 的顺序决策规则:
提交 (COMMIT): 如果组是混合的(有效的),则立即将其加入训练批次。
放弃 (ABANDON): 如果 p eff p_{\text{eff}} p eff 低于下限阈值 τ low \tau_{\text{low}} τ low ,则认为该提示词很可能已饱和。该提示词剩余的预算将被释放。
继续 (CONTINUE): 否则,该提示词将获得一次额外的展开。
预算重分配: 从放弃的提示词中释放的预算会立即重新分配给来自候选池的新提示词。这确保了固定的总预算能产生比均匀分配更多的有效组。
算法特性
正交性: SARA 作用于展开收集阶段,使其与任何提示词选择策略兼容(例如,它可以与动态采样结合使用)。
无额外展开: 与需要调用辅助模型来估计难度的预测方法不同,SARA 仅使用优化器本身就会生成的展开。
同步性: 该算法在轮次同步批次中运行以维持推理吞吐量,通常每个步骤仅需要 2–4 个同步轮次。
主要贡献
重新定义问题: 作者识别了组有效性的“早期可判定性”,并将展开收集重新定义为一个顺序分配问题,这与提示词层面的选择是不同的。
SARA 算法: 他们推导出了一个闭式 Beta-Binomial 预测器和一个双阈值停止规则,创建了一个无需预测、无需额外展开的分配器,能够集成到现有的 GRPO 流水线中。
理论保证:
放弃可靠性: 错误地放弃有效组的概率由阈值 τ low \tau_{\text{low}} τ low 约束。
展开节省: 在动态采样 (DS) 使用的固定 k k k 之下,SARA 消耗的预期展开次数严格更少,且随着组规模 k k k 的增大,节省效果愈发显著。
产量优势: 在固定预算下,SARA 保证能产生比均匀分配更多的有效组。
梯度联系: 最大化有效组的产量直接最大化了 GRPO 预期平方梯度范数的下界。
实验验证: 在使用 1.5B 和 3B 模型于数学推理和规划任务上的广泛实验。
实验结果
在单 GPU 上使用 R1-Distill-Qwen-1.5B 和 Qwen2.5-3B 模型,并在 MATH、AIME24 和 Countdown 等数据集上进行了评估:
效率对比动态采样 (DS): SARA 在准确度上匹配了使用 Oracle(先知)来过滤饱和组的动态采样 (DS),同时减少了 22% 的展开次数 。
与预测性选择的组合: 将 SARA 与动态采样结合使用 (SARA+DPS) 产生了最佳准确度,略微超过了 DS Oracle,同时比 DS 使用了 67% 更少的展开次数 。
Token 节省: 由于被放弃的“全失败”轨迹往往较长,因此 Token 的节省比展开次数的节省更为显著。
鲁棒性: 不同于随策略变化而性能下降的预测性选择,SARA 依靠样本内验证,在整个训练过程中保持了接近 100% 的有效批次比例。
兼容性: 当用作统一展开收集的替代方案时,SARA 在各种 RL 算法(PPO、GRPO、RLOO、Reinforce++)中均提升了性能。
意义与主张
论文声称 SARA 提供了一种“两全其美”的解决方案,既消除了昂贵的过采样(如 DS),又避免了预采样预测的脆弱性。通过利用展开组内部存在的统计证据,SARA 在无需辅助模型调用的情况下实现了高效训练。
作者将 SARA 定位为 RLVR 的一个基础效率杠杆,特别是在组规模增加以减少方差时。他们指出,尽管该方法假设奖励是二元的且组内展开是独立同分布 (i.i.d.) 的,但其核心的顺序分配逻辑与提示词选择及长度控制方法是正交的,允许未来扩展到连续奖励和树状展开结构。这项工作证明,通过最优停止策略而非仅仅是更好的提示词策划,可以在推理 LLM 的后训练阶段实现显著的计算节省。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。