技术摘要:离上下文 GRPO (Off-Context GRPO, OC-GRPO)
1. 问题陈述:RLVR 中的“学习悬崖”
强化学习结合可验证奖励(RLVR),特别是使用群体相对策略优化(GRPO),已成为增强大语言模型(LLM)推理能力的支配性方法。然而,作者指出了一种被称为**学习悬崖(learning cliff)**的基本失效模式。
在标准的 GRPO 中,针对给定问题,会采样一组响应,由验证器评分,并根据该组内的相对表现计算优势(advantages)。如果问题足够困难,导致模型在一次 Rollout 组中无法生成任何正确的解,则所有奖励均为零。因此,组内奖励方差会塌缩至零,导致梯度信号消失。无论训练持续多久,模型都无法获得学习信号。
现有的权宜之计通常涉及在训练期间向提示词(prompt)中注入特权引导(privileged guidance)(例如:解题前缀、提示或先验信息)以确保至少有一些 Rollout 能够成功。虽然这恢复了学习信号,但引入了离上下文问题(off-context problem):
- 训练分布: Rollout 是从包含特权信息的引导提示 g(x) 中采样的。
- 目标目标(Target Objective): 目标是优化原始、无引导提示 x 下的策略。
- 不匹配: 标准的引导方法(如 POPE, BREAD)优化的是以 g(x) 为条件的 Jguide(θ),并假设策略能够“回推泛化”(back-generalize)到 x。作者认为,这实际上是在优化一个与部署时评估的目标不同的目标函数。这种不匹配会导致梯度偏差、目标失配,并导致训练不稳定,对于吸收分布偏移能力有限的小型模型而言尤为如此。
2. 方法论:离上下文 GRPO (OC-GRPO)
论文提出了 OC-GRPO,这是对 GRPO 的一种极小化修改变体,它利用引导式 Rollout 来克服学习悬崖,同时通过数学手段修正分布不匹配,以确保更新目标是原始的无引导目标 J(θ)。
核心机制:重要性采样修正
OC-GRPO 不再将引导式 Rollout 视为由原始提示生成的样本,而是对逐 Token 策略比例应用重要性采样(Importance Sampling, IS)修正。
- 标准 GRPO 比例: ρi,t(θ)=πθold(yi,t∣x,yi,<t)πθ(yi,t∣x,yi,<t)
- OC-GRPO 比例: ρi,toc(θ)=πθold(yi,t∣g(x),yi,<t)πθ(yi,t∣x,yi,<t)
这里,分子代表当前策略在给定无引导提示(目标)下的 Token 概率,而分母代表在给定引导提示(实际采样分布)下的概率。
理论特性
- 无偏性: 经数学证明,在引导分布下的重加权期望与原始无引导目标下的期望完全等价。这确保了算法优化的是 J(θ),而非 Jguide(θ)。
- 行为感知信用分配(Behavior-Aware Credit Assignment): 重要性比例充当了一种动态的信用分配机制:
- 成功案例: 如果一条正确的轨迹在引导提示下概率很高,但在无引导提示下概率很低(即模型高度依赖提示),则重要性比例 <1,从而削弱正向信用。这防止了模型仅仅学会“遵循提示”而非“解决问题”。
- 失败案例: 如果一条轨迹尽管有引导仍然失败,则比例 >1,从而放大惩罚。这强化了即使有帮助,模型也未能解决问题的反馈。
- 方差控制: 修正项的方差随引导前缀的长度缩放,而非整个 Rollout 的长度。这促成了设计原则:使用最短且必要的引导长度来打破学习悬崖。
实现变体
- OC-GRPO-Fixed: 在训练前使用基座模型识别每个难题所需的最低引导水平。该增强数据集是固定的,策略不会重新选择引导。由于其较低的推理成本和具有竞争力的性能,建议将其作为默认方案。
- OC-GRPO-Adaptive: 在训练期间根据当前策略的表现动态调整引导水平。虽然在理论上更具灵活性,但它带来了更高的推理成本,并在实验中表现出略低的性能。
3. 核心贡献
- 形式化了离上下文问题: 作者正式定义了现有引导式 RLVR 方法中的不匹配问题,表明它们隐式地优化了一个与部署目标不同的目标函数。
- OC-GRPO 算法: 通过使用重要性采样对 GRPO 进行极小化修改,用以修正离上下文采样,从而实现对原始目标的可证明无偏性。
- 理论上的信用分配: 证明了重要性修正诱导了一种行为感知机制,能够在无需额外奖励塑造的情况下,自动降低过度依赖引导的成功权重,并放大即便有引导仍失败的惩罚。
- 实证验证: 证明了 OC-GRPO 在多个模型规模(1.5B, 3B, 7B)和数学基准测试中,相比于 Vanilla GRPO 实现了持续的增益。
4. 实验结果
作者在 MATH 数据集(等级 3–5)上使用 Qwen2.5 模型(1.5B, 3B, 7B)配合 LoRA 适配器对 OC-GRPO 进行了评估。
- 性能提升: 在 7B 模型上,OC-GRPO-Fixed 在 AIME、Gaokao2023 和 OmniMath 基准测试中,相比 Vanilla GRPO 实现了 13.8% 的相对增益(3.9% 的绝对提升)在平均 Pass@1 指标上。
- 基准对比:
- OC-GRPO 优于其他优化误匹配 Jguide 目标的引导方法(如 POPE, PrefixRL, BREAD)。
- 规模依赖性: 一个关键发现是,在较小的模型规模(如 1.5B 和 3B)下,优化误匹配目标的引导基准方法往往会低于 Vanilla GRPO。相比之下,OC-GRPO 在所有规模下均保持了稳定的增益。这表明小型模型无法吸收目标不匹配带来的影响,使得重要性修正变得至关重要。
- 稳定性: 实验表明,未经修正的引导训练(Masked no-IC)会导致奖励塌缩、梯度范数激增以及对数概率差距扩大,而 OC-GRPO 则保持稳定。
5. 意义与主张
论文主张:特权信息可以引导探索,但更新必须考虑到其来源的分布。
- 解决悬崖问题: OC-GRPO 提供了一种原则性的方法,可以在不借助监督微调(SFT)或复杂的混合目标(这些会扭曲模型的原生推理风格)的情况下,解决硬问题的学习悬崖问题。
- 对齐: 它确保了在特权上下文(在推理阶段不存在)上的训练不会导致策略偏离真实的部署目标。
- 可扩展性: 该方法对于无法通过“回推泛化”假设的小型模型尤为重要。
- 通用性: 虽然在数学推理(使用解题前缀)上进行了演示,但该框架是机制无关的,适用于任何形式的特权信号(例如:工具调用结果、中间状态)在智能体(Agentic)RLVR 设置中的应用。
作者总结道,OC-GRPO 代表了下一代 RLVR 算法必要的修正,它能够在处理困难问题时实现鲁棒推理,同时保持与原始任务定义的对齐。