想象一下,你正在试图教导一位非常聪明但固执的学生(人工智能)如何解决高难度的数学问题或编写复杂的代码。传统的教导方式就像给这位学生做一份选择题试卷,要求他们对每一道题都尝试猜测 16 次。如果猜对了,就得到一颗金星;如果猜错了,就一无所获。
问题在于,这种方法效率低下。学生在他们已经掌握的题目上反复以同样的方式猜测,浪费了时间。与此同时,对于那些让他们屡屡得不到金星、极其困难的问题,他们干脆放弃,不再尝试学习,因为他们从未获得任何反馈。
XRPO 是一种全新的教学框架,旨在解决这一问题。它就像一位超级聪明的导师,会根据学生在当下那一刻的具体需求来调整策略。其运作方式可拆解为三个简单的技巧:
1. “智能下注”策略(针对性探索)
在旧方法中,无论题目是简单还是困难,学生都被迫对每一道题尝试猜测 16 次。
- XRPO 的改进:导师审视题目并问道:“学生在哪里最困惑?”
- 如果一道题很棘手,且学生的答案五花八门(不确定性高),导师会说:“好吧,让我们对这一道题尝试 20 次猜测!”因为学习就发生在这里。
- 如果学生已经擅长某道题,导师会说:“很好,只需猜测一次就足够了。”
- 类比:这就像一位赌徒,停止在他知道是公平的硬币投掷上下注,而是将所有赌注押在最有可能改变局势的骰子投掷上。这节省了时间,并将精力集中在最重要的地方。
2. “带提示的作弊”技巧(上下文学习种子)
有时,学生遇到一道极其困难的问题,导致他们每次都得不到金星。在旧系统中,学生只会盯着空白页面发呆,感到沮丧,而老师也束手无策,因为学生从未产生过可供学习的“正确”答案。
- XRPO 的改进:导师悄悄在学生手中塞入一张“作弊条”。这并非当前问题的答案,而是学生过去曾正确解决过的一个相似问题。
- 类比:想象你被一道谜题难住了。与其盯着它发呆,不如有人递给你一张你昨天解开的类似谜题的图片。突然间,你恍然大悟:“哦!我用了同样的技巧!”这能将学生从“卡住”的状态中唤醒,帮助他们突破之前无法逾越的障碍。
3. “奖励创造力”奖金(新颖性强化)
在旧系统中,如果学生答对了,就能得到一颗金星。无论他们是用枯燥、标准的方式解决,还是用巧妙、独特的方式解决,结果都一样。这导致所有学生的答案看起来千篇一律,他们不再尝试发挥创造力。
- XRPO 的改进:导师审视正确答案并说:“你答对了,但你用了一种非常不寻常的方式!这令人印象深刻。”
- 类比:想象一场烹饪比赛。如果每个人都做出了完美的汉堡,他们都会得到相同的分数。但 XRPO 会给那个用一种自己发明的、秘密且稀有的香料做出完美汉堡的人额外加分。这鼓励学生去探索新的、富有创造力的路径,而不仅仅是复制最常见的解决方案。
成果
当研究人员将这位新“导师”(XRPO)与旧方法进行测试对比时:
- 学习更快:学生达到同等技能水平所需的时间不到原来的一半(速度快了 2.7 倍)。
- 变得更聪明:学生正确解决的问题更多,尤其是那些曾经让他们束手无策的难题。
- 效率更高:学生不再浪费时间撰写冗长、啰嗦的答案;他们学会了简洁明了。
简而言之,XRPO 阻止了人工智能盲目猜测,开始将其视为人类学习者:专注于困难部分,在卡壳时给予提示,并奖励巧妙的思维。
技术摘要:XRPO——通过定向探索与利用突破 GRPO 的极限
1. 问题陈述
近期由可验证奖励强化学习(RLVR)和组相对策略优化(GRPO)推动的大语言模型(LLM)推理进展,在效率和质量方面仍面临持续瓶颈。作者指出了现有方法(如 GRPO、GSPO)的两个主要局限:
- 对有价值轨迹的探索不足:当前方法通常采用静态轨迹分配(例如,为每个提示生成固定数量的轨迹,如 16 条)。这种均匀分布稀释了高奖励方差提示的学习信号,并导致“零准确率”提示(通常是难度最高的问题)未被充分探索。由于这些困难提示对于推动模型能力边界至关重要,忽略它们或将其丢弃(如某些动态采样方法所做的那样)会阻碍模型突破性能极限。
- 对轨迹信号的利用不足:标准的基于规则的奖励(例如二进制的 0/1)抹平了不同轨迹之间的差异。即使模型生成了正确的回答,无论推理路径的复杂性或可能性如何,奖励信号都是相同的。这种稀疏性抑制了模型区分表面相似的成功与失败的能力,未能利用生成轨迹中嵌入的丰富信息,导致行为同质化且次优。
2. 方法论:XRPO 框架
XRPO(探索–利用 GRPO)从平衡探索与利用的原则性视角重新构建了策略优化。它引入了三个核心机制来解决上述局限:
A. 分层轨迹规划(探索)
XRPO 摒弃了静态分配,引入了一种基于数学原理的分层轨迹规划器,该规划器根据不确定性减少和探索奖励自适应地分配轨迹预算。
- 不确定性感知:规划器优先处理那些额外轨迹能提供最大统计不确定性减少的提示。这通过估计平均奖励的 Student's t 置信区间的半宽来量化。
- 探索奖励:为了防止忽视采样稀疏或困难的提示,在优先级分数中加入探索奖励,鼓励在利用高方差提示和探索采样不足的提示之间进行权衡。
- 分阶段分配:该策略分阶段运行。初始的基础轨迹数量建立基线信号,随后是动态轮次,其中剩余预算根据计算出的优先级分数按比例分配。
B. 用于打破对称性的 ICL 种子(探索)
为了解决“零奖励对称性”问题(即困难提示始终无法产生梯度信号),XRPO 集成了上下文学习(ICL)种子机制。
- 机制:对于所有轨迹均失败的提示,系统从不断演进的已验证成功轨迹语料库(由模型在训练期间自行生成)中检索精心策划的示例,并将其作为上下文注入。
- 目标:这暂时扩展了搜索空间,使模型能够访问在稀疏奖励下原本无法触及的推理策略。它打破了零奖励组的对称性,使模型能够在以前无法解决的提示上实现策略改进。
- 语料库管理:ICL 语料库初始为空,并随着策略的演进,通过在线策略的成功案例逐步填充,无需外部教师即可自然演化。
C. 新颖性引导的优势锐化(利用)
为了最大化成功轨迹的效用,XRPO 引入了一种序列级新颖性度量来锐化优势估计。
- 新颖性定义:新颖性定义为轨迹的长度归一化对数似然与组平均值的偏差。在当前模型分布下不典型(低概率)的正确回答被视为“新颖”。
- 优势塑造:对于获得全额奖励的轨迹,如果该轨迹具有新颖性(即其似然低于组平均值),则会在标准 GRPO 优势的基础上添加一个受熵启发的奖励。
- 效果:该机制放大了低概率但正确的回答,鼓励模型探索多样化的推理路径,防止过早收敛到熟悉但次优的模式。它在无需额外轨迹的情况下高效运行。
3. 主要贡献
本文声称有三项主要贡献:
- 新颖的分层轨迹探索:一种根据不确定性减少和探索奖励自适应分配资源的规划器,结合 ICL 种子以打破困难提示上的零奖励对称性。
- 新颖性引导的优势锐化:一种利用序列似然来区分并奖励罕见、正确推理路径的机制,从而改善泛化能力并抵消奖励同质化。
- 全面评估:广泛的实验表明,XRPO 在多样化的数学和代码基准测试中优于最先进的基础模型(GRPO、GSPO、DAPO、TreePO)。
4. 实验结果
作者在 Qwen3-1.7B、Qwen2.5-7B-Instruct 和 Llama-3.2-3B 等模型上评估了 XRPO,基准测试包括 AIME、HMMT、BRUMO、MATH、Codeforces 和 LiveCodeBench。
- 性能提升:XRPO consistently 优于现有进展。
- 在 Qwen3-1.7B 上,与 GSPO 相比,其 pass@1 绝对增益高达4%,cons@32 增益为6%。
- 在 Llama-3.2-3B 上,其在困难数学基准测试(AIME、BRUMO)上表现出平均性能提升。
- 消融研究证实,移除任何组件(ICL、优势锐化或分层规划)都会降低性能,验证了完整框架的必要性。
- 训练效率:与 GRPO 相比,XRPO 将训练收敛速度提高了2.7 倍。例如,在 MATH 数据集上,XRPO 在 450 步内达到 75% 的准确率,而 GRPO 需要约 1,200 步。
- 推理效率:该框架自然导致了更简洁的推理。XRPO 将 Qwen3 的平均生成长度减少了34.7%,Qwen2.5 减少了6.17%,因为模型学会了在上下文约束内更高效地找到有效解决方案。
- 开销:该方法引入了可忽略的计算开销(每步延迟增加约 4.7%),ICL 语料库加载和优势塑造仅增加了极少的时间。
5. 意义与主张
本文将 XRPO 定位为一个原则性框架,系统地重新平衡 RLVR 中的探索与利用。其意义在于:
- 突破能力极限:通过 ICL 种子专门针对并解决“零奖励”困难提示,XRPO 使模型能够突破当前的决策边界,这是标准静态或简单动态采样方法难以实现的。
- 高效资源利用:它证明了基于数学原理的自适应轨迹分配可以在不伴随基于树的搜索或过度采样所带来的巨大计算开销的情况下,产生更优越的结果。
- 泛化性:该框架与最近的优化进展兼容(例如,它补充了 GSPO),并在不同模型规模和领域(数学和代码)中有效运行。
作者指出了局限性,具体而言,他们尚未在超大规模模型(300B+ 参数)上评估该方法,且 ICL 语料库目前依赖于模型自身的成功而非更强的教师模型。然而,结果表明 XRPO 提供了一条通往更稳定、更快 RLHF 收敛的稳健路径。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。