这篇论文介绍了一种名为 AAPO 的新方法,旨在让大型语言模型(LLM)变得更聪明,特别是在做数学题和逻辑推理方面。
为了让你轻松理解,我们可以把训练一个 AI 模型想象成教一个学生(AI)参加奥林匹克数学竞赛。
1. 背景:以前的老师是怎么教的?(GRPO 方法)
在 AAPO 出现之前,最流行的训练方法叫 GRPO(组相对策略优化)。
- 原来的做法:老师(算法)给同一个数学题,让 AI 学生一次性写出 10 个不同的答案(这就叫“一组”)。
- 打分方式:老师把这 10 个答案放在一起比较。
- 如果 10 个答案里,有 9 个是错的,只有 1 个是对的,那这 1 个对的就会得到很高的“奖励分”(优势值),老师会告诉 AI:“干得好!下次多写这种!”
- 问题出在哪? 如果这 10 个答案全都写得很棒,或者全都写得很烂,老师就懵了。
- 如果全对:大家分数都一样,老师没法区分谁更优秀,于是给所有人的“奖励分”都是 0。AI 学不到新东西,训练就卡住了。
- 如果全错:大家分数也都一样低,老师也没法区分,奖励分还是 0。
- 比喻:就像老师给全班 10 个考 100 分的学生打分,结果发现大家都一样好,老师就说:“好吧,既然你们水平都一样,那今天谁也别进步了。”于是,全班都停步不前。这就是论文里说的“优势值趋近于零”的问题。
2. AAPO 的绝招:引入“参照系”(优势边界)
AAPO 的核心创新在于引入了一个**“参考模型”(Reference Model)。我们可以把它想象成“昨天的自己”或者“一本标准答案书”**。
- AAPO 的做法:
- 让现在的 AI 学生(策略模型)写 10 个答案。
- 同时,让那个“参考模型”(比如还没经过强化训练的基础模型)也写 10 个答案。
- 关键一步:老师不再只盯着现在的 10 个答案互相比较,而是把现在的 AI 答案和参考模型的答案进行对比。
- 新的打分逻辑:
- 即使现在的 AI 学生写的 10 个答案全都很好(互相之间没区别),但只要它们比“参考模型”写的答案更好,老师就会给一个额外的“进步分”(这就是优势边界 Advantage Margin)。
- 比喻:以前老师只看“你们 10 个人谁比谁强”;现在老师看“你们 10 个人是不是比‘昨天的自己’强了”。只要比昨天强,哪怕大家今天都考得很好,老师也会说:“很好!你们都在进步,继续加油!”
3. 为什么这很重要?(解决了什么痛点)
- 避免“死机”:在训练后期,AI 往往已经能写出很多高质量的答案了。这时候,用老方法(GRPO),因为大家水平太接近,奖励分全是 0,训练就停滞了。AAPO 通过引入“和参考模型比”的机制,保证了永远有分数可拿,训练能一直进行下去。
- 更稳定:老方法有时候会因为某个答案稍微好一点点,就给它极高的分数,导致 AI 学偏了(奖励黑客行为)。AAPO 通过“边界”限制,让奖励更平稳,就像给油门加了个稳压器。
4. 实验结果:真的有用吗?
论文在多个数学竞赛数据集(如 AIME, MATH 等)上测试了 AAPO:
- 效果显著:无论是小模型(15 亿参数)还是大模型(70 亿参数),AAPO 训练出来的 AI,在解题准确率上都超过了之前的各种方法(包括 GRPO 和 GPG)。
- 以小博大:AAPO 甚至用较少的数据,就训练出了比那些用海量数据训练的模型还要强的效果。这说明方法比单纯堆数据更重要。
5. 总结:AAPO 是什么?
简单来说,AAPO 就是给 AI 训练加了一个**“进步标尺”**。
- 以前的 AI 训练:像是在一群天才里挑冠军,如果大家都太天才,就挑不出来了,训练就停了。
- AAPO 的 AI 训练:是看着 AI 和“昨天的自己”赛跑。只要今天比昨天强,哪怕大家今天都跑得快,也能得到鼓励。
这种方法让 AI 在解决复杂的数学和逻辑问题时,能够更持续、更稳定地进化,最终变得更聪明、更可靠。
一句话总结:AAPO 通过让 AI 和“过去的自己”比进步,解决了传统方法在 AI 变强后“学不动”的难题,让大模型在推理能力上实现了新的突破。
1. 研究背景与问题 (Problem)
背景:
强化学习(RL)已成为提升大语言模型(LLM)推理能力的关键技术,特别是在监督微调(SFT)因思维链(CoT)数据有限而表现不佳的场景下。目前主流的 RL 后训练方法(如 GRPO 和 GPG)采用了组相对优势估计(Group Relative Advantage Estimation),通过在一组采样响应内部进行相对比较来估算优势值,从而消除了对独立价值模型(Value Model)的依赖,显著降低了显存消耗和计算成本。
核心问题:
尽管组相对优势估计方法有效,但作者发现其在实际训练中存在严重的效率瓶颈,主要体现在以下两个方面:
- 优势值趋零(Zero Advantage): 当一组响应中的奖励(Rewards)方差较低时(例如所有响应质量都很高,或者都很低),组内相对优势会趋近于零。这导致梯度消失,模型参数无法更新,训练效率急剧下降。论文中的统计图(Figure 1)显示,在训练后期,零优势的比例甚至接近 100%。
- 高方差与不稳定: 当组内奖励差异巨大时,优势值方差过高,可能导致不稳定的梯度上升或意外的优化方向。
- 局部最优陷阱: 当策略模型在特定类型的题目上表现一致良好时,组内比较无法区分细微差别,导致模型难以进一步突破。
2. 方法论:AAPO (Methodology)
为了解决上述问题,作者提出了 优势增强策略优化(Advantage-Augmented Policy Optimization, AAPO)。
核心思想:
AAPO 在传统的组相对优势估计基础上,引入了**优势边界(Advantage Margin)**的概念。其核心在于将策略模型(Policy Model, πθ)生成的响应与参考模型(Reference Model, πref)生成的响应进行对比,而不仅仅是组内对比。
具体算法流程:
- 双组采样: 对于每个输入问题,同时从策略模型 πθ 和参考模型 πref 中各采样一组响应(Oθ 和 Oref)。
- 奖励计算: 计算两组响应的奖励值。
- 优势增强公式: 定义新的增强优势 A^i,t∗,其计算公式如下(公式 5):
A^i,t∗=组相对优势std(rθ)rθi−mean(rθ)+优势边界 (Advantage Margin)clip(rθi−rrefi,δlow,δhigh)
- 第一项是传统的组内相对优势。
- 第二项是优势边界,即策略模型响应奖励与参考模型响应奖励之差(经过截断处理)。
- 目标函数: 直接优化增强后的交叉熵(CE)损失,而非传统的代理损失(Surrogate Loss):
JAAPO(θ)=E[−logπθ(o)⋅A^∗]
关键机制分析:
- 解决零梯度问题: 即使组内相对优势趋近于零(因为组内响应质量都很高),只要策略模型的表现优于参考模型(rθ>rref),优势边界项就会提供非零的梯度信号,确保持续优化。
- 稳定性保障: 通过引入截断(Clip)操作,限制了优势边界的影响范围,防止梯度爆炸。
- 理论保证: 论文证明了 AAPO 在奖励有界、梯度有界的假设下,具有训练稳定性(Stability)和收敛性(Convergence),不会导致目标函数发散。
3. 主要贡献 (Key Contributions)
- 深入分析现有缺陷: 对当前主流的组相对优势估计方法(如 GRPO, GPG)进行了理论分析,揭示了其在训练后期因组内奖励方差低而导致梯度消失(Zero Gradient)的根本原因。
- 提出 AAPO 算法: 创新性地提出了结合“优势边界”的 AAPO 算法。通过引入参考模型作为基准,为策略模型提供了更可靠的优化信号,有效缓解了优势估计趋零的问题。
- 广泛的实验验证: 在多个数学推理基准(AIME24, MATH-500, AMC23, Minerva, OlympiadBench)和不同规模的模型系列(Llama 1B/3B, Qwen 1.5B/7B)上进行了验证,证明了 AAPO 的优越性。
- 开源代码: 提供了完整的代码实现,促进了社区复现与研究。
4. 实验结果 (Results)
实验在多个数学推理基准上进行了零样本(Zero-shot)Pass@1 评估:
5. 意义与总结 (Significance)
AAPO 的核心价值在于解决了 RL 训练后期“梯度消失”的痛点。
- 理论突破: 它指出了单纯依赖组内相对比较的局限性,并提出了利用“参考模型”作为外部锚点来维持优化信号的新范式。
- 工程实用: AAPO 不需要额外的价值模型(Value Model),保持了与 GRPO 相似的显存效率,同时显著提升了训练效率和最终模型性能。
- 推动发展: 该方法为提升 LLM 在复杂推理任务(如数学、科学)中的表现提供了一种高效、稳定的新路径,特别是对于资源受限或数据有限的场景,AAPO 展现了巨大的潜力。
局限性:
- 虽然缓解了优势趋零,但无法完全消除该现象。
- 由于需要采样参考模型,训练时间略有增加(尽管显存未显著增加)。
总体而言,AAPO 通过引入优势边界(Advantage Margin),巧妙地平衡了组内比较的效率和组间比较的稳定性,是当前 LLM 强化学习后训练领域的一项重要进展。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。