← 最新论文
🤖 machine learning

AAPO: Enhancing the Reasoning Capabilities of LLMs with Advantage Margin

该论文针对现有组相对优势估计方法在优势值接近零时训练效率低下的问题,提出了一种名为 AAPO 的新型强化学习算法,通过基于边际的估计方案增强优势并优化交叉熵损失,从而显著提升了大语言模型在数学推理任务上的表现。

原作者: Jian Xiong, Jingbo Zhou, Jingyong Ye, Qiang Huang, Dejing Dou

发布于 2026-04-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Jian Xiong, Jingbo Zhou, Jingyong Ye, Qiang Huang, Dejing Dou

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一种名为 AAPO 的新方法,旨在让大型语言模型(LLM)变得更聪明,特别是在做数学题和逻辑推理方面。

为了让你轻松理解,我们可以把训练一个 AI 模型想象成教一个学生(AI)参加奥林匹克数学竞赛

1. 背景:以前的老师是怎么教的?(GRPO 方法)

在 AAPO 出现之前,最流行的训练方法叫 GRPO(组相对策略优化)。

  • 原来的做法:老师(算法)给同一个数学题,让 AI 学生一次性写出 10 个不同的答案(这就叫“一组”)。
  • 打分方式:老师把这 10 个答案放在一起比较。
    • 如果 10 个答案里,有 9 个是错的,只有 1 个是对的,那这 1 个对的就会得到很高的“奖励分”(优势值),老师会告诉 AI:“干得好!下次多写这种!”
    • 问题出在哪? 如果这 10 个答案全都写得很棒,或者全都写得很烂,老师就懵了。
      • 如果全对:大家分数都一样,老师没法区分谁更优秀,于是给所有人的“奖励分”都是 0。AI 学不到新东西,训练就卡住了。
      • 如果全错:大家分数也都一样低,老师也没法区分,奖励分还是 0。
    • 比喻:就像老师给全班 10 个考 100 分的学生打分,结果发现大家都一样好,老师就说:“好吧,既然你们水平都一样,那今天谁也别进步了。”于是,全班都停步不前。这就是论文里说的“优势值趋近于零”的问题。

2. AAPO 的绝招:引入“参照系”(优势边界)

AAPO 的核心创新在于引入了一个**“参考模型”(Reference Model)。我们可以把它想象成“昨天的自己”或者“一本标准答案书”**。

  • AAPO 的做法
    1. 让现在的 AI 学生(策略模型)写 10 个答案。
    2. 同时,让那个“参考模型”(比如还没经过强化训练的基础模型)也写 10 个答案。
    3. 关键一步:老师不再只盯着现在的 10 个答案互相比较,而是把现在的 AI 答案参考模型的答案进行对比。
  • 新的打分逻辑
    • 即使现在的 AI 学生写的 10 个答案全都很好(互相之间没区别),但只要它们比“参考模型”写的答案更好,老师就会给一个额外的“进步分”(这就是优势边界 Advantage Margin)。
    • 比喻:以前老师只看“你们 10 个人谁比谁强”;现在老师看“你们 10 个人是不是比‘昨天的自己’强了”。只要比昨天强,哪怕大家今天都考得很好,老师也会说:“很好!你们都在进步,继续加油!”

3. 为什么这很重要?(解决了什么痛点)

  • 避免“死机”:在训练后期,AI 往往已经能写出很多高质量的答案了。这时候,用老方法(GRPO),因为大家水平太接近,奖励分全是 0,训练就停滞了。AAPO 通过引入“和参考模型比”的机制,保证了永远有分数可拿,训练能一直进行下去。
  • 更稳定:老方法有时候会因为某个答案稍微好一点点,就给它极高的分数,导致 AI 学偏了(奖励黑客行为)。AAPO 通过“边界”限制,让奖励更平稳,就像给油门加了个稳压器。

4. 实验结果:真的有用吗?

论文在多个数学竞赛数据集(如 AIME, MATH 等)上测试了 AAPO:

  • 效果显著:无论是小模型(15 亿参数)还是大模型(70 亿参数),AAPO 训练出来的 AI,在解题准确率上都超过了之前的各种方法(包括 GRPO 和 GPG)。
  • 以小博大:AAPO 甚至用较少的数据,就训练出了比那些用海量数据训练的模型还要强的效果。这说明方法比单纯堆数据更重要

5. 总结:AAPO 是什么?

简单来说,AAPO 就是给 AI 训练加了一个**“进步标尺”**。

  • 以前的 AI 训练:像是在一群天才里挑冠军,如果大家都太天才,就挑不出来了,训练就停了。
  • AAPO 的 AI 训练:是看着 AI 和“昨天的自己”赛跑。只要今天比昨天强,哪怕大家今天都跑得快,也能得到鼓励。

这种方法让 AI 在解决复杂的数学和逻辑问题时,能够更持续、更稳定地进化,最终变得更聪明、更可靠。

一句话总结:AAPO 通过让 AI 和“过去的自己”比进步,解决了传统方法在 AI 变强后“学不动”的难题,让大模型在推理能力上实现了新的突破。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →