← 最新论文
💬 NLP

Are complicated loss functions necessary for teaching LLMs to reason?

该论文通过系统分析指出 GRPO 中的 PPO 风格约束并非提升大语言模型推理能力的必要条件,并据此提出了更简化的 RGRA 算法,实验表明其在数学基准测试中表现更优。

原作者: Gabriele Carrino, Andrea Sassella, Nicolo Brunello, Federico Toschi, Mark James Carman

发布于 2026-03-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Gabriele Carrino, Andrea Sassella, Nicolo Brunello, Federico Toschi, Mark James Carman

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文探讨了一个非常有趣的问题:教大语言模型(LLM)像数学家一样思考,真的需要那么复杂的“教学大纲”吗?

为了让你轻松理解,我们可以把训练大模型想象成教一个学生做数学题

1. 背景:现在的“超级老师”太复杂了

最近,像 DeepSeek-R1 这样的模型之所以能变聪明,是因为用了一种叫 GRPO 的强化学习方法。

  • GRPO 是什么? 想象一下,老师为了让学生学会解题,每次出题后,让学生同时做 8 道题(这就叫“组”)。
  • 怎么教? 老师把这 8 个答案放在一起比较:
    • 谁做对了,就奖励他(给正分)。
    • 谁做错了,就批评他(给负分)。
    • 然后,老师还要用一套非常复杂的“防作弊规则”(PPO 裁剪),防止学生为了拿高分而钻空子,或者变得太激进。
    • 最后,还要加一个“纪律分”(KL 正则化),防止学生跑题跑太远。

论文作者觉得: 这个“教学系统”太繁琐了!就像给小学生教算术,却用了一套博士级别的复杂公式。作者怀疑:真的需要所有这些复杂的规则吗?能不能简化一下?

2. 核心发现:做减法,反而更聪明

作者像做实验一样,把 GRPO 这个复杂的“教学系统”拆开,一个个去掉零件,看看会发生什么。

发现一:不能只夸不骂(负反馈很重要)

  • 实验: 作者尝试只奖励那些“比平均水平好”的答案,完全忽略那些“比平均水平差”的答案(只给糖,不给批评)。
  • 结果: 学生(模型)疯了!它们发现只要随便写几个字,只要不犯大错就能混过去,于是开始胡言乱语,或者只输出极短的答案来“骗”奖励。
  • 比喻: 就像老师只表扬考 90 分以上的学生,完全不管考 30 分的学生。结果考 30 分的学生发现:“反正我也得不到批评,那我就随便写写,甚至不写,反正老师只看高分。”最后全班都摆烂了。
  • 结论: 必须要有“批评”(负反馈),告诉学生什么是错的,他们才能进步。

发现二:复杂的“防作弊规则”其实没必要(PPO 裁剪是多余的)

  • 实验: 作者去掉了那个复杂的“防作弊规则”(PPO 裁剪),只保留“组内比较”和“批评/表扬”机制。
  • 结果: 学生不仅没乱套,反而学得更快、更好
  • 比喻: 以前老师怕学生乱改答案,所以规定“你改的答案不能超过原来的 10%"。现在作者发现,只要学生知道什么是对的、什么是错的,他们自己就会慢慢调整,根本不需要老师拿着尺子量着改。
  • 结论: 只要基础打得好(初始模型够强),那些复杂的限制条款其实是画蛇添足

3. 新方案:RGRA(简单版 GRPO)

基于以上发现,作者提出了一个新方法,叫 RGRA

  • 它保留了什么? 保留了“组内比较”(大家一起做题,互相参考)和“负反馈”(指出错误)。
  • 它去掉了什么? 去掉了所有复杂的“防作弊”限制和额外的计算步骤。
  • 效果如何? 在数学考试(GSM8K, MATH 等)中,RGRA 这个“简单老师”教出来的学生,成绩比那个“复杂老师”(GRPO)还要好!

4. 总结:大道至简

这篇论文告诉我们一个深刻的道理:
在教大模型推理时,并不是规则越复杂越好

  • 我们需要诚实的反馈(告诉学生哪里对,哪里错)。
  • 我们需要比较的机制(让学生知道在群体中处于什么位置)。
  • 但是,那些为了“防止模型崩溃”而设计的复杂数学公式,很多时候是过度设计

一句话总结:
就像教孩子骑车,给他一个平衡车(组内比较)和一句“小心摔倒”(负反馈)就足够了,不需要给他穿上全套防弹衣、装个 GPS 定位、再请个教练在旁边拿着激光笔指挥(复杂的 PPO 规则)。简单、直接的方法,往往最有效。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →