← 最新论文
💬 NLP

LambdaPO: A Lambda Style Policy Optimization for Reasoning Language Models

LambdaPO 提出了一种用于推理语言模型的新型强化学习框架,该框架用分解的成对偏好结构和语义密度奖励取代了 GRPO 的单体组均值基线,以捕捉细粒度的优化信号并提升在复杂任务上的性能。

原作者: Zhe Yuan, Yipeng Zhou, Jinghan Li, Xinyuan Chen, Bowen Deng, Zhiqian Chen, Liang Zhao

发布于 2026-05-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhe Yuan, Yipeng Zhou, Jinghan Li, Xinyuan Chen, Bowen Deng, Zhiqian Chen, Liang Zhao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用通俗语言和日常类比对论文《LambdaPO:一种用于推理语言模型的 Lambda 风格策略优化》的解释。

全景图:教导学生思考

想象你正在试图教导一位聪明但困惑的学生(即人工智能)如何解决复杂的数学问题。这位学生可以为单个问题生成多种不同的解法,但其中一些路径是死胡同,有些则杂乱无章,只有少数是完美的。

本文的目标是找出最佳方式给予学生反馈,使他们能更快学习并减少错误。

问题:“平均”陷阱

本文首先审视了一种名为GRPO(组相对策略优化)的流行方法。

  • GRPO 的工作原理:想象学生为一道数学题写出了 8 种不同的解法。老师(算法)查看这 8 种解法,计算平均得分,然后告诉每个学生:“你比平均水平好,做得不错!”或者“你比平均水平差,再试一次。”
  • 缺陷:本文认为,仅使用“平均”值过于粗糙。这就像老师只说“你是平均水平”,却不告诉你为什么
    • 如果学生的解法仅比一个糟糕的答案稍好,但与最佳答案相比却差得远,“平均值”就会掩盖这种细微差别。
    • 它将整个组视为单一的数据块,丢失了不同解法之间相互比较的具体细节。这使得学生难以理解“良好”尝试与“优秀”尝试之间的微妙差异。

解决方案:LambdaPO(“一对一”教练)

作者引入了LambdaPO,这是一种新的辅导学生的方式。LambdaPO 不再将每个人与平均值进行比较,而是将每个解法与组内其他所有解法进行一对一的直接比较。

类比:锦标赛淘汰赛制

  • GRPO 就像教练看着记分牌说:“球队的平均得分是 50 分。”
  • LambdaPO 则像教练观看一场每位选手都与其他每位选手交锋的锦标赛。
    • 如果解法 A 胜过解法 B,解法 A 得一分。
    • 如果解法 A 输给解法 C,解法 A 扣一分。
    • 最终得分不仅仅关乎是否“高于平均水平”,而是关乎你相对于特定对手的表现如何。

“置信度”的转折
LambdaPO 增加了一个巧妙的转折:它会倾听学生自身的置信度。

  • 如果学生不确定(认为两个解法同样好),教练会仔细依据实际的数学结果来决定谁胜谁负。
  • 如果学生非常自信地认为解法 A 优于解法 B,但数学结果表明解法 B 实际上更好,教练会发出巨大的“纠正”信号。这有助于学生意识到他们对自己的直觉判断是错误的。

额外奖励:“语义密度”奖励

在数学问题中,得出最终答案固然很好,但正确展示步骤却更难评分。

  • 旧方法:如果学生最终数字算错,就得"0 分”,即使他们 90% 的逻辑都是正确的。这就像因为一个拼写错误而考试不及格,尽管你完全理解了整个概念。
  • 新方法(LambdaPO):作者增加了一种“语义密度奖励”。这就像一位老师阅读学生的作业,即使最终数字略有偏差,只要使用了正确的词汇和逻辑步骤,也会给予部分分数。它奖励的是推理的质量,而不仅仅是最终结果。

实验中发生了什么?

研究人员在不同的人工智能模型上,针对高难度的数学和科学问题测试了这种新方法。

  1. 更高的分数:使用 LambdaPO 训练的人工智能比使用旧“平均”方法(GRPO)训练的人工智能解决了更多正确的问题。
  2. 更稳定的学习:旧方法有时会导致人工智能在一段时间后变得困惑,并开始做出随机的、糟糕的猜测(即“崩溃”)。LambdaPO 使人工智能保持平稳和专注,防止其脱轨。
  3. 效率:在某些情况下,使用 LambdaPO 训练的人工智能用更少的词(token)解决了问题,并且没有像旧方法那样陷入重复自身的循环。

总结

LambdaPO 是一种更智能的训练人工智能思考的方法。它不再告诉人工智能其表现相对于“组平均”如何,而是确切地告诉人工智能与其自身特定尝试相比表现如何。它还奖励人工智能写出良好的推理步骤,而不仅仅是得出正确答案。这使得人工智能更聪明、更稳定,并且更擅长解决高难度的逻辑谜题。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →