← 最新论文
💬 NLP

LamPO: A Lambda Style Policy Optimization for Reasoning Language Models

LamPO 是一种针对推理语言模型的新型策略优化方法,它通过将标量组优势替换为成对分解优势以保留细粒度关系信息,从而增强带有可验证奖励的强化学习,进而在数学和科学基准测试上相比 GRPO 等现有方法实现更稳定的训练和更优越的性能。

原作者: Zhe Yuan, Yipeng Zhou, Jinghan Li, Xinyuan Chen, Bowen Deng, Zhiqian Chen, Liang Zhao

发布于 2026-05-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhe Yuan, Yipeng Zhou, Jinghan Li, Xinyuan Chen, Bowen Deng, Zhiqian Chen, Liang Zhao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一名学生如何解决复杂的数学问题。你给出一个问题,他们则带回八种不同的解题尝试。

在旧的教学方式(称为GRPO)中,你会查看所有八个答案,计算“平均”得分,然后告诉学生:“你比平均分表现更好,干得好!”或者“你比平均分表现更差,再试一次。”

这种方法的缺陷在于,它将“平均分”视为单一数值,忽略了细节。如果学生有一个答案“几乎”完美,而另一个答案“完全”错误,旧方法仅仅将它们视为“高于平均”和“低于平均”。它丢失了其中一个答案比另一个好“多少”的细微差别。

LamPO 是一种更智能的、教导这些 AI 学生的新方法。以下是其工作原理,使用简单的类比:

1. “一对一”锦标赛(成对分解优势)

LamPO 不是将每个答案与枯燥的平均值进行比较,而是将答案放入一场锦标赛中。它选取每一对可能的答案并进行直接比较。

  • 旧方式:“你比班级平均分高出 2 分。”
  • LamPO 方式:“你的答案比答案 B 高出 5 分,但答案 C 比你高出 2 分。”

LamPO 审视每一对答案之间的差距。如果学生的答案略好于一个错误答案,LamPO 会给予轻微的推动;如果好得多,则给予大幅推动。这保留了“关系信息”——它确切地知道谁击败了谁,以及击败了多少。

2. “信心计”(加权)

有时,AI 学生对自己的答案非常不确定。LamPO 拥有一个特殊的“信心计”。

  • 如果 AI 非常确信答案 A 优于答案 B,LamPO 会仔细听取该比较。
  • 如果 AI 感到困惑并认为两者差不多,LamPO 会降低该比较的权重。

这就像一位教练:当球员对自己的策略 100% 确定时,教练会听得更专注;而当球员在猜测时,教练则听得不那么专注。

3. “提示系统”(密集辅助奖励)

通常,在数学或编程中,你只在最后得到“对”或“错”的信号。这就像老师说“错了”,却不告诉你“错在哪里”。

当老师拥有正确答案时,LamPO 会添加一个“提示系统”。它使用一种称为ROUGE-L的工具(类似于“词汇重叠检查器”),来查看学生的思考过程在多大程度上与正确答案相似。

  • 即使最终答案是错的,如果学生的步骤有 80% 看起来像正确的步骤,LamPO 也会因为他们走在正确的轨道上而给予少量的“加分”。这防止了学生因得到完全的“零分”而气馁。

结果:更平稳的旅程

该论文在艰难的数学和科学谜题(如 AIME 和 MATH 数据集)上测试了这种新方法(LamPO)与旧方法(GRPO)。

  • 更好的成绩:使用 LamPO 训练的 AI 模型在这些测试中获得了更高的分数。
  • 更少的大起大落:训练过程要平稳得多。旧方法有时会导致 AI 在好坏表现之间剧烈摇摆(就像过山车)。LamPO 让学习保持稳定,就像平稳的电梯运行。
  • 效率:AI 学得更快,需要更少的尝试就能熟练掌握任务。

代价(局限性)

这种方法有一个小成本。因为 LamPO 将每个答案与其他所有答案进行比较(就像循环赛锦标赛),计算所有这些配对需要更多的计算机算力。然而,论文指出,对于他们使用的组规模,这一成本非常小,且物有所值。

总之:LamPO 是一种更智能的 AI 教练方法。它不只是查看班级平均分,而是审视每一场一对一的对决,倾听 AI 的信心,并在过程中提供有用的提示。这造就了更智能、更稳定的推理模型。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →