← 最新论文
🤖 machine learning

Hölder Policy Optimisation

本文介绍了 HölderPO,这是一种广义策略优化框架,通过动态调整 Hölder 均值参数以平衡梯度集中性与方差稳定性,从而解决了组相对策略优化(GRPO)中固定聚合的局限性,并在数学及任务导向基准测试中实现了最先进性能。

原作者: Yuxiang Chen, Dingli Liang, Yihang Chen, Ziqin Gong, Chenyang Le, Zhaokai Wang, Jiachen Zhu, Lingyu Yang, Jianghao Lin, Weinan Zhang, Jun Wang

发布于 2026-05-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Yuxiang Chen, Dingli Liang, Yihang Chen, Ziqin Gong, Chenyang Le, Zhaokai Wang, Jiachen Zhu, Lingyu Yang, Jianghao Lin, Weinan Zhang, Jun Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教导一位聪明但略显困惑的学生(一个大语言模型)如何解决复杂的数学问题或驾驭电子游戏世界。你提供了一堆练习尝试,对于每一次尝试,你都必须决定:“他们答案中的哪些具体词语是最关键的,必须答对?”

这就是本文要解决的核心挑战。作者提出了一种名为HölderPO(Hölder 策略优化)的新教学方法。

以下是使用简单类比进行的分解:

1. 问题:“一刀切”式的老师

以前的方法(如 GRPO)就像一位总是用同一套规则给学生作文打分的老师。

  • 算术平均数(标准 GRPO): 这位老师平等地平均对待每一个词。如果学生答对了 90% 的词语,但在一个困难的数学问题中漏掉了一个关键的“顿悟”时刻,这位老师会将那个错失的时刻仅仅视为平均值中的一个微小波动。学生无法从那个具体的错误中获得足够的学习。
  • 几何平均数(其他方法): 这位老师非常温和。他们平滑了分数,使得没有任何一个词语显得过于重要。这对于学生只需保持一致性的简单任务来说很好,但在困难任务中,它会忽略那些学生终于想通问题的罕见且关键的瞬间。

问题所在: 论文发现,不存在单一的“完美”规则。

  • 困难、稀疏的任务(如 AIME 数学竞赛)中,正确答案取决于少数几个罕见且精彩的步骤。你需要一位能聚焦于这些特定步骤并忽略其余部分的老师。
  • 稠密任务(如标准数学作业)中,正确答案分散在许多词语中。你需要一位能纵观全局以避免被噪声迷惑的老师。

2. 解决方案:“旋钮”式老师(HölderPO)

作者创建了一个新系统,其中包含一个单一的旋钮(称为参数 pp),用于控制老师如何给学生打分。

  • 将旋钮调高(高 pp): 老师变成了一束聚光灯。他们忽略那些平庸、普通的词语, intensely 聚焦于那些“超级正确”或“超级错误”的少数词语。这就像一位教练大喊:“你刚才那一个动作完美无缺!再做一次!”这有助于学生学习罕见且困难的技能。
  • 将旋钮调低(低 pp): 老师变成了一个广角镜头。他们平等地看待整个词语序列。这防止了学生为了完美化某一个微小细节而忽略其余部分,从而陷入疯狂。这使训练保持稳定和平静。

3. 秘密武器:“动态调度”

本文最大的突破在于认识到你不应该永远将旋钮固定在同一个位置

想象一下训练一名马拉松运动员:

  1. 早期阶段(短跑): 当运动员还是新手时,他们需要学习特定的、爆发性的动作来起步。你将旋钮调(高 pp)。你喊道:“专注于那一次完美的步幅!”这放大了那些罕见的、良好的信号,促使他们动起来。
  2. 后期阶段(耐力): 一旦他们学会了如何跑步,他们就需要保持平稳、稳定的节奏,避免绊倒自己的脚。你将旋钮调(低 pp)。你说:“保持全身平衡流畅。”这防止了他们过度纠正并导致崩溃。

HölderPO 随着训练的进展,自动将旋钮从“高”移动到“低”。 它开始时激进地搜寻那些“顿悟”时刻,结束时则平滑一切以确保稳定的收尾。

4. 结果:赢得比赛

作者将这种“旋钮式老师”在两类挑战上进行了测试:

  • 数学竞赛(AIME、MATH 等): 动态方法实现了 54.9% 的平均准确率,显著超越了之前的最佳方法。它通过成功放大那些罕见的、正确的推理步骤,打破了最难数学问题(AIME)的纪录。
  • 机器人/智能体任务(ALFWorld): 在一个模拟世界中,智能体需要寻找、清洁和加热物体,该方法实现了 93.8% 的成功率。这非常巨大,因为它意味着智能体在长期、多步骤的任务中很少会迷路或困惑。

总结

HölderPO 想象成一位聪明的训练教练,它知道何时对学生大喊以专注于特定的突破,以及何时让他们冷静下来以确保他们不犯错。通过在这两种模式之间自动切换,它以前所未有的速度和可靠性教会 AI 模型解决难题。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →