← 最新论文
💻 computer science

One-Way Policy Optimization for Self-Evolving LLMs

本文介绍了一种名为单向策略优化(OWPO)的新方法,该方法通过非对称重加权与迭代参考更新,将优化方向与更新幅度解耦,从而稳定并增强大语言模型的自演化能力,进而克服现有词元级约束的低效性,并实现在无需外部参考模型的情况下持续改进。

原作者: Shuo Yang, Jinda Lu, Kexin Huang, Chiyu Ma, Shaohang Wei, Yuyang Liu, Guoyin Wang, Jingren Zhou, Li Yuan

发布于 2026-05-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Shuo Yang, Jinda Lu, Kexin Huang, Chiyu Ma, Shaohang Wei, Yuyang Liu, Guoyin Wang, Jingren Zhou, Li Yuan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用通俗语言和日常类比对论文《面向自进化大语言模型的单向策略优化》的解释。

核心难题:“中途卡死”困境

想象你正在教一个机器人(AI)解决复杂的数学问题。你有一位裁判(验证器),它只能在解题的最终时刻说“对”或“错”。

  • 问题所在:因为裁判只在最后发言,机器人经常迷失方向。它不知道哪一步出错了,因此学习缓慢且容易困惑。
  • 旧方案:为了提供帮助,研究人员引入了一个参考模型(“老师”)。他们告诉机器人:“要紧跟老师的风格。”这虽然让训练变得稳定,却引发了新问题。
  • 新问题:有时,机器人找到了比老师更优的解题方法。但由于系统强制机器人必须贴近老师,它反而因“与众不同”而受到惩罚。这就像一名学生发现了解题的更快捷径,老师却大喊:“不行!你必须走我教你的那条老路!”结果机器人陷入停滞,无法超越老师的水平。

解决方案:单向策略优化(OWPO)

作者提出了一种名为OWPO的新方法。你可以把它想象为一位聪明的教练,将方向速度区分开来。

1. 教练的规则:

  • 方向:由裁判决定。如果裁判说“这条路是对的”,机器人就走这条路;如果裁判说“这条路是错的”,机器人就掉头。老师从不决定方向。
  • 速度:由老师决定。

2. 双向街道(非对称重加权):
OWPO 根据机器人的尝试是“不如老师”还是“优于老师”,采取不同的处理方式。

  • 场景 A:机器人落后(劣势偏差)
    • 情况:机器人犹豫不决或犯错,而老师在此处很自信。
    • 行动:教练加速学习。它说:“你在这里落后于老师了!快跑,赶紧追上来!”这被称为加速对齐
  • 场景 B:机器人领先(优势偏差)
    • 情况:机器人找到了更好的解法,或者比老师更自信。
    • 行动:教练减缓变化。它说:“你在这里做得很棒!别改太多,否则可能会意外丢掉这个好主意。”这被称为增益锁定。它能保护机器人新产生的、更优的想法,不被随机噪声冲走。

“棘轮效应”:打破天花板

过去,一旦机器人达到老师的水平,就无法再进步,因为老师就是上限。

OWPO 引入了一个棘轮机制(就像一种只能单向转动、不会回退的工具)。

  • 每隔几步,机器人就暂停一下,审视自己最好的表现,并说:“好吧,现在就是老师了。”
  • 它将参考模型更新为自己当前的最佳状态。
  • 这就形成了一架梯子。机器人向上攀登,锁住横档,然后以新的高度为基座继续攀登更高处。它绝不会滑回到过去那个较弱的老师水平。

为何重要(实验结果)

该论文在数学问题(如 AIME 竞赛)上测试了这种方法。

  • 旧方法:机器人会卡在老师水平附近。如果老师只有 37% 的正确率,机器人就会徘徊在 37% 或 38% 左右。
  • OWPO:机器人突破了天花板。它从 30% 起步,超越了老师,最终达到了 40% 以上的准确率。
  • 稳定性:其他方法在尝试更具创造性时可能会崩溃或不稳定,而 OWPO 通过“锁定”好想法,让机器人保持稳健。

总结类比

想象一名徒步者(AI)试图攀登一座山峰。

  • 裁判是指向山顶的指南针。
  • 旧老师是一张地图,上面写着:“必须走这条特定的小径。”如果徒步者发现了捷径,地图会强迫他回到老路上。
  • OWPO则是一位聪明的向导。向导说:“如果你偏离了小径且迷路了,就快跑回到路上。但如果你发现了一条通往更高处的捷径,就放慢脚步、小心行走,以免滑倒,但要沿着这条新路继续走。一旦你到达新的高点,就更新地图,表明现在才是专家,并从此处开始寻找下一条捷径。”

这使得 AI 能够持续进化,不断变得更好,而无需一个外部的“超级老师”永远牵着它的手。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →