← 最新论文
🤖 machine learning

Value-Free Policy Optimization via Reward Partitioning

本文介绍了奖励划分优化(Reward Partition Optimization, RPO),这是一种简单且可扩展的单轨迹偏好学习方法,它通过通过提示词级分布对奖励进行归一化,消除了对价值函数估计的需求,从而实现了比 DRO 和 KTO 等现有基准模型更优越的对齐性、多样性和稳定性。

原作者: Bilal Faye, Hanane Azzag, Mustapha Lebbah

发布于 2026-06-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Bilal Faye, Hanane Azzag, Mustapha Lebbah

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在教一个机器人厨师如何烹饪完美的佳肴。在过去,主要有两种方法可以做到这一点,但两者都有严重的缺陷。

旧方法:“口味测试”与“美食评委”

  1. “口味测试”(成对偏好):
    传统上,为了教导厨师,你会针对同一个订单提供两道不同的菜肴(例如,两份不同的千层肉酱面),并询问人类:“哪一个更好?”机器人通过比较这两者来进行学习。

    • 问题所在: 随着机器人变得越来越优秀,人类很难分辨出两份优秀的肉酱面之间的细微差别。这就像是要求一位美食评论家在两份五星级大餐之间做出选择;这既费力、昂贵又缓慢。
  2. “美食评委”(奖励模型 + 强化学习):
    另一种方法是聘请一位“美食评委”(一个独立的 AI)来品尝食物,并给它打出 1 到 10 分的分数。然后,机器人尝试烹饪那些能获得该评委高分的菜肴。

    • 问题所在: 评委可能会出错,或者机器人可能会试图“钻评委的空子”,制作一些奇怪、有毒或毫无意义的食物,只为了获得高分。这在计算上非常昂贵且不稳定,就像是在风暴中试图维持一座纸牌屋的平衡。

新方法:RPO(奖励划分优化)

作者引入了一种更简单的新方法,称为 RPO。RPO 不再是比较两道菜,也不需要聘请专门的“评委” AI,它通过观察机器人针对单个订单所制作过的所有菜肴,来确定该特定订单的“平均质量”。

以下是 RPO 的工作原理,使用一个简单的类比:

“课堂成绩”类比

想象一位老师(机器人)正在批改作文。

  • 旧方法 (DRO): 老师试图在写每一篇作文 之前 就猜出“完美分数”。他们在写作的同时还要同时猜测这个“完美分数”。这很令人困惑,并会导致错误。
  • RPO 方法: 老师查看针对特定题目(例如,“写一个关于猫的故事”)编写的所有文章。
    • 有些文章很糟糕(得分 2 分)。
    • 有些还可以(得分 5 分)。
    • 有些非常出色(得分 9 分)。
    • RPO 计算了所有这些猫咪故事的平均质量。
    • 如果机器人写出的故事优于平均水平,它就会得到一个“赞许”,并学习再次这样做。
    • 如果它写的文章低于平均水平,它就会得到一个“批评”,并学习进行改进。

神奇之处: RPO 不需要一个单独的“评委” AI 来告诉它平均值是多少。它只需查看现有的数据(提示词、回答和分数),并通过快速的数学计算来找到这个平均值。这使得训练过程更快、更稳定,且不太容易变得失控。

他们发现了什么?

研究人员在许多不同类型的 AI 模型(包括理解并生成文本的模型,以及仅生成文本的模型)上测试了这种新方法。结果如下:

  • 更好的结果: 经过 RPO 训练的机器人编写的回答比使用旧方法训练的机器人更具帮助性、更多样化(减少了重复)且更安全(减少了毒性)。
  • 稳定性: 旧方法有时会让机器人的行为发生剧烈波动(就像汽车失控一样),而 RPO 让机器人的行为保持在平稳、稳定的路径上。
  • 速度: 使用 RPO 训练机器人所需的时间更短。
  • 鲁棒性: 即使作文的评分有些“噪声”或不完美(比如人类评分员状态不佳),RPO 依然表现良好。它并没有崩溃。

局限性

论文诚实地指出了 RPO 可能面临困难的地方:

  1. 你需要人群: 为了计算那个“平均值”,你需要看到针对同一个提示词的多个不同回答。如果你只有一个回答,RPO 就无法进行它的神奇数学运算。
  2. 垃圾进,垃圾出: 如果评分(奖励)完全错误或被损坏,该方法仍然会遇到困难,尽管它比旧方法能更好地处理微小的错误。

核心结论

本文提出了一种更聪明、更简单的教学方式——RPO,旨在让 AI 变得更有帮助。RPO 不再要求人类比较两个选项,也不需要构建一个复杂的系统去猜测“完美分数”,它只是观察针对一个问题的所有答案,找到平均值,然后教导 AI 向着高于平均值的方向努力。这是一种更稳定、更高效且更有效的使 AI 符合人类偏好的方法。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →