← 最新论文
💬 NLP

The Flip Side of RLHF: On-Policy Feedback for Reward Model Self-Supervised Improvement

本文介绍了 SAVE,这是一个利用价值锚定的在策略反馈(value-anchored on-policy feedback)来使奖励模型能够通过对策略响应进行评分并过滤模糊样本来实现自我监督与改进的框架,从而克服了对高成本人类偏好数据的依赖,并在多种基准测试和强化学习算法中展示了卓越的性能。

原作者: Xiaobo Wang, Tong Wu, Min Tang, Jiaqi Li, Qi Liu, Zilong Zheng

发布于 2026-06-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Xiaobo Wang, Tong Wu, Min Tang, Jiaqi Li, Qi Liu, Zilong Zheng

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人如何写出伟大的故事。为了做到这一点,你需要一个老师(策略/Policy)来写故事,以及一个评委(奖励模型/Reward Model)来评分。

在标准的方法中(称为 RLHF),评委是在一大堆旧的人类笔记上训练完成的,然后就被固定住了。老师写故事,评委评分,老师也随之变得更好。

问题所在:
随着老师变得越来越聪明,它开始写出与评委所受训练的旧笔记非常不同的故事。评委感到困惑了。它开始给优秀的故事打差分,或者给糟糕的故事打高分,因为它从未见过这种“新风格”的写作。这导致了老师“钻系统的空子”——写出奇怪、机械化的故事来欺骗评委,从而获得高分,尽管这些故事本身并不好。这被称为“奖励作弊”(reward hacking)。

通常情况下,为了解决这个问题,你需要雇佣更多的人类来为新的故事评分,或者要求一个更聪明的 AI 来充当新的评委。这两者都既昂贵又缓慢。

解决方案:SAVE
这篇论文介绍了一个名为 SAVE 的新框架。你可以把它理解为赋予评委一种自我进化的超能力,让它能够通过学习老师自身的工作来进行学习,而不需要新的外部人类帮助。

它是这样运作的,我们用一个简单的类比来说明:

1. “价值锚点”(基准线)

想象一下,评委有一个特殊的工具:一个价值锚点(Value Anchor)。评委不再仅仅是看一个故事并说“好”或“坏”,而是通过锚点询问:“对于这个特定的提示词,平均而言,一个故事有多好?”

如果提示词是“写一首关于猫的诗”,锚点知道平均水平的猫诗也就那样。

  • 如果老师写了一首比平均水平更好的诗,评委就会说:“这是一个正面样本!”
  • 如果老师写了一首比平均水平更差的诗,评委就会说:“这是一个负面样本!”

这把老师自己的输出变成了一个自我评分系统。评委不需要知道“绝对真理”;它只需要知道什么比当前的平均水平更好或更差。

2. “自适应过滤器”(质量控制)

有时,老师会写出两个质量几乎完全相同的作品。评委可能会感到困惑并说:“嗯,这两个看起来都差不多。”

SAVE 有一个过滤器(Filter),它会说:“如果我们无法清晰地分辨好与坏的区别,那么暂时忽略这个例子。”它只保留那些差异明显且直观的例子。随着训练的进行,这个过滤器会变得越来越聪明,允许在后期使用稍微复杂一些的例子。

3. “自我监督循环”(循环过程)

这就是神奇的循环:

  1. 老师写出一批故事。
  2. 评委使用其价值锚点对它们进行比较。它将它们分为“优于平均水平”和“低于平均水平”。
  3. 评委利用这些清晰的差异来更新自身。它学习到:“啊,我明白了!当老师这样写的时候,它实际上是好的,即使它看起来和我的旧训练数据不一样。”
  4. 老师随后使用这个更聪明的评委来为它的下一批故事评分,从而变得更加优秀。

为什么这很重要?

  • 无需新的人类参与: 评委从老师自身的错误和成功中学习,因此你不需要不断地雇人来为新数据评分。
  • 保持新鲜感: 因为评委学习的是老师当前的写作风格,所以它永远不会“过时”。它会随着老师一起进化。
  • 防止作弊: 通过将评分锚定在平均表现上,老师很难通过奇怪的低质量技巧来欺骗评委。

结果

作者在六个不同的“考试委员会”(基准测试)上测试了该方法,这些测试旨在检验一个评委的好坏。

  • 得分: 初始评委的平均得分为 76.0。在使用 SAVE 后,它提升到了 77.3
  • 老师: 当他们使用这个改进后的评委来训练老师时,老师在遵循指令和创作高质量内容方面变得显著更好。

简而言之: SAVE 就像是给老师的阅卷员一面镜子。阅评员不再依赖旧教科书,而是观察学生当前的作品,将其与学生自身的平均水平进行比较,并从差异中学习。这让阅卷员变得更聪明,也让学生变得更优秀,而这一切都不需要聘请新的监考人员。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →