← 最新论文
🤖 machine learning

PEBS: Per-rater Empirical-Bayes Shrinkage for RLHF Reward-Model Calibration

PEBS 是一种闭式、事后经验贝叶斯收缩估计器,它通过拟合每个标注者的仿射校准器并将其向总体均值收缩,来校准 RLHF 奖励模型中的个体标注者评分尺度,从而在无需重新训练基础奖励模型的情况下显著降低预测误差。

原作者: Arnav Raj

发布于 2026-06-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Arnav Raj

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图烘焙一个完美的蛋糕,但你不是只有一个烘焙师在提供反馈,而是有一千个不同的人在提供反馈。有些人非常严格,只有绝对完美的蛋糕才会给高分。有些人则非常慷慨,几乎任何东西都能给高分。有些人认为“70分”是一个很棒的分数,而对另一些人来说,“70分”简直是一场灾难。

在人工智能(AI)的世界里,特别是在一个被称为 RLHF(基于人类反馈的强化学习)的过程中,AI 模型通过汇集这成千上万种不同的意见来训练出一个巨大的“平均”意见。

问题所在:“平均型”烘焙师并不存在
目前的方法是将所有这些不同的烘焙师强行压缩成一个单一的、扁平的平均值。这就像是把一个认为 70 分很糟糕的严格烘焙师和一个认为 70 分很棒的慷慨烘焙师放在一起,然后说:“好吧,对所有人来说,70 分正好处于中间位置。”

论文指出,这是一个错误。通过将所有人平均化,AI 创建了一个“奖励模型”(即计分员),而这个计分员实际上并不匹配任何一个真实的人。它是一个“弗兰肯斯坦式”的计分员,它混淆了蛋糕的“质量”与烘焙师的“个性”。

解决方案:PEBS(个性化计分员)
作者引入了一种新方法 PEBS(每位评分者经验贝叶斯收缩法)。你可以把 PEBS 想象成一个为每一位烘焙师准备的智能、个性化的翻译官。

PEBS 不再强迫每个人都说同一种语言,它做了两件事:

  1. 倾听个体: 它观察每一个特定的人是如何评分的。它学习到:“啊,这个人是一个‘拉伸型’评分者;他们把分数从 0 到 100 展得很宽。这个人是一个‘压缩型’评分者;他们把分数挤压在一个很小的范围内。”
  2. 利用“群体智慧”作为安全网: 如果一位烘焙师只对极少数蛋糕进行了评分,那么他们的个人翻译可能会不稳定或带有噪声。PEBS 会将他们的个人翻译轻轻地“收缩”(或称之为“向心”)向群体平均值,程度恰到好处,既保证了稳定性,又不会因为过度收缩而丢失其独特的风格。

神奇之处:无需重新训练
最酷的部分是,PE%,它不需要重新教 AI 如何烘焙。它是一个 post-hoc(事后)的调整过程。

  • 想象 AI 已经学会了如何烘焙。
  • PEBS 就像是在烘焙完成后,戴在计分员眼睛上的一副眼镜。
  • 它会对分数进行实时校准,这样当 AI 看到“70 分”时,它能理解:“哦,这是来自一位严格烘焙师的 70 分”,而不是将其视为一个通用的“70 分”。

论文的研究发现
作者在几个不同的数据集上测试了该方法(例如一个大规模的人类反馈集合 PRISM 和另一个 PluriHarms)。

  • 更高的准确度: 当他们使用 PEBS 时,AI 的分数预测与人类实际评分的匹配度更高。他们降低了误差(即 AI 的预测值与人类实际分数之间的差异)约 8.5% 到 9.6%
  • 适用于不同的模型: 他们在不同的 AI “大脑”(如 Qwen 和 Phi-3)上进行了测试,效果良好,尽管在处理某些特定类型的 AI 架构(如 Llama 系列在特定设置下)时存在一定的局性。
  • 不会改变“胜者”: 有趣的是,PEBS 并不会改变哪个蛋糕被排在第 1 名或第 2 名(排名顺序保持不变)。相反,它修正了分数的“量级”。这至关重要,因为 AI 的训练过程(PPO 或 DPO)依赖于分数的实际数值,而不仅仅是排名。如果数值错了,AI 就会学到错误的教训。

“收缩”类比
把 PEBS 中的“收缩”部分想象成一个智能恒温器。

  • 如果一个房间(特定的评分者)拥有非常可靠、长期的温度记录,恒温器会完全信任那个房间的传感器。
  • 如果一个房间只记录了两次读数,恒温器就会假设该传感器可能出现了故障。它并不会忽略传感器,但它会将读数稍微向建筑物的平均温度“收缩”,以防止一个疯狂的猜测搞乱整个系统。

核心结论
PEBS 是一个数学工具,它修复了不同人类评分者与 AI 之间的“翻译误差”。它承认了人们衡量质量的“尺度”各不相同。通过单独校准每个人的尺度并进行智能融合,AI 能够获得一个更清晰、更准确的关于人类真实喜好的图景,而无需从头开始重新训练。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →