← 最新论文
💬 NLP

Bayesian Preference Learning for Test-Time Steerable Reward Models

本文提出了变分上下文奖励建模(ICRM),这是一种新颖的贝叶斯框架,它通过上下文示例适应未见过的偏好分布,从而使奖励模型具备测试时的可调控性,进而提升准确性、校准度及多目标对齐能力,同时提供防止过度优化的理论保障。

原作者: Jiwoo Hong, Shao Tang, Zhipeng Wang

发布于 2026-05-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Jiwoo Hong, Shao Tang, Zhipeng Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一个非常聪明的机器人助手(大型语言模型),它需要学习如何以人类喜欢的方式行事。为了教导它,我们通常使用“奖励模型”——可以将其想象为一位严格的老师,这位老师研读过一本关于人类偏好的庞大教科书。一旦这位老师训练完成,它们就固定不变了。即使你走进房间说:“实际上,今天我更看重安全而不是速度”,或者说:“我希望你幽默一点,而不是严肃”,它们也无法改变主意。

本文介绍了一种名为ICRM(变分上下文奖励建模)的新型老师。ICRM 不像一本僵化的教科书,而更像一只变色龙或一位智能翻译官,能够根据你在开始工作前向它展示的少量示例,即时调整其“品味”。

以下是其工作原理的简单概念分解:

1. 问题:被“冻结”的老师

传统的奖励模型就像一位 memorize 了特定规则集的法官。如果你训练它们喜爱“有帮助”的回答,那么即使你后来向它们展示“安全”回答的示例,它们也永远只会喜爱“有帮助”的回答。除非从头重新训练(这既缓慢又昂贵),否则它们无法转变视角。

2. 解决方案:“变色龙”老师(ICRM)

作者提出了一种利用贝叶斯统计(一种基于新证据更新信念的方法)的系统,使老师变得灵活。

  • 类比:想象你试图猜测一位陌生人的最爱冰淇淋口味。
    • 旧方法:你基于去年进行的一项大规模调查来猜测。你只能固守那个猜测。
    • ICRM 方法:你问陌生人:“你喜欢巧克力还是香草?”他们回答“巧克力”。然后你问:“你喜欢草莓还是薄荷?”他们回答“草莓”。
    • ICRM 不仅仅死记硬背“巧克力”。它构建了一个关于这位陌生人此刻喜欢什么的心理地图(概率分布)。如果你向它展示 8 个强调“安全”重要的示例,老师的关注点就会转向安全;如果你展示 8 个强调“有帮助”的示例,它就会转向有帮助。

3. 工作原理:“贝塔”配方

本文使用一种名为贝塔分布的数学工具来表示这些偏好。你可以将其想象为一个带有两个旋钮的拨盘:

  1. 方向旋钮(均值):偏好指向哪个方向?(例如,指向“安全”还是“有帮助”)。
  2. 置信度旋钮(集中度):我们对这种偏好的把握有多大?
    • 如果你只向老师展示一个示例,“置信度旋钮”保持低位。老师会说:“我看到了你喜欢什么,但我还不完全确定,所以我会谨慎行事。”
    • 如果你向老师展示64 个示例,“置信度旋钮”就会调高。老师会说:“我看到了清晰的模式!我对这种偏好非常有信心。”

这防止了老师变得“过度自信”或“过度优化”(过于努力迎合示例而犯错)。它让老师保持谦逊和准确。

4. 本文的发现(结果)

作者通过多种方式测试了这位“变色龙老师”:

  • 可引导性:如果你向老师展示“安全”是首要优先级的示例,它就会成为安全专家。如果你展示“数学”是优先级的示例,它就会成为数学专家。它甚至能处理混合优先级(例如,“要有帮助,但不要不安全”)。
  • 示例越多,表现越好:你在测试时刻提供的示例(演示)越多,它在猜测你的真实意图方面就越聪明。仅通过增加更多示例,他们在标准测试(RM-Bench)上的准确率就从60.5%跃升至70.8%
  • 处理冲突:当你有两个相互冲突的目标时(例如“要有帮助”与“要安全”),ICRM 能在两者之间找到完美的平衡点,而旧老师通常只会固守其中一方。
  • 适用于数学:他们利用 ICRM 教导模型解决数学问题。因为 ICRM 可以即时查看少量“正确推理”与“错误推理”的示例,它帮助模型解决数学问题的能力超过了标准老师,甚至超过了仅仅检查最终答案的严格“验证器”。

5. “安全网”(理论保证)

本文还从数学上证明了该系统免受一种称为“奖励黑客”的特定漏洞的影响。

  • 漏洞:有时,AI 模型学会钻系统的空子,给出那些对老师来说看起来完美但实际上是胡言乱语的答案,仅仅为了获得高分。
  • 修复:ICRM 系统内置了一个“刹车”(KL 正则化项)。它确保老师不会太快变得过于自信。它迫使老师保持在概率的“安全区”内,防止其发疯或过度优化。

总结

简而言之,本文提出了一种训练 AI 法官的新方法。他们不是训练一个拥有固定价值观的法官,而是训练了一个能够读懂你的心思的法官,它基于你在开始工作前向它展示的少量示例来调整。它灵活,随着你提供的示例增多而变得更聪明,并且拥有数学安全网以防止其脱轨。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →