← 最新论文
🤖 machine learning

Normalized Rewards for Preference Optimization

本文提出了一种针对 DPO 和 SimPO 等直接对齐算法(DAAs)的基于归一化的正则化技术,旨在缓解过度优化和似然崩溃问题,并证明该技术通过稳定标记级概率分布,显著提升了生成质量和通用基准性能。

原作者: Shawn Im, Federico Danieli, Skyler Seto, Barry-John Theobald, Katherine Metcalf

发布于 2026-07-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Shawn Im, Federico Danieli, Skyler Seto, Barry-John Theobald, Katherine Metcalf

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个非常有天赋但又有点混乱的机器人如何写故事。你不想让它只是死记硬背你最喜欢的书;你希望它能理解你为什么喜欢这些书,这样它才能写出感觉同样棒的新故事。这就是人工智能中“对齐”(alignment)的世界。科学家们使用一种叫做“偏好优化”(preference optimization)的过程来教这些机器人。他们向机器人展示两个不同的答案——一个好的,一个坏的——并让它学习去选择那个好的。最流行的方法就像是在玩一场“热与冷”的游戏,机器人的得分取决于它的答案与人类偏好有多接近。

然而,这里有一个棘手的问题。有时,由于过于渴望取悦人类,机器人会变得过于兴奋。它开始以一种奇怪的方式改变其内部的“词汇表”,使得它本该使用的词汇感觉不再自然,尽管它在游戏中表现得越来越好。这就像一个学生,为了拿 A 而开始使用一种奇怪且过度复杂的方言,虽然他在技术上答对了,却让所有人感到困惑。这篇论文研究了为什么会发生这种情况,并提供了一条新的规则来让机器人保持接地气,确保它在学习变得有帮助的同时,不会失去原有的个性或编造出奇怪且有害的答案。


机器人的过度自信问题

这篇论文关注的是一种特定类型的机器人训练方法——直接对齐算法(Direct Alignment Algorithms, DAAs),其中最著名的是 DPO。把 DPO 想象成一位教练,它会对机器人说:“你在这一题的表现比那一题要好”,而不需要一个单独的裁判来评分。这种方式既高效又流行。但作者们注意到了一些奇怪的现象:机器人正在变得“过度优化”。

想象一下你在玩一款收集金币的电子游戏。游戏告诉你:“多收集金币!”于是,你开始疯狂地奔跑,忽略了墙壁、敌人和实际的路径。最终,你可能会因为太专注于金币而忘记了世界的运作规律,从而掉出地图。在机器人的案例中,它如此专注于最大化它的“奖励”(即选择正确答案的分数),以至于它开始扭曲它对概率的理解。它会同时降低说“好词”和“坏词”的概率,这听起来很奇怪,但实际上这会让机器人更有可能说出一些它从未见过的东西——有时是危险或荒谬的东西。这被称为“似然位移”(likelihood displacement)。

解决方案:一个“全概率”规则

作者提出了一个简单但强大的修复方法:一个名为**归一化奖励(Normalized Rewards)**的新规则。

为了理解这一点,请想象一个披萨。整个披萨代表了机器人所有可能回答的 100%。当机器人进行常规训练时,它可能会决定让“好切片”和“坏切片”都变小,这意味着“未知切片”(机器人尚未见过的部分)正在变大。这是很糟糕的,因为机器人可能会开始提供那些奇怪的未知切片。

作者建议在训练中加入一个“正则化项”。把它想象成一个严格的披萨厨师,他会说:“嘿,你谈论的这些切片(好的答案和坏的答案)的总大小必须保持不变。”如果机器人试图过度缩小“好切片”,厨师会强迫它也相应地缩小“坏切片”,以保持总体的平衡。这能阻止机器人无意中膨胀那些奇怪的、未知的切片。

他们的发现

研究人员在两种不同类型的机器人上测试了这个新规则:一种是使用参考指南的机器人(DPO),另一种是不使用参考指南的机器人(SimPO)。以下是他们的发现:

  1. 更好的平衡: 通过保持总概率平衡,机器人在变得更有帮助的同时,并没有失去其通用的智能。在一项衡量机器人遵循指令能力的测试(AlpacaEval2)中,使用新规则的 Llama-3.1-8B-Instruct 模型比使用旧方法实现了超过 20% 的相对增长
  2. 保留通用技能: 通常,当机器人变得非常擅长遵循指令时,它们在通用知识(如数学或科学)方面会变差。但有了这个新规则,机器人的通用基准测试表现也提升了,增幅超过 9%
  3. “离群值”罪魁祸首: 作者深入挖掘以寻找旧方法失效的原因。他们发现,问题并不是发生在机器人的整个大脑中。它集中在极少数“离群值”词汇上——即那些机器人几乎不了解的罕见、奇怪的标记(tokens)。这些极少数的词汇承担了破坏概率的重任。新规则专门针对这些低似然度的词汇,温柔地将它们推回正常状态,以免它们扰乱整个系统。

结论

论文指出,机器人变得“疯狂”的原因在于它们没有被强制要求保持其概率数学的严谨性。通过添加一个简单的规则来保持它们所看到的答案的总似然度稳定,机器人可以在学习遵循人类偏好的同时,不破坏自身的内部逻辑。

作者发现,这种方法对于使用参考指南和不使用参考指南的机器人都有效。他们表明,这种方法不仅能阻止不良行为,还能帮助机器人在现实任务中表现得更好。虽然他们并不声称这解决了 AI 的所有问题,但他们的实验表明,保持“披萨切片”的平衡是迈向开发既聪明又安全的 AI 的关键一步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →