← 最新论文
💬 NLP

When Distance Distracts: Representation Distance Bias in BT-Loss for Reward Models

本文指出标准的 Bradley-Terry 奖励模型损失函数存在表示距离偏差,该偏差导致梯度更新过度依赖于特征距离而非预测误差,并提出了一种轻量级归一化方案 NormBT,通过缓解这一问题来显著提升性能,尤其是在细粒度推理任务上。

原作者: Tong Xie, Andrew Bai, Yuanhao Ban, Yunqi Hong, Haoyu Li, Cho-Jui Hsieh

发布于 2026-06-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Tong Xie, Andrew Bai, Yuanhao Ban, Yunqi Hong, Haoyu Li, Cho-Jui Hsieh

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在训练一名法官,让其决定两个 AI 生成的答案中哪一个更好。这正是大型语言模型(LLM)领域中**奖励模型(Reward Model)**的核心工作。训练这位“法官”的标准方法叫做 Bradley-Terry (BT) 损失函数

你可以将 BT 损失看作是一位正在给学生评分的老师。老师观察两个答案:一个是“被选中”的(好的),另一个是“被拒绝”的(坏的)。如果学生答错了,老师就会给予一个“推力”(梯度更新)来纠正他们。

问题所在:“距离”带来的干扰

论文指出,目前的“老师”(BT 损失)有一种奇怪的偏见。它不仅仅根据学生“错得有多离谱”来给予推力,还会根据这两个答案在计算机眼中看起来“有多不同”来给予推力。

这里有一个简单的类比:

想象你在教一个人分辨两幅画的区别。

  1. 情况 A(明显的错误): 你展示了一幅猫的画和一幅烤面包机的画。学生说:“烤面包机更好。”这是一个巨大的、显而易见的错误。在学生的认知中,这两张图片距离很远。老师给出了一个巨大的、响亮的推力:“不!那是烤面包机!学学这个!”
  2. 情况 B(微妙的错误): 你展示了两幅非常相似的猫的画。一幅耳朵上有一道微小的划痕;另一幅则是完美的。学生说:“带划痕的那幅更好。”这是一个极其微小、微妙的错误,但它是唯一的区别。在学生的认知中,这两张图片距离非常近

缺陷: 在标准的 BT 方法下,老师对情况 B 只会给予一个微弱的、几乎察觉不到的推力。为什么?因为计算机认为:“这两张图片看起来如此相似,我对它们的‘感觉’差异很小,所以我也不会用力推学生。”

相比之下,对于情况 A,老师仅仅因为图片看起来差异巨大,就给予了巨大的推力,即便学生早就已经确定烤面包机是不好的。

结果: 学生把所有时间都花在了学习如何区分猫和烤面包机(那些容易、明显的差异)上,却几乎没怎么学习如何发现猫耳朵上那道微小的划痕(那些困难、重要的细节)。在 AI 世界中,这意味着模型在安全性(拒绝不良请求)方面表现出色,但在推理任务上表现不佳,因为这类任务中,正确答案与错误答案之间的区别往往只是一个微小的逻辑步骤。

解决方案:NormBT(公正的老师)

作者提出了一种名为 NormBT 的新方法。

你可以将 NormBT 想象成一位不再关注画作看起来有多不同,而是完全专注于学生错得有多离谱的老师。

  • 修复方案: NormBT 给老师的推力增加了一个特殊的“音量旋钮”。
    • 如果两个答案看起来非常相似(距离小)但学生答错了,老师会调高音量。“嘿,尽管它们看起来很像,但你还是错了!注意听!”
    • 如果两个答案看起来差异很大(距离大),老师会稍微调低音量。“好吧,你答对了,但别太兴奋,这个区别本来就很明显。”

为什么这很重要

论文在各种 AI 模型上测试了该方法,并发现:

  1. 它是“即插即用”的修复方案: 你不需要重建 AI 或改变它的“大脑”。你只需要更换老师进行推力计算时的数学公式即可。这既便宜又快速。
  2. 它有助于处理难题: 最显著的改进出现在推理任务(如编程或数学逻辑)中。这些任务中,“好”答案与“坏”答案看起来几乎完全一样,而旧的方法在教导 AI 识别这些细微差别时失效了。
  3. 它平衡了天平: AI 不再仅仅从容易的差异中学习,现在它能从困难的区别中同样有效地学习。

总结

论文指出,目前训练 AI 法官的标准方式偏向于明显的差异,而忽略了微妙的差异。通过添加一个简单的数学“归一化器”(NormBT),他们迫使 AI 专注于它错得有多离谱,而不是选项看起来有多不同。这使得 AI 在识别精细错误方面表现得更好,尤其是在复杂的推理任务中。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →