← 最新论文
💬 NLP

Am I More Pointwise or Pairwise? Revealing Position Bias in Rubric-Based LLM-as-a-Judge

本文揭示了基于评分量表的 LLM-as-a-judge 评估本质上存在类似于多项选择任务的模型特定位置偏差,即评分选项和标准的排序会显著影响判断,但同时也表明,通过对这些顺序应用随机排列可以有效缓解这种偏差并提高与人类标注的一致性。

原作者: Yuzheng Xu, Tosho Hirasawa, Tadashi Kozuno, Yoshitaka Ushiku

发布于 2026-06-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Yuzheng Xu, Tosho Hirasawa, Tadashi Kozuno, Yoshitaka Ushiku

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一个机器人法官(大型语言模型,或称 LLM),它的工作是给学生的作文评分。你给这个机器人一个评分标准——一份包含评分选项的列表,比如“1:糟糕”、“2:较差”、“3:一般”、“4:良好”和“5:优秀”。

名为《我是点对点还是对对点?》(Am I More Pointwise or Pairwise?)的论文提出了一个简单但令人惊讶的问题:机器人是否在意这些选项在页面上的排列位置?

以下是他们研究结果的解读,使用了日常生活的类比。

1. “菜单”问题

通常,我们认为这些评分标准只是一个简单的清单。但研究人员发现,对于这些 AI 法官来说,评分标准更像是一个多项选择题

当机器人阅读列表时,它不仅仅是在看分数的含义;它还会观察它们所处的位置。就像人类可能会下意识地选择菜单上的第一个选项(因为它是第一个被看到的),或者最后一个选项(因为它最令人印象深刻)一样,这些 AI 法官也存在“位置偏差”。

  • 研究发现: 有些机器人偏爱第一个选项(“首位偏向型”法官)。另一些机器人则偏爱最后一个选项(“末位偏向型”法官)。
  • 令人惊讶之处: 并非所有模型都一样。一个模型可能仅仅因为“良好”排在顶部就总是选它,而另一个模型可能仅仅因为“优秀”在底部就总是选它。这是特定机器人的个性化特征,而不是评分标准本身的问题。

2. “排队”偏差

研究人员还观察了一个场景:如果机器人需要同时对多个方面进行评分(例如:连贯性、共情力和惊喜感)。

想象一下嫌疑人站成一排。如果你要求警察识别罪犯,他们可能会更加关注站在队伍最前面的那个人。同样,研究发现标准的顺序会产生影响。

  • 如果“连贯性”排在第一位,机器人给出的分数可能会与“连连贯性”排在第三位时略有不同。
  • 即使机器人完全有能力理解文本,这种情况依然会发生。顺序的变化会改变最终得分。

3. “洗牌”解决方案

那么,如何解决一个容易被书写位置所干扰的机器人呢?

研究人员尝试了一种称为**平衡置换(Balanced Permutation)**的方法。这就像洗一副扑克牌。

  • 他们不是让机器人仅用一种顺序(1, 2, 3, 4, 5)对作文进行一次评分,而是让它对同一篇作文进行十次评分。
  • 每次,他们都会打乱分数的顺序(例如:3, 1, 5, 2, 4;然后是 5, 2, 1, 4, 3,等等)。
  • 通过计算平均值,这种“位置偏差”就会被抵消掉,从而留下真实的得分。

关键点: 论文发现,你不需要进行完美的洗牌。你不需要做所有的数学运算来创建一个完美的平衡列表。

  • 类比: 这就像试图测量一个公平的平均温度。你不需要在一天中的每一秒钟都进行测量。如果你只是在一天中随机进行几次测量,你就能得到一个相当不错的平均值。
  • 结果: 仅仅随机打乱几次列表(大约 3 到 5 次)的效果,就几乎等同于进行复杂的完美洗牌。这是消除机器人被顺序干扰的一种廉价且简便的方法。

4. 为什么这很重要(“赢家”会改变)

你可能会想:“好吧,分数确实会有微小的变化,但这真的重要吗?”

论文指出,是的,这非常重要,尤其是在挑选赢家的时候。

  • 想象一场有 4 名参赛者的比赛。如果机器人的偏差改变了分数,排名第一的选手可能会发生易位
  • 研究人员发现,仅仅改变评分标准的顺序,就会导致在 16% 到 39% 的案例中“赢家”发生改变。
  • 隐喻: 这就像一场比赛,终点线的位置会根据你在哪个赛道而略有移动。如果这场比赛是为了决定谁能获得奖学金,那么移动终点线(改变评分标准顺序)可能会在无意中把奖项给错人。

总结

  • 问题: AI 法官会受到它们所看到的选项顺序的影响,就像人类一样。
  • 特性: 一些 AI 模型偏爱第一个选项,而另一些则偏爱最后一个。
  • 解决方法: 你可以通过让 AI 在不同的顺序下多次对同一内容进行评分来解决这个问题。
  • 捷径: 你不需要完美的洗牌;只需进行几次随机洗牌就足以获得公平的结果。
  • 影响: 如果你不解决这个问题,即使 AI 非常聪明,你也可能会在无意中选错“最佳”答案。

论文的结论是,我们需要将这些基于评分标准的 AI 法官视为正在参加多项选择题,其中答案的位置至关重要,因此我们需要通过“洗牌”来获取真相。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →