← 最新论文
💬 NLP

Evaluating Scoring Bias in LLM-as-a-Judge

本文通过定义和量化三种新型评分偏差——评分标准顺序偏差、分数标识偏差及参考答案分数偏差,并提出通过改进提示词设计与自动化评估来缓解这些偏差的综合框架,从而解决了大语言模型作为裁判系统中评分偏差这一研究不足的问题。

原作者: Qingquan Li, Shaoyu Dou, Kailai Shao, Chao Chen, Haixiang Hu

发布于 2026-05-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Qingquan Li, Shaoyu Dou, Kailai Shao, Chao Chen, Haixiang Hu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你雇佣了一位非常聪明的自动化机器人教师来批改作文。这位机器人本应公平、客观且一致。你给它一篇学生作文和一份评分标准(即一篇好作文的检查清单),它就会给这篇作文打出一个从 1 到 5 的分数。

本文旨在揭示:即使是最聪明的机器人教师,实际上也极易被误导。它们不仅仅是在看作文本身;即使指令表达的意思完全相同,它们也会因指令的书写方式不同而感到困惑。

以下是用简单类比对该研究发现的拆解:

核心问题:“魔法 8 号球”效应

研究人员发现,如果你稍微改变评分指令的格式——而不改变其实际含义——机器人对同一篇作文的评分可能会发生剧烈变化。这就像问朋友:“这部电影怎么样?”如果你礼貌地询问,得到的回答是"5 分满分”;但如果你倒立着问,得到的回答却是"2 分满分”。电影本身没有变,但答案却变了。

本文聚焦于评分偏差,即机器人仅仅因为提示词被微调(而非答案本身发生变化),就给出了不同的绝对分数(例如 3 分或 4 分)。

机器人感到困惑的三种方式

研究人员确定了三种会扰乱机器人评分的具体“把戏”:

  1. 菜单顺序偏差(评分标准顺序):
    想象一下餐厅菜单。通常,开胃菜列在前面,然后是主菜。如果你把菜单反过来,让主菜列在前面,食物的味道会变吗?不会。但机器人教师却认为会变。

    • 研究发现: 如果评分规则按"1 到 5"(从低到高)列出,机器人的评分结果与按"5 到 1"(从高到低)或随机顺序列出的结果不同。机器人会被序列顺序搞糊涂。
  2. 姓名标签偏差(分数标识):
    通常,我们使用数字如 1、2、3、4、5。但如果我们使用字母(A、B、C、D、E)或罗马数字(I、II、III、IV、V)呢?

    • 研究发现: 机器人的大脑对这些不同的分数“名称”反应不同。有时使用罗马数字会让机器人成为更好的评分者;有时则会让它变得更差。这就好比机器人有一个偏爱的字母表。
  3. “完美范例”偏差(参考答案分数):
    有时,老师会给学生展示一篇“完美范例”作文,以说明什么是"5 分”。研究人员测试了如果给该范例附加一个分数会发生什么。

    • 研究发现: 如果你向机器人展示一个完美范例并将其标记为“分数 5",机器人会变得非常一致且准确。然而,如果你将同一个完美范例标记为“分数 3",机器人就会感到困惑,并开始给其他所有作文打更低的分数,心想:“哦,如果完美范例只有 3 分,那么这篇学生作文肯定糟糕透顶。”

实验:测试机器人

研究人员在多种不同的“机器人教师”(AI 模型)上测试了这一点,范围从最强大的模型(如 GPT-4o)到较小、较便宜的模型。

  • 大机器人 vs. 小机器人: 最强大的机器人不太容易被混淆。它们就像资深教师,对内容了如指掌,菜单顺序的颠倒不会让它们失态。而较小的机器人则像紧张的学生教师;指令中微小的变化会让它们的分数剧烈波动。
  • 意外发现: 有时,这些“把戏”反而起了作用!对于某些机器人,使用罗马数字或颠倒规则顺序,使其评分比标准方式更准确。事实证明,人类通常编写提示词的“标准”方式,并不总是最适合机器人的方式。

解决方案:如何修正评分

基于实验,作者提出了三种使这些机器人法官更可靠的方法:

  1. 雇佣大机器人: 如果你需要关键的评分(例如用于求职或升学),请使用可用的最强大的 AI 模型。它们天生更稳定,不太容易受格式把戏的影响。
  2. 打破规则(有意为之): 不要只是照搬标准的"1 到 5"列表。尝试按"5 到 1"的顺序列出规则,或者使用字母代替数字。该论文建议,做一些稍微“非传统”但清晰的事情,实际上可以防止机器人落入其惯常的偏差陷阱。
  3. 展示完美范例(并标记为 5): 如果你要展示一个“黄金标准”答案以帮助机器人评分,请确保将其标记为"5"(最高分)。这能锚定机器人的思维,使其更加准确。

结论

该论文得出结论:"LLM-as-a-Judge"(使用 AI 来评估 AI)并不像我们想象的那么客观。机器人对规则的呈现方式很敏感,而不仅仅是对规则本身敏感。为了获得公平的评分,我们需要非常谨慎地编写指令,或许要使用最强大的模型,并以与我们习惯略有不同的方式设计提示词。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →