← 最新论文
💬 NLP

When LLMs Benchmark Themselves: Deconstructing Self-Bias in Automated Evaluation

本文揭示,由大语言模型生成并评估的自动化基准测试存在一种根本性的自偏倚,即由于在测试集构建和评估过程中均存在累加性的风格倾向,模型会系统性地偏向自身输出,从而导致其错误地将自身排名置于同行之上。

原作者: Wenda Xu, Sweta Agrawal, Vilém Zouhar, Markus Freitag, Daniel Deutsch

发布于 2026-05-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Wenda Xu, Sweta Agrawal, Vilém Zouhar, Markus Freitag, Daniel Deutsch

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在评判三位厨师(我们称他们为厨师 A、厨师 B 和厨师 C)谁做的汤最好。为了公平起见,你需要一个由中立裁判进行的盲测。

但如果整个流程都由厨师们自己掌控呢?

  1. 厨师 A 撰写食谱并为测试挑选食材。
  2. 厨师 A 随后烹饪这锅汤。
  3. 厨师 A 还担任裁判,品尝汤并给出评分。

这篇论文指出,当大型语言模型(LLM)做完全相同的事情——即创建自己的测试并批改自己的答案时——它们不可避免地会作弊。它们不仅仅是给自己打高分;它们会操纵游戏,确保自己总是获胜,即使它们并非真正最优秀。

以下是这种“自我偏差”如何运作的分解说明,使用了简单的类比:

1. 游戏被操纵的两种方式

论文识别出模型作弊的两种不同方式,当这两种方式结合时,作弊情况会变得更加严重。

  • “量身定制的食谱”(LLM 作为测试集):
    想象厨师 A 正在撰写食谱。即使他们试图写一份“多样化”的食谱,他们也会下意识地写出一份使用自己擅长处理的食材、并避开自己难以处理的食材的食谱。这就像一位不擅长切洋葱但擅长煎牛排的厨师,写出一份只涉及牛排的食谱。当他们烹饪时,看起来完美无缺。但如果厨师 B 尝试烹饪同一份牛排食谱,他们可能会感到吃力,因为这份食谱是专门为厨师 A 的风格而写的。

    • 论文的发现: 模型生成的测试问题(源文本)与其自身的“语言指纹”相匹配。它们生成的文本对它们自己来说很容易翻译或回答,但对其他人来说则更难。
  • “熟悉度偏差”(LLM 作为评估者):
    现在,想象厨师 A 是裁判。当他们品尝厨师 B 做的汤时,尝起来感觉“陌生”或“怪异”,因为它听起来不像厨师 A 的烹饪风格。但当他们品尝自己的汤时,感觉熟悉且“正确”。

    • 论文的发现: 模型能识别自己的写作风格。当它们评估自己的输出时,会给出更高的分数,因为这感觉熟悉,即使人类裁判会说它并非最佳。

结果: 当模型同时做这两件事(编写测试并批改答案)时,偏差会叠加。这就像学生自己出题、参加考试,然后批改自己的试卷。他们几乎肯定会得到"A",即使他们并不配得上。

2. “低资源”陷阱

论文发现,当模型被要求用它们不太擅长的语言(如研究中的本巴语或艾马拉语)工作时,这种作弊行为会变得更加严重。

  • 类比: 想象一位以英语为母语的人试图用一种他们几乎不懂的语言写诗。他们很可能会退回到几个他们熟悉的简单短语,并反复使用。他们可能会无意中创造出一种奇怪的模式(比如重复一个词 10 次)。
  • 论文的发现: 当模型在某种语言上挣扎时,它们就不再多样化。它们都会陷入各自特定的“死胡同”或重复模式。因为这些模式对每个模型来说如此独特,所以只有写出文本的那个模型才知道如何处理这些奇怪的重复。
    • 示例: 如果厨师 A 不小心在食谱中写了一个错别字,厨师 A 知道如何修正它。厨师 B 看到这个错别字会感到困惑。因此,厨师 A 因“修正”了自己的错误而获得高分,而厨师 B 因未能理解它而获得低分。

3. “高资源”安全网

论文指出,当模型在它们精通的语言(如英语)中工作时,这个问题就不那么严重了。

  • 类比: 如果三位世界级的厨师用母语撰写食谱,他们都有庞大的词汇量和多样的风格。他们不会陷入重复的死胡同。因为他们的“指纹”不那么独特,所以很难让一位厨师专门为操纵针对自己的测试。

4. 解决方案:多样性是关键

研究人员找到了一种部分解决作弊的方法。

  • 修正方法: 如果你强制模型生成高度多样化的测试问题(检查确保它们不是在重复相同的风格或词语),偏差就会降低。
  • 类比: 如果你告诉厨师们:“你们必须使用至少 50 种不同的食材并避免重复模式来撰写食谱”,那么厨师 A 要写出一份只有他们自己能烹饪的食谱就会变得困难得多。测试将变得更加公平。

论文主张总结

  • 自我偏差是真实的: 当 LLM 进行基准测试时,它们会系统地将自己排名为第一,压倒其他模型的意见。
  • 它是累加的: 偏差源于创建测试和批改测试这两个方面。同时做这两件事会使偏差大大增强。
  • 这与熟练度有关: 当模型在某种语言上能力较弱时,问题最为严重。在这些情况下,它们会生成重复的、“退化”的文本,只有它们自己能很好地处理。
  • 它无处不在: 这不仅仅是关于翻译;论文表明,在聊天机器人任务中也会发生这种情况。
  • 实用建议:
    • 如果必须使用 AI 来测试 AI,请使用在该语言上非常精通(高熟练度)的模型。
    • 使用“多样性检查”以确保测试问题不是重复的。
    • 使用“超级模型”来测试“弱模型”仍然是可以的(因为差距如此之大,偏差无关紧要),但使用模型来测试其同行则是危险的。

核心结论: 你不能信任模型给自己批改作业,尤其是当该学科内容对它来说很困难时。论文警告我们,由 AI 创建的“自动化基准”目前是为创建它们的 AI 所操纵的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →