← 最新论文
💬 NLP

Exploring the Effects of Alignment on Numerical Bias in Large Language Models

本研究确定对齐是导致 LLM-as-a-judge 系统中数值偏差的主要原因,并证明调整评分范围是减轻这种偏差并提高评估性能最有效的启发式策略。

原作者: Ayako Sato, Hwichan Kim, Zhousi Chen, Masato Mita, Mamoru Komachi

发布于 2026-01-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Ayako Sato, Hwichan Kim, Zhousi Chen, Masato Mita, Mamoru Komachi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你雇佣了一支专家评审团队(大语言模型,简称 LLM)来给文章评分、翻译故事或纠正语法错误。你要求他们给出 0 到 100 分之间的分数。这就是“LLM 作为评审”(LLM-as-a-judge)的方法。

然而,这篇论文的研究人员发现了一个奇怪的故障:这些数字评审员有一种坏习惯,那就是过于一致。他们不会给出多样化的分数(比如 42、67、89、12),而是不断重复同一个数字,就像一张卡在“80”上的坏掉的唱片。

研究人员将这种现象称为**“数值偏差”(Numerical Bias)**。这就像一位餐厅评论家,无论你端上什么菜,他总是在评价卡上写下“8/10”。即使食物很糟糕或非常美味,他也无法打破这种模式。

罪魁祸首:“对齐”(Alignment)

研究人员想知道:为什么会发生这种情况?

他们怀疑问题是由一个叫做**“对齐”**的过程引起的。

  • 对齐前: 把 LLM 想象成一个狂野、富有创造力的艺术家。它可能会给你 3 分,然后是 95 分,接着是 42 分。它是不可预测且多样化的,但有时它并不太能遵循你的指令。
  • 对齐后: 为了让 AI 变得更有用且更有礼貌,人类会对它进行“训练”以更好地遵循指令。这就像把艺术家送进了严格的艺术学校。现在,AI 完美地遵守规则,但它变得有点机械化。它失去了那种“狂野”的多样性,开始将答案聚集在一个安全的特定数字周围。

发现: 研究通过对比“狂野”(对齐前)的模型与“受训”(对齐后)的模型,发现受训后的模型更容易卡在特定的数字上(比如 10 分制中的 8 或 9),无论输入的内容是好是坏。这种“卡住”的行为实际上降低了它们的评分准确性。

好消息与坏消息

  • 坏消息: 这种“卡住”的行为(偏差)使 AI 变成了一个更差的评审员。如果它无法区分优秀的翻译和糟糕的翻译,因为无论如何都给它们打“8”分,那么这个系统就失效了。
  • 好消息: 即便存在这个缺陷,受训后的(对齐后的)模型在遵循指令方面仍然比“狂野”的模型更好。它们仍然是这项工作的最佳选择,但它们需要一点帮助来修正它们的评分习惯。

如何修复这张“坏掉的唱片”

研究人员测试了三种方法来阻止 AI 卡在某个数字上:

  1. 调高“温度”(随机性):
    想象 AI 是一个掷飞镖的选手。“温度”就是他们手的抖动程度。如果他们太稳了(低温度),每次都会击中完全相同的位置。如果你让他们的手稍微抖动一下(高温度),他们可能会击中不同的位置。

    • 结果: 这有一点帮助,但如果你让手抖得太厉害,分数就会变成随机的垃圾。这并不是一个完美的解决方法。
  2. 校准(重新校准刻度):
    这就像告诉 AI:“嘿,你给太多 8 分了。让我们通过数学方式调整你的大脑,让你多给一些 5 分和 9 分。”

    • 结果: 这减少了偏差,但并不总是能提高评分的准确性。有时这反而会让 AI 感到困惑。
  3. 改变评分范围(神奇的解决方法):
    这是最有效的解决方案。想象你要求 AI 在 1 到 5 分 的范围内评分。它可能会卡在“4”上。但如果你告诉它,“按 1 到 100 分 的范围评分”,它突然就有更多的呼吸空间了。它不再觉得被迫去选那个“安全”的中位数,而是开始使用整个范围。

    • 结果: 通过简单地改变指令,允许使用更宽的分数范围(例如 1–100 而不是 1–5),AI 就不再卡住了。它给出了更多样化的分数,准确性也显著提高了。

总结

论文得出结论:当我们使用 AI 来评判事物时,我们不能仅仅假设默认设置是完美的。

  • 对齐(训练 AI 变得更有用)无意中让它在评分时变得过于可预测和重复。
  • 解决方案: 不要只接受默认设置。如果你要求 AI 对某项内容进行评分,尝试告诉它使用更宽的分数范围。这就像告诉一个紧张的学生,“你可以得到从 A 到 F 的任何成绩”,而不是“你只能得到 B”。这个简单的改变有助于 AI 展示其真实的判断力,而不是仅仅重复一个安全的数字。

简而言之:AI 评审员很棒,但因为我们把它们训练得太好了,它们会“卡”在特定的数字上。给它们一个更大的游乐场(更宽的分数范围)有助于它们打破这种习惯,做得更好。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →