← 最新论文
💬 NLP

Rating Roulette: Self-Inconsistency in LLM-As-A-Judge Frameworks

本文揭示了基于大语言模型的评判者在不同运行中表现出显著的内部评分者不一致性,削弱了其评分的可靠性,并探讨了是否可以通过特定准则使此类评估仍能被有效利用。

原作者: Rajarshi Haldar, Julia Hockenmaier

发布于 2026-04-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Rajarshi Haldar, Julia Hockenmaier

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用通俗语言和创意类比对论文《Rating Roulette:LLM-as-a-Judge 框架中的自我不一致性》的解释。

核心理念:“过山车”式评委

想象你聘请了一位著名的美食评论家来评价一家新餐厅。你请他们在同一张桌子前、面前放着同一张餐巾的情况下,连续三次品尝同一道菜。

  • 第一次品尝: 他们给出五星评价,称其为“杰作”。
  • 第二次品尝: 他们给出两星评价,称其“平淡无味且煮过头了”。
  • 第三次品尝: 他们给出四星评价,称其“尚可但需要更多盐”。

如果发生这种情况,你绝不会信任这位评论家。你会意识到他们的判断就像轮盘赌——即使食物(输入)从未改变,轮盘每次旋转后停下的数字却各不相同。

这正是研究人员在要求大语言模型(LLM)充当其他 AI 生成文本的评委时所发现的情况。他们发现,这些 AI 评委正遭受着"评分轮盘赌"的困扰。

问题所在:AI 评委无法与自己达成一致

在 AI 领域,我们常利用一个 AI 来给另一个 AI 的工作打分。这被称为"LLM-as-a-Judge"(LLM 作为评委)。它之所以流行,是因为比雇佣人类更快、更便宜。

然而,研究人员进行了一项简单的测试:

  1. 他们选取了一段文本(如新闻摘要或聊天对话)。
  2. 他们要求同一个 AI 评委使用完全相同的指令对该文本进行三次评分。
  3. 他们检查 AI 每次是否给出了相同的分数。

结果: AI 评委的表现千差万别。

  • 在名为 SummaC 的任务中(检查摘要是否符合事实),表现最好的 AI 评委仅有约 79% 的时间能与自己达成一致。
  • 在名为 MT-Bench 的任务中(对聊天机器人对话进行排名),一致性甚至更低。在某项任务中,一个 AI 评委仅在 61% 的案例中连续三次给出了完全相同的答案。

这就像评委的情绪每次你提问时都会改变,尽管问题和答案都未曾变动。

适得其反的“魔法”

你可能会想:“好吧,让我们告诉 AI 别再随机行事了。让我们关掉它大脑中‘掷骰子’的部分,让它总是给出相同的答案。”

研究人员尝试了这种方法。他们将 AI 设置为 100% 确定性(无随机性)。

  • 它变得一致了吗? 是的。
  • 它变成了更好的评委吗? 没有。

事实上,当他们强迫 AI 停止掷骰子时,与人类评委相比,它的评分实际上变得更了。这就像强迫厨师每次都使用完全相同的食谱;他们可能不再犯错,但也失去了创造力或适应性,最终食物的味道反而变差了。

该论文指出存在一种权衡:为了获得与人类观点相符的良好评分,AI 需要一点点“随机性”(变异性)。但这种同样的随机性又导致 AI 无法与自己保持一致。

人类对比:人类做得更好吗?

研究人员还考察了人类评委,以查看这是否仅为 AI 独有的问题。

  • 人类专家: 当专家对同一段文本进行评分时,他们彼此之间的一致性尚可,但并非完美。
  • 众包工人: 当普通人(众包工人)对文本进行评分时,他们经常彼此之间以及与专家之间意见不一。
  • 令人惊讶的是: 在某些情况下,AI 评委与自己的一致性甚至高于人类彼此之间的一致性。然而,由于 AI 的分数波动如此之大,很难判断 AI 究竟是“正确”还是仅仅“运气好”。

这为何重要?(“坏尺子”类比)

想象你试图测量一棵树的高度。

  • 旧方法: 你使用一把略微弯曲的尺子。它不完美,但很稳定。
  • 新方法(LLM 评委): 你使用一把橡胶尺子。有时它会拉伸,有时它会收缩。即使你对同一棵树测量三次,也会得到三个不同的数字。

如果你使用橡胶尺,你就无法信任测量结果。该论文认为,目前使用 LLM 作为评委就像使用一把橡胶尺

  • 如果你运行一次测试,你会得到一个分数。
  • 如果你再次运行,你会得到不同的分数。
  • 如果你第三次运行,你会得到第三个分数。

因为分数每次都在变化,我们不知道 AI 是否真的擅长评判质量,还是仅仅在猜测。

他们在不同任务中发现了什么?

研究人员测试了 AI 必须参与的三种不同类型的“游戏”:

  1. 真或假(SummaC): 摘要在事实上是否正确?(二选一)。
    • 结果: AI 评委表现不一致,但更新、更大的模型稍好一些。
  2. 1 到 5 星评价(SummEval): 根据“连贯性”、“流畅性”等对摘要进行评分。
    • 结果: AI 表现非常不一致,尤其是在“流畅性”(文本听起来是否顺畅)方面。有趣的是,AI 在判断流畅性方面有时比人类彼此达成一致的能力还要强。
  3. 大逃杀(MT-Bench): 两个聊天机器人中哪一个给出了更好的答案?
    • 结果: 这是最困难的任务。AI 评委在这里表现得极其不稳定,经常改变主意,不确定哪个聊天机器人更好。

结论:如何修复轮盘赌

该论文为想要使用 AI 评委的人提供了一些实用建议:

  1. 不要信任单次运行: 如果你让 AI 对某事物进行评分,不要只取第一个答案。让它评分三次,然后取平均值多数票。这可以平滑“轮盘赌”效应,得出更接近人类观点的分数。
  2. 不要关闭随机性: 尽管随机性会导致不一致,但完全关闭它会使 AI 在匹配人类观点方面变得更差。你需要一点点混乱才能获得正确的答案。
  3. 检查你自己的一致性: 在信任 AI 评委之前,你应该检查它是否能与自己达成一致。如果它无法与自己达成一致,它可能也无法与你达成一致。

总结

该论文揭示,AI 评委目前不可靠,因为每次被问及同一个问题时,它们都会给出不同的答案。它们更像是一个轮盘赌,而不是一架稳定的秤。虽然更新的 AI 模型在一致性上稍好一些,但它们仍难以做到可靠。目前最好的解决方案是让 AI 多次参与游戏并取平均结果,而不是信任轮盘的一次“旋转”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →