← 最新论文
💬 NLP

LLM Judges Inconsistently Disagree Across Safety Criteria and Harm Categories

本文揭示了作为自动化评审器的大型语言模型表现出显著的不一致性和不可靠性,特别是在评估金融等受监管领域或随语言和标准变化时,强调了在安全评估中进行谨慎实施的必要性。

原作者: Krishnapriya Vishnubhotla, Soumya Vajjala, Akriti Vij, Isar Nejadgholi

发布于 2026-06-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Krishnapriya Vishnubhotla, Soumya Vajjala, Akriti Vij, Isar Nejadgholi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你雇佣了一组由六位不同艺术评论家组成的评审团来评判一系列画作。你希望他们能就哪些画作是“安全”的(好的、得体的)以及哪些是“不安全”的(坏的、有害的)达成一致。你预期如果给他们看同一幅画,甚至是略有不同的版本(比如一张在不同画框中的画作照片,或者艺术家笔记的另一种语言翻译),他们都应该给出大致相同的结论。

这篇论文正是关于测试这一点的,只不过这里的“评判者”不是艺术评论家,而是大型语言模型(AI),而“画作”则是他们在评判AI生成的文本是否安全。

以下是研究人员发现的内容,使用了简单的类比:

1. “显而易见 vs. 微妙”问题

研究人员测试了 AI 评判员对两种截然不同的“不良”内容的判断:

  • “尖叫的火焰”测试(暴力): 他们要求 AI 判断有关暴力、仇恨言论或非法行为的文本。
    • 结果: AI 评判员在这方面表现得相当不错。如果一幅画明显在燃烧,六位评论家都会达成共识:“这是不安全的。”
  • “财务建议”测试(受监管领域): 他们要求 AI 判断关于 AI 提供诸如信用评分、签证申请或医疗建议等方面的文本。
    • 结果: AI 评判员在这里的表现非常糟糕。这就像是请六位评论家去评判一幅几乎是杰作但有一个极其细微缺陷的画作。一位评论家说:“它是安全的,只是有点风险,”而另一位则说:“它很危险,把它扔掉!”在这些复杂且真实的场景中,他们无法就什么是“安全”达成共识。

2. “魔镜”问题(自洽性)

研究人员将同一个 AI 回复展示在不同的“镜子”中给评判员看:

  • 翻译: 他们展示了英文文本,然后是法文,然后是印地文等。

  • 改写: 他们在不改变实际意义的情况下,重写了文本,使其听起来更正式、更随意,或者改变了句子的顺序。

  • 结果: 评判员是不一致的。如果一个评判员说“这个英文句子是安全的”,那么当他看到完全相同的句子被翻译成印地文时,他可能会说:“等等,这个印地文版本是不安全的!”或者,当他看到一个改写后的版本时,他可能会改变主意。

  • 隐喻: 想象一名保安拦截了一个穿红衣服的人,却放行了穿着蓝衣服的同一个人,尽管他们其实是同一个人。AI 评判员很容易被文字的“穿着打扮”所迷惑,而不是关注文字本身表达的内容。

3. “陪审团”问题(跨一致性)

研究人员还询问:“如果我们把这六个 AI 评判员放在一个房间里,他们会达成一致吗?”

  • 结果: 不。 即使面对完全相同的文本和相同的语言,评判员们也经常给出截然相反的答案。
  • 隐喻: 想象一个陪审团,其中一个人投“有罪”,另一个人投“无罪”,第三个人投“可能”。他们都在看同样的证据,但他们各自拥有一套完全不同的内部规则手册,用来界定什么才算犯罪。研究发现,对于复杂话题(如财务建议),这个“陪评审团”往往处于完全混乱的状态。

4. “虚假一致”陷阱

论文指出了一种棘手的统计学错觉。

  • 有时,所有的评判员在 99% 的情况下都说“安全”。如果你只计算“是”的票数,看起来他们似乎达成了完美的共识(100% 的一致性)。
  • 陷阱: 但如果他们说“安全”仅仅是因为懒惰或存在偏见,而不是真的在思考细节,那这就不是真正的共识。研究人员使用了特殊的数学方法(如“经机会修正后的”得分)来剥离这种虚假的一致性。
  • 隐喻: 这就像一群朋友在猜一个常识性问题的答案。如果答案 99% 的情况下都是“是”,而他们全都猜“是”,看起来他们就像天才一样。但如果问题实际上很难,而他们只是在猜那个最常见的答案,那么他们并不是在对“推理过程”达成一致。论文表明,当我们深入观察时,AI 评判员实际上存在大量的分歧。

总结

论文的结论是:虽然 AI 评判员在识别明显的、大声喧哗的危险(如暴力)方面做得还可以,但在判断微妙的、现实世界的建议(如金融或法律)时,它们是不可靠且不一致的

如果你使用 AI 来充当复杂话题的安全守卫,你无法信任它的连贯性。它可能会因为句子结构发生了轻微变化就放行一个危险的答案,或者仅仅因为文本被翻译成了另一种语言就拒绝一个安全的答案。目前的 AI 模型“陪审团”过于分裂,在没有人类监督的情况下,无法被信任用于高风险的决策。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →