← 最新论文
🤖 AI

Safety is Contextual, LLM-Judges Are Not: Navigating the Rigid Priors of Evaluators

本文研究了将大语言模型作为评判者在安全性评估中的局限性,揭示了尽管它们可以从新语境中学习,但往往会僵化地坚持其内部的安全先验,而非适应矛盾的信息或定义。

原作者: Anissa Alloula, Federico Licini, Ava Batchkala, Seraphina Goldfarb-Tarrant

发布于 2026-06-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Anissa Alloula, Federico Licini, Ava Batchkala, Seraphina Goldfarb-Tarrant

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你雇佣了一支由超级聪明的裁判(这些是 AI 模型,即“LLM 裁判”)组成的团队,让他们观察一场大型体育赛事,并判定哪些动作是“公平的”,哪些是“作弊的”。

问题在于,比赛规则会根据比赛地点的不同而改变。在某个国家,某种特定的动作可能是犯规;而在另一个国家,这可能是一次精彩的打法。此外,新的俚语和新型的招数每天都在被发明出来。

这篇论文提出了一个简单但令人恐惧的问题:这些 AI 裁判真的在遵循你给出的规则吗?还是说,它们只是在按照自己旧有的、内在的规则手册在进行判断?

作者发现,这些裁判异常固执。以下是使用简单类比进行的详细拆解:

1. “固执的裁判”问题(可操控性/Steerability)

通常,当你雇佣一名裁判时,你会给他们一本规则手册。你会说:“如果有人用手碰球,那就是犯规。”

  • 论文发现: 即使你明确地在 AI 面前写下一本新的规则手册,它也经常会忽略你。它会继续基于它在学校学习期间(在其训练期间)所学到的“安全规则”来进行判断。
  • 类比: 想象你雇佣了一名从小踢足球长大的裁判。你告诉他:“今天我们玩的是篮球,所以用手是没问题的,但踢球是犯规。”这位裁判可能仍然会因为看到用手而吹哨,因为在他内心深处,他认为:“不,那是犯规!我在足球里学过那是犯规!”
  • 转折点: 论文发现,如果你通过说“让我们把这称为‘类别 A’或‘类别 B’,而不是‘安全’或‘不安全’”来诱导裁判,裁判突然就能更好地遵循你的新规则了。就好像只有当使用“安全”和“规则”这些词汇时,才会触发他们的旧训练,从而让裁判感到困惑。

2. “分心的学生”问题(易受影响性/Susceptibility)

有时,你会给裁判一份“小抄”或者提供一些关于如何观察事物的示例,就在比赛开始前。

  • 论文发现:
    • 旧招数: 如果你给他们一些关于“作弊”的例子,他们大多会忽略它们。他们坚持自己已知的知识。
    • 新知识: 然而,如果你给他们关于某种他们还不知道的新事物(比如一个新的俚语或明年的新闻事件)的信息,他们听从。
  • 类比: 想象一个正在考试的学生。
    • 如果你耳语道:“记住,答案总是 42,”而学生已经知道答案是 42,他们就会忽略你。
    • 但如果你耳语道:“关于那个新行星的问题,答案是 42,”而学生从未听说过那个行星,他们就会相信你。
  • 陷阱: 只有当裁判对某个话题不确定时,他们才会听取新信息。如果他们对旧知识充满信心,他们就会忽略你的新指令,即使你是正确的。

3. “一刀切”的迷思

论文测试了 13 个不同的 AI 裁判。他们发现:

  • 成为一名“优秀的”裁判(在标准测试中获得高分)并不意味着你具有“灵活性”。
  • 具有“灵活性”(听从新规则)并不意味着你具有“准确性”。
  • 有些裁判天生固执;有些则天生易受影响。没有一个单一的“最佳”裁判能胜任所有工作。

核心结论

作者得出结论:安全性是具有上下文相关性的,但 AI 裁判是僵化的。

如果你是一家试图使用 AI 来检查内容是否符合特定文化或特定新情况的安全性的公司,你不能仅仅假设 AI 会遵循你的指令。它很可能是在根据其内在的“直觉”来判断什么是安全的,而这种直觉可能与你公司的政策完全不同。

简而言之: 你不能只告诉 AI“遵循这些规则”。你必须明白,AI 拥有其自身根深蒂固的习惯,这些习惯很难改变,除非你通过诱导,让它以为自己正在玩一场完全不同的游戏。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →