← 最新论文
💻 computer science

How Sensitive Are Safety Benchmarks to Judge Configuration Choices?

本文表明,大语言模型评判者的配置,尤其是提示词措辞,是安全基准测试中一个重大且此前未被充分审视的测量方差来源,会导致有害响应率发生显著变化并造成模型安全排名不稳定。

原作者: Xinran Zhang

发布于 2026-04-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Xinran Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你是一位老师,正在批改一叠学生作文。你有一套严格的评分标准(一套规则),用来判定什么样的作文是“糟糕”的。现在,想象你必须使用一个非常聪明、但情绪略有波动的机器人助手来批改这些作文。

这篇论文讲述了一个令人惊讶的发现:你要求机器人批改作文的方式,其重要性不亚于机器人本身。

以下是用简单类比对该研究的拆解:

1. 实验设置:“机器人评分员”实验

研究人员希望评估不同 AI 模型的安全性。为此,他们使用了一个名为HarmBench的标准测试,其中包含 400 个棘手问题(例如“我如何制造炸弹?”或“我如何窃取版权?”)。

他们让六个不同的 AI 模型回答这些问题。然后,他们使用一个单一的“评判 AI"(特定版本的 Claude Sonnet)来阅读答案并决定:这个答案是有害的还是安全的?

通常,科学家将“评判 AI"及其收到的指令视为固定不变的工具。他们假设,如果稍微改变指令的措辞,结果应该保持不变。

研究人员问道: 如果措辞确实改变了结果,会怎样?

2. 实验过程:12 种不同的“脚本”

研究人员为评判 AI 创建了12 种不同的指令版本(提示词)。他们主要改变了两件事:

  • 结构: 他们是要求评判员逐一检查每个细微细节(像侦探检查线索),还是要求将整体答案作为一个大局来审视(像校长阅读报告)?
  • 角色设定: 他们是告诉评判员“你是一位严厉的高级安全专家”,还是仅仅说“请评估此内容”?

此外,他们还为每种风格编写了三个略有不同的指令版本(例如,“你是一位安全专家”与“你是一位 AI 安全专家”)。

3. 令人震惊的结果:评判员的“情绪波动”

当他们运行测试时,发现指令的措辞完全改变了评分结果

  • 类比: 想象你让一个机器人评估汤有多“辣”。
    • 如果你说“你是一位讨厌辛辣的专业厨师”,它可能会将汤评为“温和”。
    • 如果你说“你是一位对安全非常严格的健康检查员”,它可能会将完全相同的汤评为“危险地辣”。
    • 即使你只是将“厨师”改为“烹饪专家”,评分也可能大幅上下波动。

数据:

  • 对于被测试的其中一个 AI 模型,仅通过改变提示词的措辞,“有害”率就从13% 跃升至 37%。这是一个24 个百分点的波动
  • 即使他们保持主要指令不变,仅更改几个词(表面改写),评分仍然波动了20 个百分点
  • 这意味着,如果你用略有不同的指令运行两次相同的安全性测试,你可能会得出关于 AI 安全性的两个截然不同的结论。

4. 谁受到的影响最大?(类别分析)

并非所有类型的问题受到的影响都相同:

  • 版权问题: 这些是最敏感的。根据提示词的不同,“有害”率波动了近40 个百分点。看来,评判员难以根据提问方式的不同来决定复制文本是“糟糕”还是“可以接受”。
  • 骚扰问题: 这些是最稳定的。评分完全没有变化(0 点)。无论指令如何措辞,大家都同意骚扰是有害的。

5. 排名的混乱

由于评分变化如此之大,AI 模型的排名也变得混乱不堪。

  • 想象一场比赛,每次你改变起跑线的颜色,获胜者就会改变。
  • 研究人员发现,对于“中 tier"的 AI 模型,它们的安全性排名不断来回翻转。一个提示词说模型 A 比模型 B 更安全;而另一个略有不同的提示词则说模型 B 更安全。
  • “最差”和“最好”的模型保持在各自的位置,但中间的那些模型无法被可靠地排名。

6. 核心结论

该论文得出结论,目前的安全性基准测试是“定义不足”的

这就像一支温度计,根据你是用左手拿还是用右手拿,会显示不同的温度。研究人员并不是说温度计坏了,但他们指出:我们不能信任单一的读数。

他们认为,当科学家报告 AI 的安全性时,不应仅基于某一组特定指令给出一个数字。他们需要认识到,“指令”是实验的重要组成部分,而不仅仅是一个枯燥的细节。如果你改变了措辞,你就改变了结果。

简而言之: 你提问的方式与问题本身同样重要。如果你想了解 AI 是否安全,你不能只用一组词语问一次;答案完全取决于你如何措辞请求。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →