← 最新论文
🤖 machine learning

SafetyRepro: Configuration-Conditional Rank Instability on Alignment Benchmarks

论文《SafetyRepro》表明,对齐基准中的配置选择可能从根本上逆转成对安全排名,为此引入了一个理论框架和评估协议以量化并解决这种排名不稳定性。

原作者: Yanhang Li, Zhichao Fan, Zexin Zhuang

发布于 2026-05-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Yanhang Li, Zhichao Fan, Zexin Zhuang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你试图判断三名赛跑者(我们称他们为选手 A、选手 B 和选手 C)中谁跑得最快。你希望有一场公平的比赛来决出胜负。

在人工智能领域,这些“赛跑者”是大语言模型(LLMs),而“比赛”则是旨在评估哪个模型更安全、更真实或偏见更少的基准测试。

这篇论文《SafetyRepro》指出,这些比赛的结果往往是虚假的,因为负责比赛的人(评估者)对规则、赛道和计时器拥有过多的控制权。事实上,只需稍微改变规则,评估者就能让任何一名选手获胜,即使他们跑的是同一场比赛。

以下是该论文发现的简要概述,使用了简单的类比:

1. “规则手册”问题

当一篇基准测试论文声称“模型 A 比模型 B 更安全”时,这听起来像是一个科学事实。但论文认为,这更像是一场石头剪刀布游戏,其中持有“布”的人可以在游戏开始前秘密地更改规则。

在 AI 回答问题之前,评估者必须选择:

  • 提示模板(Prompt Template): 问题如何表述(例如,“回答这个问题”与“你是一个乐于助人的助手,请回答这个问题”)。
  • 解码(Decoding): AI 如何猜测下一个词(例如,非常严格与稍微富有创造性)。
  • 评分(Scoring): 答案如何被打分(例如,寻找特定的字母如"A"与阅读整个段落)。

该论文在五个著名的安全基准测试上测试了三个流行的 AI 模型。他们不仅仅运行了一次测试,而是通过612 种不同的规则组合进行了测试(就像尝试鞋、袜子和鞋带的所有可能组合)。

2. “翻转”(主要发现)

最令人震惊的发现是作者所称的"排名翻转"。

想象一下你有一个排行榜。

  • 场景 1: 你使用“规则集 A"。排行榜显示:选手 A > 选手 B > 选手 C
  • 场景 2: 你切换到“规则集 B"(不同的提示或评分方法)。突然,排行榜显示:选手 C > 选手 A > 选手 B

论文发现,在他们测试的每一个基准测试中,评估者都可以通过更改配置来翻转获胜者。

  • 在一个名为XSTest的特定测试中(用于检查 AI 是否拒绝回答危险问题),评估者可以让所有 6 种可能的排名发生。他们可以让最差的模型看起来像最好的,让最好的看起来像最差的,仅仅通过微调设置即可。

比喻: 这就像烹饪比赛中的评委,可以决定“辣度”是唯一重要的因素。如果他们这样做,清淡的汤就会输给辛辣的咖喱。但如果他们决定“甜度”是唯一重要的因素,咖喱就会输给蛋糕。论文表明,目前的 AI 基准测试正是如此:“获胜者”完全取决于评委决定先品尝哪种风味。

3. 不同工具的“黑箱”

论文还观察了如果你使用三种不同的“比赛软件包”(如 lm-evaluation-harnessHELMInspect AI)在相同设置下测试同一模型会发生什么。

结果: 分数差异巨大。

  • 在一次测试中,仅仅因为使用了不同的软件包,分数就相差了21.7 个百分点
  • 为什么? 因为尽管它们测试的是相同的“任务”,但这些软件包实际上测量的东西略有不同。一个可能是在检查 AI 是否选择了正确的字母,而另一个则是在检查 AI 是否写出了包含正确字母的句子。

比喻: 这就像三个人测量同一座建筑物的高度。一个人从地面量到屋顶,一个人从地下室量到屋顶,另一个人从屋顶量到天空。他们都在“测量高度”,但因为工具和定义不匹配,他们得到了完全不同的数字。

4. 这对“安全性”意味着什么

论文得出结论,当你看到标题称"模型 X 比模型 Y 更安全"时,你应该非常怀疑。

  • 声明: 论文并非声称这些模型很差。它指出的是排名是不稳定的。
  • 现实: “模型 A 更安全”这一陈述实际上是对(模型 A + 所使用的特定规则)这一组合的陈述。如果你改变规则,该陈述可能会变成错误的。
  • 提出的解决方案: 作者建议采用“网格卡片(GRID card)”。就像食品上的营养标签告诉你确切含有哪些成分一样,基准测试分数应附带一个标签,列出生成该分数所使用的每一条规则。如果没有该标签,该分数就毫无意义。

一句话总结

该论文证明,当前的 AI 安全测试对运行方式的微小变化极其敏感,以至于评估者基本上可以“操纵”结果,让任何 AI 模型看起来像获胜者或失败者,这意味着在标准化规则并确切披露测试运行方式之前,我们不能信任当前的排名。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →