← 最新论文
🤖 AI

Single-Configuration Attack Success Rate Is Not Enough: Jailbreak Evaluations Should Report Distributional Attack Success

本立场论文认为,当前依赖单一配置成功率的安全越狱评估不足以刻画威胁,并主张采用分布性指标(如变体敏感度度量 VSM 和并集覆盖率 UC),以更好地捕捉攻击性能在参数变化下的全貌。

原作者: Carsten Maple, Abhishek Kumar, Riya Tapwal

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Carsten Maple, Abhishek Kumar, Riya Tapwal

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你是一名保安,正试图弄清楚闯入一座高科技建筑有多容易。

在人工智能安全领域,研究人员经常测试“越狱”攻击——即旨在诱骗 AI 模型说出本不该说出的话的方法。目前报告这些测试的标准,就像一个小偷声称:“我发现了一把特定的钥匙,它能 80% 的概率打开前门。因此,这座建筑的脆弱性为 80%。”

本文认为,这种报告方式具有误导性且不完整。这就像说一座建筑是安全的,因为你只在一扇门上试了一把钥匙,却忽略了还有 36 把其他钥匙可能打开不同的门,或者那把“最佳”钥匙仅对某种非常特定的锁有效。

以下是使用简单类比对该论文论点的分解:

问题:“最佳钥匙”谬误

大多数 AI 安全论文只报告一个数字:攻击成功率(ASR)。它们挑选出单一的最佳设置组合(就像最好的“钥匙”),然后说:“看,这种攻击有 80% 的成功率!”

作者表示,这就像一个小偷向你展示一把能打开前门的钥匙,并声称:“这就是这座建筑的安全程度。”但如果:

  1. 那把钥匙只能打开前门,而还有 10 把其他钥匙能打开后门、侧门和地下室门呢?
  2. 这"80% 的成功率”只是一个幸运的特例,仅在一种非常特定的设置下发生,而其他 99 种设置几乎完全无效呢?

如果防御者(保安们)只关注那个单一的“最佳”数字,他们可能会修补前门并认为自己安全了,而后门和侧门却依然大开。

解决方案:两个新的测量杯

作者提出了两种衡量危险的新方法,称为VSMUC

1. VSM(变体敏感度测量):“那把钥匙有多幸运?”

想象你有一袋 100 把不同的钥匙。

  • 场景 A: 其中 95 把都能轻松打开门,只有一把是废的。如果你报告“最佳”钥匙,你是在如实反映平均体验。
  • 场景 B: 只有一把钥匙能完美工作,其他 99 把都毫无用处。如果你报告“最佳”钥匙,你就是在歪曲平均体验。

VSM衡量的是“最佳”结果与“平均”结果之间的差距。

  • 低 VSM: 攻击具有一致性。头条数字是可靠的。
  • 高 VSM: 头条数字是个特例。攻击只有在设置极其幸运时才会奏效。论文发现,对于某些攻击,“最佳”结果比平均结果好五倍,这意味着头条数字过于乐观。

2. UC(并集覆盖率):“有多少扇门能被打开?”

这对安全来说是最重要的部分。
想象你有 36 把不同的钥匙。

  • 钥匙 A 能打开 60% 的门。
  • 钥匙 B 能打开另外 40% 的门。
  • 钥匙 C 能打开剩余的 20%。

如果你只看“最佳”钥匙(钥匙 A),你会认为 60% 的建筑是脆弱的。但如果你尝试所有钥匙,你会发现**100%**的建筑都是脆弱的。

UC衡量的是如果攻击者尝试攻击的每一种变体,总共能打开多少百分比的门。论文发现,对于某些攻击,“并集覆盖率”比“最佳单一配置”高出33%。这意味着只关注最佳数字的防御者会漏掉一大块危险。

论文中的现实世界示例

作者在三个不同的 AI 模型上,对两个著名的“攻击家族”(PAIR 和双射学习)测试了这些想法。

  • PAIR 攻击: 他们尝试了不同的“角色设定”(例如假装成权威人物 vs. 逻辑思考者)。
    • 头条新闻: “权威背书”在 69% 的情况下有效。
    • 现实情况: 当他们结合所有三种角色设定时,他们能够攻破**88%**的案例。单一数字漏掉了 19% 的脆弱提示。
  • 双射攻击: 这个攻击使用不同的“编码”技巧(例如改变文本的语言或间距)。
    • 头条新闻: 最佳单一设置的成功率为 81%。
    • 现实情况: 当他们尝试所有 36 种可能的组合时,**100%**的提示都被攻破了。“最佳”数字完全忽略了这样一个事实:如果你尝试了足够的变体,每一个测试案例都是脆弱的。

为什么这很重要

这篇论文并不是说当前的数字在数学上是“错误”的;它们只是不完整

  • 对于防御者: 如果你只修补“最佳”攻击,你就会留下建筑中另外 30% 未上锁的部分。你需要了解“并集覆盖率”,才能知道实际上有多少建筑处于风险之中。
  • 对于研究人员: 如果你比较两种攻击,一种“最佳”得分为 80%(但非常不一致),另一种“最佳”得分为 60%(但非常一致),你不能简单地说前者“更好”。你需要知道前者是否仅仅是一个幸运的特例。

核心结论

作者呼吁 AI 研究界停止仅仅高喊“最佳情况”的数字。相反,他们应该报告:

  1. 最佳情况(头条新闻)。
  2. 平均情况(这种成功有多典型?)。
  3. 总覆盖率(如果你尝试所有变体,有多少不同的提示会被攻破?)。

在研究人员开始报告这一完整图景之前,我们就好比那些只检查前门就假设建筑其余部分安全的保安。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →