← 最新论文
💻 computer science

The Great Pretender: A Stochasticity Problem in LLM Jailbreak

本文揭示了大语言模型越狱中攻击成功率(ASR)的不稳定性源于评估和生成过程中的随机性,导致指标被系统性高估,并提出了 CAS-eval 和 CAS-gen 框架以准确衡量这种方差并恢复性能损失。

原作者: Jean-Philippe Monteuuis, Cong Chen, Jonathan Petit

发布于 2026-05-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Jean-Philippe Monteuuis, Cong Chen, Jonathan Petit

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你是一家极其严格的俱乐部(即人工智能模型)的保安。你的工作是阻止任何人携带危险物品(有害提示)进入。现在,想象一群聪明的骗子(研究人员)正试图寻找潜入的方法。

长期以来,安全行业一直使用单一分数来衡量这些骗子的能力:攻击成功率(ASR)。如果骗子在十次尝试中哪怕只有一次成功绕过保安,旧系统就会说:“太棒了!他们 100% 成功了!”

论文《伟大的伪装者》(The Great Pretender)认为,这种衡量方式是一个巨大的谎言。这就像因为魔术师有一次从帽子里变出了兔子,就宣称他是幻术大师,尽管他在接下来的九次尝试中都失败了。该论文声称,当前的成功率被“夸大”了,因为它们忽略了随机性(stochasticity)。

以下是该论文发现的简要说明,使用了简单的类比:

1. “运气”的两个来源

该论文指出,当前的成功分数不可靠,因为一直以来都被忽视的两种随机性:

  • 生成运气(掷骰子): 当骗子尝试制造越狱攻击时,他们通常会生成同一骗术的许多不同版本。这就像掷骰子 10 次,看看是否能掷出"6"。如果你第一次就掷出了"6",你就停下来并说:“我赢了!”但下次你掷骰子时,可能再也掷不出"6"了。旧论文通常只报告那一次幸运掷骰的结果。
  • 评估运气(不可靠的裁判): 在骗子尝试他们的骗术后,一个“裁判”(另一个 AI)会判断是否成功。但这个裁判也有点喝醉了或累了;有时它对完全相同的骗术说“安全”,有时又说“不安全”,仅仅是因为随机的情绪波动。如果裁判在测试时恰好处于“宽容”的情绪中,骗子看起来就像天才。如果裁判很严格,骗子看起来就像失败者。

2. “伟大的伪装者”问题

作者发现,许多著名的越狱方法(如"Best-of-N"或"Crescendo")都在伪装得比实际更强大。

  • 场景: 一篇论文声称某种方法对顶级 AI 的成功率为 80%
  • 现实: 当作者进行正确测试时,同样的方法在要求持续成功的情况下,实际上只有**50%**的成功率。
  • 类比: 这就像一名篮球运动员,如果只计算他们在风完全顺向吹拂时投出的球,他们 10 次能投进 8 次。但如果你要求他们在正常条件下连续投 10 次,他们可能只能投进 5 次。旧论文将那些“顺风日”的投篮计为掌握技术的证明。

3. 解决方案:“一致性”测试

为了解决这个问题,作者提出了一种新的成功衡量方法,称为CAS(攻击成功的一致性)

他们不再问:“这个骗术有一次奏效了吗?”,而是问:“这个骗术在我们尝试的每一次都奏效了吗?”

他们引入了两个新工具:

  • CAS-gen(严格的生成器): 在骗术被加入“名人堂”之前,它必须证明其具有一致性。它必须连续 5 次或 10 次成功绕过保安。如果哪怕失败一次,它就会被淘汰。这过滤掉了那些“幸运”的骗术。
  • CAS-eval(严格的裁判): 在测试骗术时,裁判不只查看一次。裁判对同一个骗术查看 10 次。如果裁判 9 次说“不安全”,但 1 次说“安全”(由于随机性),该骗术会被计为成功。它必须每次都通过裁判的审查。

4. 令人震惊的结果

当作者应用这些严格规则时,数字急剧下降:

  • 下降幅度: 一些看起来成功率高达 80%的攻击,在测试一致性时降至50%或更低。仅仅通过去除“运气”,就出现了30 个百分点的下降。
  • 温度效应: 他们发现,如果调高裁判的“温度”(随机性),成功率会显得人为地高。这就像如果保安被指示通过抛硬币来决定谁可以进入,你会纯粹靠运气获得很多“成功”。
  • 修复: 通过使用他们新的“一致性”框架,他们实际上能够改进攻击。通过迫使攻击者在创建阶段保持一致性,他们发现了真正稳健的骗术,恢复了那丢失的 30% 性能。

核心结论

该论文得出结论,当前对 AI 越狱攻击的排名方式是错误的。这就像根据一次幸运的猜测而不是学生的实际理解来给学生打分。

作者呼吁建立新标准:不要只告诉我们你幸运了多少次;要告诉我们你一致成功了多少次。 在我们做到这一点之前,我们在研究论文中读到的“攻击成功率”仅仅是“伟大的伪装者”——表面上看起来强大,但在真正的考验中却失败了。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →