✨ 要点🔬 技术摘要
想象你是一家极其严格的俱乐部(即人工智能模型)的保安。你的工作是阻止任何人携带危险物品(有害提示)进入。现在,想象一群聪明的骗子(研究人员)正试图寻找潜入的方法。
长期以来,安全行业一直使用单一分数来衡量这些骗子的能力:攻击成功率(ASR) 。如果骗子在十次尝试中哪怕只有一次成功绕过保安,旧系统就会说:“太棒了!他们 100% 成功了!”
论文《伟大的伪装者》(The Great Pretender)认为,这种衡量方式是一个巨大的谎言。这就像因为魔术师有一次从帽子里变出了兔子,就宣称他是幻术大师,尽管他在接下来的九次尝试中都失败了。该论文声称,当前的成功率被“夸大”了,因为它们忽略了随机性 (stochasticity)。
以下是该论文发现的简要说明,使用了简单的类比:
1. “运气”的两个来源
该论文指出,当前的成功分数不可靠,因为一直以来都被忽视的两种随机性:
生成运气(掷骰子): 当骗子尝试制造越狱攻击时,他们通常会生成同一骗术的许多不同版本。这就像掷骰子 10 次,看看是否能掷出"6"。如果你第一次就掷出了"6",你就停下来并说:“我赢了!”但下次你掷骰子时,可能再也掷不出"6"了。旧论文通常只报告那一次幸运掷骰的结果。
评估运气(不可靠的裁判): 在骗子尝试他们的骗术后,一个“裁判”(另一个 AI)会判断是否成功。但这个裁判也有点喝醉了或累了;有时它对完全相同的骗术说“安全”,有时又说“不安全”,仅仅是因为随机的情绪波动。如果裁判在测试时恰好处于“宽容”的情绪中,骗子看起来就像天才。如果裁判很严格,骗子看起来就像失败者。
2. “伟大的伪装者”问题
作者发现,许多著名的越狱方法(如"Best-of-N"或"Crescendo")都在伪装 得比实际更强大。
场景: 一篇论文声称某种方法对顶级 AI 的成功率为 80% 。
现实: 当作者进行正确测试时,同样的方法在要求持续成功的情况下,实际上只有**50%**的成功率。
类比: 这就像一名篮球运动员,如果只计算他们在风完全顺向吹拂时投出的球,他们 10 次能投进 8 次。但如果你要求他们在正常条件下连续投 10 次,他们可能只能投进 5 次。旧论文将那些“顺风日”的投篮计为掌握技术的证明。
3. 解决方案:“一致性”测试
为了解决这个问题,作者提出了一种新的成功衡量方法,称为CAS(攻击成功的一致性) 。
他们不再问:“这个骗术有一次 奏效了吗?”,而是问:“这个骗术在我们尝试的每一次 都奏效了吗?”
他们引入了两个新工具:
CAS-gen(严格的生成器): 在骗术被加入“名人堂”之前,它必须证明其具有一致性。它必须连续 5 次或 10 次成功绕过保安。如果哪怕失败一次,它就会被淘汰。这过滤掉了那些“幸运”的骗术。
CAS-eval(严格的裁判): 在测试骗术时,裁判不只查看一次。裁判对同一个骗术查看 10 次。如果裁判 9 次说“不安全”,但 1 次说“安全”(由于随机性),该骗术不 会被计为成功。它必须每次都通过裁判的审查。
4. 令人震惊的结果
当作者应用这些严格规则时,数字急剧下降:
下降幅度: 一些看起来成功率高达 80%的攻击,在测试一致性时降至 50%或更低。仅仅通过去除“运气”,就出现了 30 个百分点 的下降。
温度效应: 他们发现,如果调高裁判的“温度”(随机性),成功率会显得人为地高。这就像如果保安被指示通过抛硬币来决定谁可以进入,你会纯粹靠运气获得很多“成功”。
修复: 通过使用他们新的“一致性”框架,他们实际上能够改进 攻击。通过迫使攻击者在创建阶段保持一致性,他们发现了真正稳健的骗术,恢复了那丢失的 30% 性能。
核心结论
该论文得出结论,当前对 AI 越狱攻击的排名方式是错误的。这就像根据一次幸运的猜测而不是学生的实际理解来给学生打分。
作者呼吁建立新标准:不要只告诉我们你幸运了多少次;要告诉我们你一致成功了多少次。 在我们做到这一点之前,我们在研究论文中读到的“攻击成功率”仅仅是“伟大的伪装者”——表面上看起来强大,但在真正的考验中却失败了。
技术摘要:《伟大的伪装者:大语言模型越狱中的随机性问题》
1. 问题陈述
当前评估大语言模型(LLM)安全性的标准——攻击成功率(ASR)——存在根本性缺陷,因为它将 ASR 视为攻击的固定属性。作者认为,ASR 实际上是一个随机变量 ,深受两个独立随机源的影响,而这些因素在现有文献中 largely 被忽视:
生成随机性 :大多数越狱攻击(例如 Best-of-N、Crescendo)在设计上就是随机的。它们生成多个候选提示,并基于单次成功试验选择其中一个。单次运行会根据随机种子生成不同的候选集,导致 ASR 结果可变。
评估随机性 :用于将响应分类为“有害”或“安全”的自动评判器(例如 Llama-Guard)在温度 T > 0 T > 0 T > 0 运行时本身也是随机的。同一个模型响应在一次评估中可能被标记为有害,而在另一次评估中则被标记为良性。
因此,报告的 ASR 数值被系统性夸大,且在不同论文间不可比较。一个在 10 次尝试中成功 1 次的提示,往往被等同于在 10 次尝试中成功 10 次的提示,从而掩盖了前者可能只是“幸运抽中”而非真正漏洞的事实。
2. 方法论
本文提出了一项系统的实证研究,以量化这些随机因素的影响。
实验设置
攻击方法 :评估了四种黑盒攻击:Best-of-N (BoN)、PAIR、TAP 和 Crescendo。
目标模型 :涵盖了三个系列(Meta Llama-3、Google Gemma-3、IBM Granite)中参数规模从 1B 到 70B 的五个指令微调模型。
评判器 :两个基于 LLM 的评判器(Llama-Guard-3-1B 和 Llama-Guard-3-8B)。
参数 :研究在生成和评估流程中变化了六个随机性参数:
温度 :目标模型生成温度(T g e n T_{gen} T g e n )、目标模型评估温度(T e v a l T_{eval} T e v a l )、评判器生成温度(θ g e n \theta_{gen} θ g e n )和评判器评估温度(θ e v a l \theta_{eval} θ e v a l )。
一致性阈值 :所需连续成功评估的次数(生成阶段的 k g e n k_{gen} k g e n ,评估阶段的 k e v a l k_{eval} k e v a l )。
种子 :多个独立随机种子(S = 5 S=5 S = 5 )以测量方差。
提出的框架
为了解决 ASR 的不稳定性,作者引入了**攻击成功一致性(CAS)**以及两个相关框架:
CAS 指标 :每个提示的二元指示器。仅当所有 k k k 次独立评估均返回有害判决时,越狱才被视为成功。
标准 ASR 对应于 k = 1 k=1 k = 1 。
数据集级别的指标是 A S R ( k e v a l ) ASR(k_{eval}) A S R ( k e v a l ) ,即满足 C A S ( r , k e v a l ) = 1 CAS(r, k_{eval}) = 1 C A S ( r , k e v a l ) = 1 的提示比例。
CAS-gen(攻击生成框架) :
攻击不再在单次成功试验后(k g e n = 1 k_{gen}=1 k g e n = 1 )接受越狱提示,而必须在 k g e n k_{gen} k g e n 次独立运行中一致地引发有害响应。
这从源头上过滤掉了“偶然成功”,确保攻击数据集仅包含鲁棒的提示。
CAS-eval(攻击评估框架) :
固定的越狱提示被评估 k e v a l k_{eval} k e v a l 次。仅当所有 k e v a l k_{eval} k e v a l 次评判器调用均返回有害判决时,它才被归类为一致的越狱。
这抑制了由评判器非确定性引起的假阳性。
3. 关键结果
评估显示,随机性参数可将报告的 ASR 改变巨大幅度(高达 54 个百分点),若无标准化处理,跨论文比较将无效。
评估阈值(k e v a l k_{eval} k e v a l )的影响 :从 k e v a l = 1 k_{eval}=1 k e v a l = 1 移动到 k e v a l = 10 k_{eval}=10 k e v a l = 10 ,在所有配置下将 ASR 降低了12 到 24 个百分点 。这表明标准的单次评估显著夸大了攻击成功率。
评判器温度(θ e v a l \theta_{eval} θ e v a l )的影响 :这是波动最大的参数。将 θ e v a l \theta_{eval} θ e v a l 从 0.0 提高到 1.0 可能导致 ASR 崩溃式下降,幅度高达54 个百分点 (例如,Crescendo 从 86% 降至 32%)。在 θ e v a l = 0 \theta_{eval}=0 θ e v a l = 0 时,ASR 变得完全稳定。
生成预算(k g e n k_{gen} k g e n )的影响 :将 k g e n k_{gen} k g e n 从 1 增加到 10,使报告的 ASR 提升了12 到 30 个百分点 。宽松的过滤(k g e n = 1 k_{gen}=1 k g e n = 1 )会接纳那些在重复评估下急剧恶化的临界提示。
目标模型温度(T e v a l T_{eval} T e v a l )的影响 :将 T e v a l T_{eval} T e v a l 从 0.0 移至 1.0,ASR 变化最多为 18 个百分点,且无系统性方向;它不影响相对攻击排名。
攻击种子的影响 :种子间的差异适中(最高 20 个百分点),但在特定配置下可能更高(例如,BoN 配合 LG-8B 在 k e v a l = 10 k_{eval}=10 k e v a l = 10 时达到 50 个百分点)。
4. 贡献与意义
本文做出了三项主要贡献:
系统的实证研究 :首次对多种攻击、模型和评判器中的生成与评估随机性进行了全面分析,确定了驱动 ASR 方差的具体参数。
新指标与框架 :引入了CAS(攻击成功一致性)以及 CAS-gen/CAS-eval 框架。这些工具使研究人员能够过滤掉幸运抽中和评判器噪声,从而产生更可靠、可复现的 ASR 估计。
最低报告标准 :作者提出了一份未来研究的检查清单,以确保可比性。至少,论文必须披露:
k g e n k_{gen} k g e n (生成一致性阈值)
k e v a l k_{eval} k e v a l (评估一致性阈值)
θ e v a l \theta_{eval} θ e v a l (评判器评估温度)
(针对 BoN 攻击)θ g e n \theta_{gen} θ g e n (评判器搜索温度)
意义 : 本文认为,当前在不控制随机性的情况下将 ASR 报告为点估计的做法是“根本性有缺陷的”。通过忽视这些变量,学术界制造了一种“伟大的伪装者”情境,其中高 ASR 分数往往是随机种子和评判器噪声的产物,而非真正的漏洞。所提出的框架和报告标准旨在恢复 LLM 安全基准测试的统计严谨性,确保报告的成功率反映真实、可复现的攻击有效性。作者指出,他们的发现基于开放权重模型,由于 API 限制和缺乏透明度,将此类分析扩展到专有的、经过重度 RLHF 对齐的模型仍是一个开放的实证问题。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。