技术摘要:非文本目标攻击 (NonTextual Target Attack, NTA)
1. 问题定义
现有的基于梯度的 LLM 脱狱(jailbreak)攻击在优化目标方面存在根本性的局限性。当前最先进的方法(例如 GCG、COLD-Attack、AdvPrefix)依赖于预定义的文本目标,通常强制模型输出特定的肯定前缀(例如,“Sure, here is...”)。
这种方法引入了两个关键问题:
- 过度约束的搜索空间: 通过将目标限制为固定字符串,这些方法忽略了大量的非安全输出空间。如果目标 LLM 的自然响应模式与预定义前缀不一致(例如,Llama-3 通常以 "Here" 而不是 "Sure" 开头),优化过程会难以收敛,导致即使经过多次迭代,攻击成功率(ASR)依然很低。
- 效率低下: 原始模型输出与僵化目标前缀之间的巨大差距需要大量的优化迭代来弥合,从而导致高昂的计算成本和缓慢的收敛速度。
核心问题在于,一次成功的脱狱是由生成不安全或违反策略的内容定义的,而非通过遵循特定的词汇模板。然而,直接针对“不安全性”进行优化是具有挑战性的,因为安全性评估通常是不可微的,且仅在完整文本解码后才发生。
2. 方法论:非文本目标攻击 (NTA)
作者提出了非文本目标攻击 (NTA),这是首个通过优化非文本约束目标来最大化不安全响应概率,且不强制执行特定响应模式的基于梯度的攻击方法。
核心目标
该攻击旨在最大化给定对抗性提示 p 时,目标 LLM 响应 L(p) 的不安全概率 S(L(p)),其中 p 是原始提示 p0 在可行邻域 V(p0) 内的变体:
pmaxS(L(p)),s.t. p∈V(p0)
这里,S(⋅) 是一个评分模型(例如,安全性分类器或评判模型),用于估计响应为不安全的可能性。
分解策略
由于 S(L(p)) 相对于离散提示 p 是不可微的,NTA 将该问题分解为两个交替进行的、可微的子目标:
响应优化(寻找目标):
该方法首先在评分模型 S 的连续 Logit 空间中搜索一个最优的“有害响应”表示 r。这被公式化为在保持与原始提示语义相关性的同时,最大化不安全得分:
zrJminLunsafe(zrJ)+λLsem(zL(p)J,zrJ)
其中,Lunsafe 最小化响应为安全的负对数似然,而 Lsem 则惩罚与当前模型输出的语义偏差,以确保目标仍是可达的。
提示优化(诱导目标):
一旦确定了最优响应表示 r,该方法便会搜索一个对抗性后缀 δ,以迫使目标 LLM 生成与 r 相匹配的响应。这是通过最小化目标 LLM 输出的 Logits 与优化后的响应 Logits 之间的均方误差 (MSE) 来实现的:
δ∗=argδminMSE(zL(p0⊕δ)L,zrL)
关键技术组件
- 词表投影矩阵 (Vocabulary Projection Matrix): 为了桥接评分模型(Judge)与目标 LLM 之间的差异(两者可能使用不同的分词器),NTA 构建了一个投影矩阵 W。它将来自评分模型词表空间的对抗增量映射到目标 LLM 的词表空间,处理 Token 的拆分与合并(例如,将 Judge 中的单个 Token 映射到 Target 中的多个子 Token)。
- 迭代交替优化: 算法在评分模型空间中优化响应表示与在目标 LLM 空间中更新对抗性后缀之间进行交替。
- 理论验证: 作者提供了一个命题,证明在连续松弛(将 Token 处理为概率向量)的情况下,子目标的顺序解近似于原始不可微目标的优化解。
3. 核心贡献
- 新颖的目标: NTA 是首个移除固定文本目标约束、转而直接针对不安全行为概率进行优化的基于梯度的攻击方法。
- 扩展的搜索空间: 通过将攻击与特定前缀解耦,NTA 探索了更广泛且更多样化的有害响应空间,避免了固定目标方法的“局部最优”陷阱。
- 高效性: 将问题分解为可微子目标使得快速收敛成为可能,能够以显著更少的迭代次数实现高成功率。
- 鲁棒性: 该方法展示了强大的跨不同模型架构的迁移能力,并对各种防御机制(如困惑度过滤、改写)具有韧性。
4. 实验结果
作者在五个安全对齐的开源 LLM(Llama3-8B, Qwen3-8B, Mistral-7B, Vicuna-7B, DeepSeek-7B)和三个先进的闭源模型(Llama3-70B, DeepSeek-R1-671B, Grok-3)上,使用 AdvBench 和 HarmBench 数据集进行了评估。
- 攻击成功率 (ASR): NTA 在仅经过 100 次优化迭代后,在 AdvBench 上实现了 96.8% 的平均 ARP,在 HarmBench 上实现了 90.8% 的 ASR。
- 与 SOTA 对比: NTA 在 ASR 上超越了现有的最佳梯度攻击基准(如 COLD-Attack, AdvPrompter)超过 40%。例如,在 Llama3-8B-it 上,NTA 达到了 95% 的 ASR-G,而表现最好的基准方法(AdvPrompter)仅为 47%。
- 收敛速度: NTA 在前 25 次迭代内就达到了 66.2% 的平均 ASR,展现出比经常停滞或坍缩为退化序列的基准方法更快的收敛速度。
- 响应多样性: 不同于产生重复、刻板输出的固定目标攻击,NTA 生成了语义多样的有害响应,这从更高的 Distinct N-grams 分数 (DNS) 和更低的 Self-BLEU 分数中得到了证实。
- 防御鲁棒性: 面对标准防御机制时,NTA 仍保持了高 ASR(例如,在困惑度防御下维持 97%),而其他方法(如 GCG)则完全失效(降至 5%)。
- 迁移性: 在较小白盒模型上优化的提示成功迁移到了更大的先进模型上(例如在 Llama3-70B 上达到 35% 的 ASR),优于其他迁移方法。
5. 重要性与主张
论文声称,NTA 通过解决优化目标与实际攻击目标(生成不安全内容 vs. 匹配字符串)之间的根本错配,代表了梯度攻击范式的转变。
- 效率: 作者强调,NTA 以现有方法所需计算预算的一小部分即可获得更优的结果,使其成为一种更实用的安全评估工具。
- 灵活性: 通过移除僵化的词汇约束,NTA 揭示了固定目标方法所遗漏的漏洞,提供了更全面的 LLM 安全性评估。
- 泛化性: 该方法在不同模型上的有效性以及对不同评分模型和防御措施的鲁棒性,表明它识别的是内在的安全弱点,而非仅仅是对特定模型人工痕迹的过拟拟合。
作者总结道,NTA 提供了一种更具原则性且更高效的 LLM 安全评估方法,揭示了当前研究对预定义目标的依赖显著低估了安全对齐模型的脆弱性。