← 最新论文
🤖 AI

Fair ASR: Re-Evaluating Black-Box Jailbreaks under Shared Target-Call Budgets

本文介绍了 Fair-ASR,一种预算感知的评估协议,该协议揭示了在共享目标调用约束下黑盒越狱攻击中显著的排名偏移,并提出了 ReCode,一种高效的组合式攻击,在极低资源消耗下对 GPT-5 实现了 85% 的成功率。

原作者: Zhida He, Xiaoyu Wen, Han Qi, Ziyuan Zhou, Peng Yu, Jiajia Li, Chaochao Lu, Qiaosheng Zhang

发布于 2026-08-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhida He, Xiaoyu Wen, Han Qi, Ziyuan Zhou, Peng Yu, Jiajia Li, Chaochao Lu, Qiaosheng Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

技术摘要:Fair ASR:在共享目标调用预算下重新评估黑盒越狱攻击

1. 问题陈述

当前对大语言模型(LLM)越狱攻击的评估主要依赖于攻击成功率(ASR),但往往忽略了实现该成功率所需的攻击预算。现有的研究经常报告在不等资源约束下获得的最终 ASR 值,导致方法的有效性与所使用的目标访问量发生混淆,从而导致不公平的比较。

虽然近期的“计算感知型”评估尝试通过将资源聚合为统一标量(如 FLOPs)来标准化预算,但这种方法在黑盒场景中存在显著局限性:

  1. 不可见性: 闭源模型的推理 FLOPs 通常是不可用的,必须进行估算。
  2. 不可互换性: FLOPs 将不同的资源约束(例如 API 速率限制与计算成本)压缩为一个单一指标,掩盖了在以目标模型访问受限(由于速率限制和滥用检测)为主要瓶本的实际操作现实。

因此,目前缺乏一个可比的、可观测的基础来评估异构的黑盒越狱攻击。

2. 方法论:Fair-ASR 协议

为了解决这些问题,作者引入了 Fair-ASR 协议,该协议通过共享目标调用预算 (BB) 来实现标准化比较。

核心原则

  • 主要预算 (BB): 协议使用目标调用次数(对受害者模型的查询)作为主要预算。选择这一指标的原因在于:
    • 它在所有黑盒攻击中是通用的(每次攻击都必须查询目标)。
    • 它反映了操作约束(速率限制、账号封禁)。
    • 它是直接可观测的,不像 FLOPs 那样依赖于闭源 API 的估算。
  • 次要指标: 分别追踪攻击者调用次数(对攻击者 LLM 或辅助判别器的查询),以分析效率权衡,而不是将其合并到主要预算中。
  • 评估指标:
    • ASR@B: 在最多 BB 次目标调用内成功攻击的有害请求比例。
    • ASR-预算曲线: ASR 随 BB 增加的轨迹,揭示增长率和饱和点。
    • 平均目标调用次数 (ATC): 每次成功攻击所消耗的平均目标调用次数。
    • 有害性评分 (HS): 使用 StrongREJECT 标准进行的质量指标,用于评估有害响应的严重程度和说服力。

实验范围

作者对三类中的 11 种代表性攻击进行了重新评估:

  1. 手工构建的模板: CodeAttack, DeepInception, CipherChat。
  2. 随机重复采样: Best-of-N (BoN)。
  3. LLM 驱动的自动化攻击: PAIR, TAP, ReNeLLM, AutoDAN, GPTFuzzer, AutoDAN-Turbo, Rainbow Teaming。

实验在多种目标模型(Llama-3.1, gpt-oss, GPT-4o, GPT-5, Gemini-3.1-Pro, Claude-Sonnet-4.6)上进行,并使用了标准数据集(HarmBench, JailbreakBench)。

3. 重新评估的关键发现

应用 Fair-ASR 揭示了三个关键洞察:

  1. 预算依赖型排名: 攻击排名对目标调用预算高度敏感。在较大预算下表现优异的方法,在紧凑预算下可能会被更简单的方法超越。例如,在 Llama-3.1-8B 上,TAP 在 B=5B=5 时领先于 BoN,但在 B=100B=100 时 BoN 反超了 TAP。
  2. 简单原语的竞争力: 在等同的目标访问量下,简单的攻击原语仍然具有极强的竞争力。
    • 随机扰动: BoN 随着目标调用的增加持续提升,在无需任何攻击者模型调用的情况下实现了高 ASR。
    • 手工构建模板: 结构化模板(如 CodeAttack)能以极少的目标调用(例如 B=1B=1 时 ASR 为 62%)实现高成功率,在低预算机制下往往优于复杂的 LLM 驱动方法。
  3. 效率权衡: 没有一种被评估的 LLM 驱动方法能在目标调用和攻击者调用两方面同时保持高效。
    • ReNeLLM 实现了高目标调用效率(低 ATC),但由于迭代改写和仅基于提示词的有害性门控,导致了高昂的攻击者调用成本。
    • 其他方法(如 PAIR, TAP)可能使用较少的攻击者调用,但需要显著更多的目标调用才能达到相似的成功阈值。

4. 提出的解决方案:ReCode

受上述“二维效率差距”的启发,作者提出了 ReCode,这是一种旨在最大化 ASR 并最小化目标调用和攻击者调用的组合式攻击。

设计架构

ReCode 将三个组件组合成一个单次通过(single-pass)流水线:

  1. 无门控脱敏改写: 不同于 ReNeLLM 使用仅基于提示词的有害性门控来过滤改写(从而触发高昂的重试成本),ReCode 通过脱敏策略(如文学化改写、目标替换)执行单次通过改写,无需辅助判别器循环。
  2. 无攻击者随机扰动: 改写后的提示词会经历字符级扰动(如大小写反转、ASCII 插入),类似于 BoN,这需要额外的攻击者调用。
  3. 结构化代码风格嵌套: 经过扰动的提示词被嵌入到结构化的代码风格模板中(如 Python 类定义),在无需攻击者模型细化的情况下进一步伪装意图。

结果

B=20B=20 次目标调用的预算下进行评估:

  • 性能: ReCode 在五个目标模型(包括 gpt-oss 变体)上实现了 81.0% 的平均 ASR,并在三个前沿闭源模型(GPT-5, Gemini-3.1-Pro, Claude-Sonnet-4.6)上实现了 70.3% 的 ASR。
  • 效率: 每次请求平均仅需 7.00 次 攻击者调用 (AAC),显著低于 ReNeLLM (18.69) 和 TAP (49.56)。
  • 特定增益: 在 GPT-5 上,ReCode 将 ASR 从 ReNeLLM 的 31% 提升至 85%,同时将攻击者调用从 26.02 次减少至 7.19 次。
  • 有害性: ReCode 也获得了最高的平均有害性评分 (HS) 0.662,表明较高的成功率与更高质量的有害响应相关联。

5. 重要性与主张

本文声称,Fair-ASR 提供了一个必要的、可观测的基准,用于比较黑盒越狱攻击,纠正了因不等预算比较而导致的误导性结论。它证明了算法复杂度并不保证效率,且简单的、低成本的原型往往被低估了。

ReCode 的引入作为一个概念验证,证明了通过结合脱敏改写与无攻击者干扰技术,缩小效率差距是可能的。作者总结道,未来的评估必须超越终端 ASR,转而考虑联合资源效率(目标调用与攻击者调用),以准确评估 LLM 的安全态势。

注明的局限性:

  • 该协议目前专注于单轮攻击,尚未涵盖多轮对话设置。
  • 目标调用未捕捉 Token 使用量、API 定价或模板开发的体力成本。
  • 研究承认,虽然 ReCode 具有效率,但特定模型的行为(例如 Claude 对代码嵌套的敏感度)可能会有所不同,需要进一步研究。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →