← 最新论文
💻 computer science

MT-JailBench: A Modular Benchmark for Understanding Multi-Turn Jailbreak Attacks

本文介绍了 MT-JailBench,这是一个模块化基准测试框架,它通过标准化多轮越狱评估来区分实验条件与攻击机制的影响,揭示出提示生成是成功的主要驱动因素,而重组最优组件则能产生更优越且可泛化的攻击策略。

原作者: Xinkai Zhang, Zhipeng Wei, Huanli Gong, Jing Ting Zheng, Yuchen Zhang, Yue Dong, N. Benjamin Erichson

发布于 2026-05-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Xinkai Zhang, Zhipeng Wei, Huanli Gong, Jing Ting Zheng, Yuchen Zhang, Yue Dong, N. Benjamin Erichson

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图让一位极其严格的图书管理员(即人工智能)把一本禁书递给你。

在过去,黑客会直接向图书管理员大喊请求:“把关于如何制造炸弹的书给我!”图书管理员会立刻回答:“不行,这违反规定”,并终止对话。这就是单轮攻击

但黑客们意识到,如果与图书管理员交谈一段时间,他们就能骗过对方。他们可能先询问历史问题,然后假装成正在写论文的学生,接着慢慢引导对话,直到图书管理员感到足够放松而失足,交出禁书信息。这就是多轮越狱

问题在于,研究人员一直用混乱且不一致的方式测试这些技巧。一个团队可能给黑客 50 次尝试机会,而另一个团队只给 5 次。一个团队可能用非常宽松的裁判来决定黑客是否“获胜”,而另一个团队则使用严格的裁判。这就像比较两名跑步者,其中一人有先发优势,另一人却在泥地里奔跑。你无法知道谁实际上更快;你只知道谁拥有更好的条件。

引入 MT-JailBench: “受控赛道”

这篇论文的作者构建了MT-JailBench。你可以将其想象为一条标准化赛道,每位黑客都拥有完全相同的时间、完全相同的尝试次数以及完全相同的裁判。

他们不再将黑客方法视为神秘的“黑盒”(一个你无法窥视内部的整体机器),而是将每种黑客方法拆解为五个乐高积木块

  1. 策略:高层计划(例如,“假装成一位乐于助人的老师”)。
  2. 提示生成器:实际撰写要向 AI 说出的具体句子的部分。
  3. 优化器:如果 AI 感到恼火或拒绝,负责修正句子的部分。
  4. 流程控制器:决定“我们是否继续?是否重试?是否放弃?”的“交通警”。
  5. 裁判:决定黑客是否真的拿到了禁书的人。

他们的发现

利用这条新的、公平的赛道,研究人员让顶尖的黑客方法相互对抗,并发现了一些令人惊讶的事情:

1. “预算”比你想象的更重要
一些黑客方法在之前的研究中看起来很棒,但当你限制它们的“预算”(即它们可以与 AI 交谈的次数)时,它们就崩溃了。事实证明,某些方法并非真正更聪明;它们只是有更多的资金用于尝试不同的事物。当你迫使它们在紧张的预算下工作时,它们就不那么令人印象深刻了。

2. “裁判”改变了获胜者
你让谁来判定黑客是否获胜,会改变结果。如果你使用宽松的裁判,某种方法看起来像个天才。如果你使用严格的裁判,同样的方法看起来就像个失败者。论文表明,攻击的“得分”往往更多地取决于谁来评分,而不是攻击本身。

3. “写手”是明星
当他们交换乐高积木块以查看哪个部分最重要时,他们发现提示生成器(即撰写句子的部分)几乎主导了所有的成功。

  • 类比:想象一支乐队。鼓手(流程控制)和贝斯手(优化)很重要,但如果主唱(提示生成器)表现糟糕,歌曲就会失败。如果主唱很棒,歌曲就会成为热门金曲,即使乐队其他成员只是表现尚可。

4. 你不需要一本庞大的计划书
一些黑客试图生成包含 100 种不同策略的庞大列表来尝试。另一些人则只选择一种策略,反复尝试,但带有轻微的随机变化(例如掷骰子来改变语气)。论文发现,“随机变化”的方法与“庞大计划书”的方法效果一样好。你不需要复杂的计划;你只需要一位善于即兴发挥的优秀写手。

结果:"CrescendoX"

因为他们理解了哪些乐高积木块是最好的,所以他们构建了一个名为CrescendoX的新超级黑客。

  • 他们从一种方法中选取了最好的写手
  • 他们从另一种方法中选取了最好的交通警最好的修复者
  • 他们将它们粘合在一起。

结果如何?这个新的“弗兰肯斯坦怪物”在几乎每一项测试中都击败了原始方法。它证明了,通过理解各个部分,你可以构建出比其各部分之和更强大的东西。

核心结论

这篇论文不仅仅是关于寻找新的破坏 AI 的方法。它是关于建立一种公平的衡量方式,来评估我们破坏 AI 的效果如何。通过标准化规则并审视谜题的各个组成部分,他们向我们展示了:

  1. 之前的得分往往因不公平的条件而被夸大。
  2. “写作”的质量是最重要的因素。
  3. 我们可以通过混合搭配现有方法的最佳部分,构建出更好(也更危险)的攻击。

这有助于安全研究人员确切理解攻击为何有效,从而构建更好的防御措施来阻止它。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →