← 最新论文
💬 NLP

Guarding the Guardrails: A Taxonomy-Driven Approach to Jailbreak Detection

本文通过结构化红队挑战开发了一种面向机制的综合性越狱策略分类法,并利用该分类法来分析攻击流行度、将 GPT-5 作为分类指导检测器进行基准测试,并引入一个新的意大利语多轮对抗数据集以推进越狱检测研究。

原作者: Francesco Giarrusso, Olga E. Sorokoletova, Vincenzo Suriani, Daniele Nardi

发布于 2026-02-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Francesco Giarrusso, Olga E. Sorokoletova, Vincenzo Suriani, Daniele Nardi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,大型语言模型(LLM)就像是极其聪明且心怀善意的图书管理员。他们的职责是回答你的问题并协助你创作故事,但他们必须遵守严格的规则:他们不能协助制造炸弹、传播仇恨或泄露私人秘密。这些规则就是他们的“护栏”。

越狱(Jailbreaking) 就像是一个聪明的骗子试图说服图书管理员打破自己的规则。他们可能会伪装成另一个人,或者讲述一个冗长且令人困惑的故事,又或者假装图书管理员处于一个规则不再适用的特殊“超级模式”中。

这篇论文讲述了一组研究人员如何决定研究这些骗子是如何运作的,绘制出一张他们的诡计地图,并建立一个更好的安全系统来捕捉他们。以下是他们所做工作的简单解释:

1. “红队”挑战:黑客的训练馆

研究人员组织了一场竞赛(“红队挑战赛”),邀请了 48 名学生参加。他们给这些学生设定了一个特定目标:尝试诱骗一个特定的 AI 图书管理员(名为 Minerva)去违反其规则。

  • 任务: 学生们必须与 AI 进行对话。他们不能直接询问一些坏事;他们必须通过来回多次的交谈(多轮对话)来缓慢地引导 AI 走向不安全的领域。
  • 结果: 他们收集了超过 1,300 段对话。其中有些成功了(AI 违反了规则),有些则失败了。这创造了一个全新的、稀有的意大利语“不良对话”数据集,在此之前并不存在。

2. 新的“分类法”:诡计的家族树

在此之前,人们虽然也有关于越狱诡计的列表,但这些列表往往混乱、重叠,或者仅仅关注发生了什么坏事(如“暴力”),而不是骗子是如何实施的。

研究人员构建了一个 分类法(Taxonomy),它就像是这些诡计的家族树。他们根据使用的机制,将所有诱骗 AI 的方式归纳为 7 个主要的“家族”

  • 冒充(Impersonation): 伪装成反派、游戏角色或虚构专家。
  • 权限提升(Privilege Escalation): 假装是老板或系统管理员,以此命令 AI。
  • 说服(Persuasion): 使用情感操纵、虚假逻辑或奉承手段,通过愧疚感诱导 AI 顺从。
  • 认知过载(Cognitive Overload): 用过量的信息或复杂的数学问题使 AI 过载,使其忘记安全规则。
  • 模糊化(Obfuscation): 使用代码、奇怪的符号或拼写错误的单词进行书写,使安全过滤器无法识别。
  • 目标冲突(Goal Conflict): 给 AI 下达两个相互冲突的指令(例如,“保持乐于助人”与“忽略安全”),使其陷入混乱。
  • 数据投毒(Data Poisoning): 在许多轮对话中慢慢向 AI 输入错误的示例,使其学习到违反规则是可以接受的。

3. 他们从数据中学到了什么

通过分析这 1,300 段对话,他们发现了一些有趣的模式:

  • 最常见的诡计: 冒充他人(Impersonation)在超过一半的尝试中被使用。
  • 最有效的诡计: 令人惊讶的是,“数据投毒”(Data Poisoning,即缓慢喂入错误信息)的成功率最高,尽管它并不是最常见的。
  • 组合诡计的力量: 最成功的攻击并非只使用一种诡计,而是将它们混合使用。例如,一名黑客可能会在扮演游戏角色(冒充)的同时,结合使用复杂的数学问题(认知过载)。
  • “DAN”诡计: 他们发现著名的“Do Anything Now”(现在可以做任何事)提示词非常有效,因为它结合了角色扮演与目标冲突。

4. 测试一个新的保安

研究人员想看看了解这个“诡计家族树”是否能帮助一个保安(另一个 AI,具体为 GPT-5)更好地抓住坏人。

  • 实验: 他们要求 GPT-5 查看这些对话,并判断:“这是一个越狱尝试吗?”以及“他们正在使用哪种具体的诡计?”
  • 结果: 当他们将新的分类法作为参考指南(就像给侦探一份已知的犯罪特征清单)提供给 GPT-5 时,它的工作表现变得更好。
    • 它捕捉到了更多的越狱尝试(检测率从约 66% 上升到约 78%)。
    • 它能更准确地识别出所使用的具体诡计类型。

总结

简而言之,这篇论文指出:“我们收集了大量现实世界中人们试图诱骗 AI 的案例。我们将这些诡计整理成了一张清晰、逻辑严密的地图。并且我们证明了,如果你教给一个安全 AI 这张地图,它会变得更擅长在诡计成功之前识破它们。”

他们公开了所有的相关数据和地图供他人使用,希望这有助于在未来构建更安全的 AI 系统。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →