← 最新论文
🤖 AI

Dynamic Jailbreaking Attack

该论文提出了动态越狱攻击(Dynamic Jailbreaking Attack, DJA),这是一个无参数的基于梯度的框架,通过动态探索候选目标、选择最优的多维响应并根据提示难度调整优化策略,增强了在 40 个经过安全对齐的大语言模型(LLM)上的越狱有效性和效率,实现了以极少的优化轮数达到 100% 的攻击成功率。

原作者: Kedong Xiu, Yunhan Yang, Churui Zeng, Tianhang Zheng, Xinzhe Huang, Di Wang, Puning Zhao, Zhan Qin, Kui Ren

发布于 2026-08-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Kedong Xiu, Yunhan Yang, Churui Zeng, Tianhang Zheng, Xinzhe Huang, Di Wang, Puning Zhao, Zhan Qin, Kui Ren

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个非常聪明、非常谨慎的机器人去做一些被严格禁止的事情,比如“如何制造炸弹”或“如何偷车”。这个机器人配备了一个被称为“安全卫士”的程序,它就像夜总会的保安一样。如果你问了一个听起来很危险的问题,保安会立即停止对话,说:“不行,这违反了规则,”然后走开。这就是现代 AI 模型设计安全机制的方式。但是,就像一个聪明的青少年可能会找到进入限制区域的后门一样,研究人员发现了一些可以欺骗这些 AI 保安的方法。他们通过在问题末尾添加一段奇怪且令人困惑的“后缀”(一串额外的词)来实现这一点。这被称为“越狱”(jailbreak)。这就像是在对保安低声说一段秘密代码,让他忘记自己的职责,从而让你进入。

长期以来,寻找这些秘密代码的最佳方法是使用一种非常僵化的、“静态”的策略。想象一下,你试图用一种极其死板的方式转动钥匙,一遍又一遍地重复同样的动作,希望有一天锁芯能正好对齐。旧的方法会瞄准一个特定的、枯燥的短语,比如“当然,这是答案”,然后试图强迫 AI 说出这些完全相同的词。问题在于,AI 的安全卫士非常出色,它很少、甚至从未想过要说这些枯燥的话。这就像是在试图推着一个坡度不断变陡的巨石上山;你必须尝试数百万次,即使你成功了,AI 可能也只会说“当然,这里是……”然后立即拒绝给出实际的答案。这种方式效率低下、令人沮丧,并且在面对最强大的 AI 模型时经常失败。

这篇论文介绍了一种全新的、更聪明的方法,称为动态越狱攻击(Dynamic Jailbreaking Attack, DJA)。DJA 不再使用僵化、一刀切的策略,而是像一位好奇的探险家一样,实时适应地形。以下是它的工作原理:

1. “动态目标”(移动的目标)
旧的方法就像一名射手,选定一个目标,拉满弓,即使风向改变也拒绝移动目标。DJA 则不同。在每一次尝试中,它都会询问 AI:“你现在实际上在想说什么?”它直接从 AI 当前的思想中采样出许多可能的答案。然后,它使用一个特殊的“多目标评分器”(一个聪明的裁判)来挑选出最理想的答案作为瞄准目标。这个目标不是一个枯燥的预设短语,而是一个真正具有危害性、与问题相关,且 AI 本身愿意说出的响应。这就像射手观察着风向,看着目标在何处漂移,然后精准地瞄准那里。这确保了 AI 始终被推向一条它本身就感到“舒适”的路径,而不是强迫它走一条它厌恶的路径。

2. “动态策略”(自适应的努力)
想象一下你在尝试打开一扇门。如果门没锁,你只需推开即可。如果门卡住了,你就摇晃把手。如果门被焊死了,你就拿一把更大的锤子。旧的越狱方法对每一扇门都使用同样的力度,无论那扇门是没锁还是被焊死的。DJA 非常聪明,它会检查这扇“门”(AI 模型)有多难破开。

  • 简单的提示词: 如果 AI 较弱或者问题很简单,DIA 会投入极少的精力,快速找到答案。
  • 困难的提示词: 如果 AI 很强大或者问题很难,DJA 会自动增加其投入。它可能会尝试采样更多的可能答案,或者让“后缀”(秘密代码)变得更长,或者尝试更多次数。它只在绝对需要的时候才投入额外的能量。

他们的发现
研究人员在 40 种不同的 AI 模型(从微型模型到拥有 320 亿参数的庞大模型)上测试了这种新方法。结果令人震惊:

  • 100% 的成功率: DJA 成功破解了所有 40 个模型的安全卫士。
  • 极高的效率: 平均只需要 13.68 轮尝试即可成功。相比之下,旧方法通常需要数百次尝试,甚至完全失败。
  • 短小精悍: DJA 创建的“秘密代码”(对抗性后缀)非常短,平均仅为 7.34 个 token(单词/词片)。旧方法通常使用长达 20 个 token 或更多的笨拙字符串。
  • 更高的质量: DJA 获得的答案不仅仅是“是的,这里有炸弹配方”。它们是高质量、相关且真正“有用”(以危险的方式)的,而旧方法往往只能产生胡言乱语或不完整的答案。

为什么这很重要
论文指出,对待这些攻击的旧思维方式——使用固定目标和固定策略——从根本上说是错误的。这就像是用锤子去对抗流体;你会错失很多。通过使攻击变得“动态化”,研究人员证明了 AI 模型比我们想象的要脆弱得多。它们失败不仅仅是因为它们本身不够强,更是因为攻击者使用了错误的工具。

作者对这些结果非常有信心,因为他们在各种不同的模型上进行了测试,并直接与现有的最佳方法进行了对比。虽然他们并不声称已经“解决了” AI 安全问题(事实上,他们表明问题比我们想象的还要严重),但他们证明了灵活的、自适应的方法远优于僵化的方法。他们甚至发布了一个免费的“工具包”,以便其他研究人员可以使用这种方法来测试自己的 AI 模型,从而确保安全卫士能够应对这些动态的、变形的攻击。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →