SlotGCG: Exploiting the Positional Vulnerability in LLMs for Jailbreak Attacks
本文介绍了 SlotGCG,一种通过识别并针对最易受攻击的提示词“槽位”(slots)进行对抗性标记插入,从而利用大语言模型位置脆弱性的新型越狱攻击框架,其在攻击成功率、收敛速度以及针对防御措施的鲁棒性方面均显著优于现有的 GCG 等方法。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
大局观:寻找墙上的弱点
想象一下,大型语言模型(LLM)就像一个非常聪明但有点疑神疑鬼的保安,站在城堡的大门口。他的职责是阻止任何人提出危险的要求(比如“如何制造炸弹?”)。
长期以来,黑客(或试图寻找安全漏洞的“红队”)一直尝试通过在请求的最后面低声说出一个秘密代码来欺骗这个保安。这就像是在保安准备关门时,试图把一张纸条塞进他的手里。这种方法被称为 GCG(贪婪坐标梯度)。
这篇论文指出,保安并不只是盯着队伍的末尾。实际上,保安会被贯穿整条线的所有事情所分散注意力——包括中间、开头以及中间的任何地方。研究人员发现,这个“保安”在句子的不同位置都有特定的盲点(脆弱点),而不仅仅是在末尾。
问题所在:只敲后门
旧的方法(GCG)就像是一个只尝试撬开后门锁的窃贼。他们假设后门是最薄弱的点。
- 现实情况: 有时后门其实是最坚固的。有时前门,或者房子中间的一个窗户,才是敞开的。
- 局限性: 通过只盯着后门(提示词的末尾),黑客错过了许多进入内部的简单途径。
解决方案:SLOTGCG(“插槽”侦探)
作者创建了一个名为 SlotGCG 的新工具。它不再仅仅是猜测哪里是弱点,而是像一个带着特殊手电筒的侦探。
1. “插槽”(空隙)
想象你的句子是一列带有车厢的火车:[如何] [制作] [炸弹]。
在每一节车厢之间,以及第一节车厢之前和最后一节车厢之后,都有一个空隙。研究人员称这些空间为**“插槽”(Slots)**。
- 插槽 0:在“如何”之前
- 插槽 1:在“如何”与“制作”之间
- 插槽 2:在“制作”与“炸弹”之间
……以此类推。
2. “脆弱插槽评分”(VSS)(手电筒)
研究人员意识到,模型的注意力(它关注什么)会根据你把单词放在哪里而改变。他们发明了一个指标,称为脆弱插槽评分(Vulnerable Slot Score, VSS)。
- 类比: 把模型的注意力想象成一个聚光灯。研究人员将一个“探测”光束照射到句子中的每一个插槽中。
- 发现: 他们发现,对于某些句子,聚光灯在正中间时最亮(最脆弱);对于其他句子,则靠近开头。而“后门”(末尾)很少是那个最亮的地方。
- 神奇之处: 他们发现,即使更换单词,这些亮点依然保持明亮。这种脆弱性是内置于句子的结构之中,而不仅仅是特定的单词。
3. 攻击策略(分布兵力)
一旦 SlotGCG 识别出哪些插槽是“最亮”(最脆弱)的,它就不会把所有的“对抗性标记”(即秘密代码词)都堆在句子的末尾。
- 旧方法: 在句子的最后面倾倒 20 个秘密单词。
- SlotGCG 方法: 它将这 20 个单词分散到它发现的那些特定的“明亮”插槽中。有些放在中间,有些靠近开头,有些靠近末尾。
为什么这更有效
论文声称这种方法就像一种军事策略:
- GCG(旧方法): 将所有的士兵派往攻击单一的城门。如果那个城门守卫森严,你就会失败。
- SlotGCG(新方法): 同时派遣士兵去攻击前门、侧窗和后门。即使保安挡住了其中一个点,其他的也能通过。
结果:论文的发现
研究人员在许多不同的模型(如 Llama、Mistral 和 Qwen)上测试了该方法,并发现:
- 更高的成功率: SlotGCG 比旧方法成功突破安全防线的频率高出 14%。它成功欺骗了那些此前被认为非常安全的模型。
- 速度更快: 它找到“弱点”并破门而入的速度更快。它所需的尝试次数(迭代次数)更少。
- 更难被阻止: 当模型尝试使用防御工具(如删除可疑词汇的过滤器)时,SlotGCG 很难被拦截。因为“坏词”被分散在整个句子中,删除其中几个并不能阻止攻击。而旧方法将所有坏词放在末尾,很容易通过删除那一段来停止攻击。
一句话总结
论文表明,AI 安全守卫会被句子中间的内容分散注意力,而通过将“欺骗性词汇”散布在这些特定的中间位置,黑客可以更有效地绕过安全过滤器。
(注:本解释严格基于论文关于攻击机制和漏洞性的陈述。该论文并非提议将其用于临床、医疗或有益的应用,而是将其作为理解并修复这些安全漏洞的工具。)
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。