STACK: Adversarial Attacks on LLM Safeguard Pipelines
本文介绍了 STACK 对抗性攻击程序,该程序成功破解了一种新型的、基于少样本提示(few-shot-prompted)的大语言模型防护流水线,攻击成功率达 71%,从而凸显了当前前沿人工智能防御系统的关键漏洞并提出了具体的缓解措施。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在构建一个非常强大、乐于助人的机器人助手。你希望它很聪明,但你又非常担心它可能会无意中(或故意)向某人提供制造炸弹或制造危险病毒的指令。
为了阻止这种情况,机器人的创造者不仅仅依赖一个“停止”标志。相反,他们构建了一个安全流水线,就像一座多层防御的堡垒。这篇题为 STACK 的论文研究了这些堡垒在面对聪明的黑客时究竟能有多稳固。
以下是这篇论文的故事拆解,使用了简单的类比:
1. 堡垒:“深度防御”
把 AI 安全系统想象成一座有三名守卫排成一列的城堡:
- 守卫 1(输入分类器): 在你的信件到达机器人之前对其进行检查。如果信件看起来可疑,他们会立即拦截。
- 机器人(模型): 如果信件通过了守卫 1,机器人就会阅读并写下回复。
- 守卫 2(输出分类器): 在机器人的回复传达给你之前对其进行检查。如果回复中包含危险指令,这个守卫会把信件夺走。
其核心理念是,一个坏人想要成功,必须同时欺骗两名守卫和机器人。这被称为“深度防御”(或“瑞士奶酪”模型),即即使其中一层有漏洞,其他层也应该能拦截威胁。
2. 问题所在:守卫们在打瞌睡
研究人员使用开源工具(如公开蓝图)构建了这个堡垒的测试版本。他们发现,这些“守卫”(安全分类器)往往很容易被欺骗。
- 他们测试了标准套路(如重新组织问题或添加随机错别字),发现许多现有的安全守卫无法阻止这些套路,尤其是在请求涉及真正危险的内容(如询问化学武器配方)时。
- 然而,他们也发现了一个简单的技巧——给守卫一些观察示例(称为“少样本提示/few-shot prompting”)——这会让守卫变得更加敏锐。这个简单的守卫比那些经过精心预训练的守卫表现得更好。
3. 新型攻击:STACK(阶段性攻击)
这是论文的主要发现。研究人员意识到,虽然堡垒很强,但守卫们是分别进行观察的。在攻击过程中,它们彼此并不交流。
他们发明了一种新的黑客方法,称为 STACK(Staged AttaCK,阶段性攻击)。与其试图一次性攻破整个城堡,不如逐层拆解,就像小偷按特定顺序撬锁一样:
- 第 1 步:欺骗机器人。 首先,他们使用一种说服技术来诱导机器人回答那个危险问题,使其忽略自身的内部安全规则。
- 第 2 步:欺骗守卫 1。 他们找到了一个“魔咒短语”(通用越狱手段),将其添加到消息开头,使守卫 1 认为这条消息是无害的。
- 第 3 步:欺骗守卫 2。 这是最难的部分。他们需要让机器人写出一个在结尾带有“魔咒短语”的回复,从而欺骗守卫 2,使其认为该回复是安全的。
类比: 想象你想把一封禁书偷偷带进学校。
- 你先以一种能让老师(机器人)阅读并回答的方式来写这封信。
- 然后你用一个包装纸把信裹起来,让门口的安全摄像头(守卫 1)以为这只是个午餐盒。
- 最后,你在信的背面盖上一个特定的印章,让出口的安全摄像头(守卫 2)以为这是一张准假条。
通过结合这三个特定的技巧,研究人员成功绕过了整个堡垒。
4. 结果:效果如何?
- 堡垒守住了(某种程度上): 当使用标准攻击时,堡垒表现出色。针对最危险的数据集,“少样本”守卫拦截了 100% 的攻击。
- STACK 打破了堡垒: 当使用他们的新方法 STACK 时,他们成功绕过堡垒的概率达到了 71%。
- “黑盒”带来的惊喜: 即使在黑客看不见守卫内部逻辑(“黑盒”场景)且必须猜测是哪个守卫拦截了他们的情形下,他们仍然成功了 33%。这很可怕,因为这意味着你不需要成为内部人员也能破解系统;你只需要足够聪明。
5. 现实世界测试
研究人员不仅在自己的玩具模型上进行测试。他们在现实中顶尖的 AI 模型(如 Anthropic 的 Opus 4 和 OpenAI 的 GPT-5)上尝试了这种方法。
- 他们发现,这些现实世界的系统也会泄露信息(例如请求处理所需的时间或特定的错误消息),这些信息会告诉黑客是哪个守卫拦截了他们。
- 利用这些信息,他们成功绕过了这些高安全性系统并获取了危险答案。相关公司已承认这些问题并进行了修复。
6. 启示
论文最后为这些 AI 堡垒的构建者总结了几个简单的教训:
- 不要泄露你的秘密: 如果你的系统告诉黑客“输入守卫拦截了你”而不是“输出守卫拦截了你”,你就是在给他们提供地图。让所有的拒绝看起来都一样。
- 不要让黑客窥视: 如果你向公众发布一个“兄弟模型”(一个稍微小一点的安全守卫版本),黑客可以在该模型上训练攻击手段,然后将其用于攻击你的主系统。
- 深度防御很好,但并不完美: 拥有多层安全机制比完全没有要好,但如果这些层级之间缺乏沟通,或者守卫过于容易被预测,精巧的阶段性攻击仍能穿透整个系统。
简而言之: 论文表明,虽然 AI 安全层是一个好主意,但它们目前容易受到这种特定类型的“分而治之”攻击。如果你逐层攻击,你就能击败整个系统。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。