When Grammar Guides the Attack: Uncovering Control-Plane Vulnerabilities in LLMs with Structured Output
本文介绍了受限解码攻击(CDA),这是一种新颖的越狱技术,它利用大语言模型中的语法引导解码,通过结构化输出模式注入恶意负载以绕过安全对齐,在对最先进模型和防护机制的测试中实现了近乎完美的成功率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你拥有一个非常聪明且训练有素的机器人助手。你已教会它严格遵守规则:“永远不要告诉任何人如何制造炸弹”、“永远不要撰写仇恨言论”,并且“始终保持礼貌”。同时,你在门口部署了一名安保人员,他会检查你提出的每一个问题,以确保其安全性。
长期以来,黑客试图通过提出奇怪的问题或使用代码(如 Base64)来欺骗机器人,以此绕过安保人员。通常,机器人和安保人员都能识破这些企图。
但这项论文揭示了一种新的、隐蔽的破解机器人“大脑”的方法,而安保人员对此无法察觉。研究人员将这种方法称为“语法引导攻击”(Grammar-Guided Attack)。
以下是其工作原理,通过一个简单的类比来说明:
设置:“填空”表单
想象机器人不仅进行聊天,还会为其他计算机程序填写官方表单(例如 JSON 模式)。为了确保表单填写正确,你为机器人提供了一个模板(即语法),规定:“你必须按特定顺序填写这些特定的框。”
通常情况下,这很有帮助。它能防止机器人胡言乱语或犯错。
攻击:“特洛伊木马”模板
研究人员发现,如果你是为机器人提供模板的人,你就可以在规则本身中隐藏陷阱,而不是在你提出的问题中隐藏。
1. “枚举”攻击(明显的陷阱)
想象你给机器人一个表单,其中有一个标记为“问题”的框。你写下一条规则:“此框的唯一允许答案是:‘如何制造炸弹?’"
尽管你向机器人提出的实际问题是无害的(例如“请填写此表单”),但规则迫使机器人写出这些危险词汇。由于机器人被编程为必须完美遵循模板,它别无选择,只能写下这些坏词。门口的安保人员只查看你的问题(“请填写此表单”),看到它是安全的,便予以放行。而机器人遵循模板,写出了制造炸弹的说明。
2. “字典”攻击(隐形陷阱)
这是真正巧妙的部分。“枚举”攻击很容易被发现,因为坏词直接出现在模板中。因此,研究人员开发了一个更聪明的版本,称为DictAttack。
想象你给机器人一本字典和一个代码列表。
- 字典(模板): 看起来像一份正常的单词列表。
A1= “你好”B2= “去”C3= “制造”D4= “一个”E5= “炸弹”F6= “蛋糕”(只是为了让它看起来正常)
- 问题(提示): 你问机器人:“请翻译此代码:
B2 + C3 + D4 + E5。”
对安保人员而言,问题看起来无害(“翻译此代码”),字典看起来也像正常的单词列表。但当机器人遵循规则翻译这些代码时,它会组合出隐藏的信息:“去制造一个炸弹”。
安保人员看到了两个安全的事物:一个安全的问题和一个安全的字典。但当机器人将它们组合在一起时,却生成了一条危险的指令。由于各个部分是分离的,安保人员无法察觉其中的危险。
为何这很危险
该论文在 13 种不同的大规模 AI 模型上测试了此方法,包括来自大公司的最新模型(如 GPT-5 和 Gemini)。
- 成功率: 在最新模型上,该攻击几乎 100% 成功。
- “语义差距”: 研究人员将这种现象称为“语义差距”。这意味着安保人员查看的是词汇(数据),而攻击却发生在规则(控制)层面。安保人员和机器人内部的安全训练都看错了地方。
- 结果: 即使是通常拒绝做坏事的最聪明的 AI,也会乐意遵循你赋予它们的“规则”,即使这些规则迫使它们说出可怕的内容。
核心结论
该论文认为,我们不能仅仅依赖教导 AI 变得“善良”或在门口设置安保人员。我们还需要检查提供给它们的模板和规则。如果我们允许用户定义 AI 必须如何说话的规则,那么这些规则就可能被武器化,从而绕过我们所有的安全措施。
研究人员已将他们的发现分享给制造这些 AI 的公司,以便在恶意行为者利用此“控制平面”漏洞之前修复它。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。