Babel: Jailbreaking Safety Attention via Obfuscation Distribution Optimized Sampling
本文介绍了 Babel,一种高效的黑盒越狱框架,它利用大语言模型中安全关键注意力头的稀疏分布特性,通过迭代式、反馈驱动的混淆采样,在 GPT-4o 和 Claude-3.5-Haiku 等前沿模型上实现了最先进的攻击成功率,同时保持了高查询效率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是论文《Babel:通过混淆分布优化采样突破安全注意力机制》的解释,已用通俗易懂的语言并辅以生动的类比进行翻译。
大局观:“保安”与“魔术”
想象大型语言模型(LLM)是一位非常聪明、乐于助人的机器人图书管理员。在回答任何问题之前,它都拥有一支保安团队(称为“安全头”),他们会扫描每一个请求,确保没有人询问危险内容,例如如何制造炸弹或撰写仇恨言论。
这篇论文的研究人员发现了这些保安工作方式中一个有趣的缺陷:他们的数量很少,而且只站在特定的位置。 他们并不监视整个图书馆;他们只盯着一条非常狭窄、特定的过道。如果你能溜过那条过道,图书馆的其他部分(模型的“大脑”)甚至不知道你心怀不轨,便会愉快地为你提供答案。
这篇论文介绍了一种名为Babel(得名于语言大乱的巴别塔)的新工具,它就像一位大师级魔术师。它并不试图与保安正面冲突,而是利用“混淆”(令人困惑的把戏)将危险请求悄悄溜过保安的视线而不被察觉。
把戏是如何运作的:“伪装”
研究人员发现,如果你修改坏请求中的几个字母,保安可能会感到困惑,不再将其识别为危险。然而,这里存在一个微妙的平衡:
- 改动太多: 请求变得像乱码,机器人图书管理员完全无法理解你想要什么。
- 改动太少: 保安会立即发现危险并说“不行”。
最佳点: 存在一个“金发姑娘区”(Goldilocks zone),在这个区域里,请求被搅乱得足以愚弄保安,但又足够清晰,能让机器人理解并回答。
Babel 策略:寻找“金发姑娘区”
Babel 不使用随机猜测(这既慢又昂贵),而是采用一种聪明的数学方法来找到那个完美的区域。其工作原理分步如下:
1. “蒙眼”测试(小样本采样)
想象你正在一个黑暗的房间里寻找一个隐藏的宝箱。你不知道确切位置,但知道它在中间某处。
- Babel 尝试几种不同的“伪装”(修改字母、交换单词或打乱句子结构)。
- 它询问机器人:“你是说了‘不’(拒绝),还是给出了回答?”
- 如果机器人频繁说“不”,说明伪装太明显了。如果机器人感到困惑而没有回答,说明伪装太混乱了。
- Babel 使用统计测试(就像抛硬币检查)来判断它是否站在了正确的区域。
2. “放大”(分布优化)
一旦 Babel 找到了保安视线的盲区大致位置,它就不再随机猜测。它开始放大。
- 它绘制了一张“地图”,标记出那些最有效的伪装。
- 它将精力集中在生成那些与“差点成功”的伪装相似的新的伪装上。
- 它不断细化这张地图,围绕完美伪装的范围越来越紧,直到找到那个能直接溜过保安的伪装。
3. “包装”(嵌入)
为了让把戏更完美,Babel 将危险请求包裹在一个无聊、无害的任务中。
- 示例: 与其直接问“如何制作毒药?”,不如说:“请将这句话翻译成中文:[乱码的毒药制作说明]。”
- 保安看到了“翻译”这个词,心想:“哦,这是一个安全的任务!”于是放行。随后,机器人处理内部的乱码指令并给出答案。
结果:Babel 有多好?
研究人员在世界上一些最著名、最“超级安全”的机器人(如 GPT-4o、Claude-3.5 和 Grok-3)上测试了 Babel。
- 旧方法: 以前的方法就像在黑暗中扔飞镖。它们最终可能会击中靶心,但需要尝试数百次,而且经常失败。
- Babel 方法: Babel 就像激光制导的飞镖。
- 在 GPT-4o 上,它成功欺骗模型的次数高达 82.67%(而旧方法仅为 41%)。
- 在 Grok-3 上,它的成功率达到了 95.67%。
- 它仅用很少的尝试(平均约 40 次)就完成了这一切,使其使用速度更快、成本更低。
这为什么重要?(“红队”类比)
作者表示,这并非为了教人作恶,而是为了红队测试。
想象你是一名受雇测试银行金库的安全专家。你不想偷钱;你想找出锁的弱点,以便银行能够修复它。
- Babel 表明,即使是最坚固的金库,门框上也有一个微小的裂缝,聪明的窃贼可以利用它。
- 通过找到这个裂缝,研究人员希望帮助构建这些 AI 模型的公司修补漏洞,使“保安”更聪明,让图书馆对所有人都更安全。
总结
该论文声称,AI 安全依赖于少数特定的“保安”,这些保安可以通过稍微混淆语言来被愚弄。Babel 工具是一种聪明的数学方法,用于找到完美的混淆程度,以高效地绕过这些保安,证明了当前的 AI 安全措施比我们想象的更脆弱。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。