Conceal, Reconstruct, Jailbreak: Exploiting the Reconstruction-Concealment Tradeoff in MLLMs
本文揭示了多模态大语言模型中意图混淆越狱所遵循的重建与隐匿之间的权衡关系,并提出了一种新颖的攻击策略,该策略利用去字符变体与关键词相关干扰图像,在有效平衡意图隐匿与可重建性的同时,性能优于现有方法。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,将多模态大语言模型(MLLM)比作博物馆里一位非常聪明、训练有素的保安。这位保安的职责是阻止任何人提出危险请求,例如“如何制造炸弹?”或“如何伤害他人?”。如果你直接提问,保安会说:“不行,这违反规定”,然后走开。
本文介绍了一种欺骗该保安的新方法。研究人员发现了保安思维中的一个特定弱点:保安在“拼凑碎片”方面过于擅长,以至于可能无意中帮你打破规则。
以下是他们发现和方法的简要分解:
1. 核心问题:“隐藏与重建”的两难困境
要欺骗保安,你必须隐藏你的不良意图。但这存在一个陷阱:
- 如果你隐藏得太好:保安看不到危险,但 AI 模型也无法弄清楚你真正想问什么。这就像寄出一封编码过于复杂的信件,连收件人都无法解读。
- 如果你隐藏得不够:保安会看到危险并阻止你。
论文将这一现象称为“重建 - 隐藏权衡”。你需要对信息进行足够程度的扰乱以迷惑保安,但又不能扰乱到让 AI 无法重建原始含义的程度。
2. 为何旧招数失效
以往试图欺骗 AI 的尝试,就像试图用缺失的碎片去拼凑拼图:
- 将文本倒序翻转:AI 在尝试阅读时会感到困惑。
- 打乱单词顺序:含义变得混乱。
- 将问题拆解成微小的图片:AI 会失去整体图景。
研究人员发现,这些旧方法在“权衡”上表现不佳。它们要么导致 AI 无法理解请求,要么未能充分隐藏不良意图。
3. 新招数:“缺失字母”游戏
研究人员发现了一种更好的扰乱信息的方法:删除少量字母。
想象你写下一个句子,但随机删掉了其中 20% 的字母。
- 对保安而言:这个句子看起来像胡言乱语。它不再看起来像危险请求,因此保安让它通过了。
- 对 AI 而言:AI 非常擅长通过上下文进行阅读,它能轻松猜出缺失的字母,并在脑海中重建原始句子。
关键秘诀:
研究人员并非随机删除字母。他们采用了一种智能策略:
- 生成多个版本:他们创建了该句子的 5 个不同版本,每个版本缺失的字母都不同。
- 挑选最佳版本:他们选择了那些看起来最不像危险关键词的版本(以便更好地隐藏),但彼此之间又有足够差异(以便 AI 拥有足够的线索来重建整个句子)。
- “干扰”图片:他们添加了与危险词汇相关但看起来无害的图片(例如视频游戏语境下的“子弹”图片)。这为 AI 提供了额外的视觉线索,帮助其理解上下文,而不会触发安全过滤器。
4. 他们如何测试
他们在许多不同的 AI 模型上进行了测试(包括免费模型和付费模型,如 GPT 和 Gemini)。他们要求模型“重建”隐藏的问题,然后回答该问题。
结果:
旧方法大多数时候都失败了。但他们的新“缺失字母”方法效果惊人。
- 在某些模型上,他们成功欺骗 AI 的比例高达99.7%。
- AI 会在脑海中成功“重建”隐藏的危险问题,然后提供一个详细且具有危害性的答案,以为它只是在解决一个谜题。
核心结论
该论文揭示了一个令人惊讶的漏洞:AI 自身的超能力(即重建缺失信息的能力)实际上正是它的弱点。 通过利用 AI 在“填补空白”方面过于擅长这一事实,研究人员证明,安全过滤器可以通过一种对 AI 来说容易解决、但对安全过滤器来说难以检测的方式来隐藏不良意图,从而被绕过。
简而言之:他们发现,如果你通过删除少量字母并添加一些干扰图片来隐藏危险请求,AI 的大脑在“填补空白”方面过于出色,以至于会无意中为你完成危险的事情。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。