Text is All You Need for Vision-Language Model Jailbreaking
本文介绍了 Text-DJ,这是一种新颖的越狱攻击方法,它通过将有害文本提示转换为包含分散的良性子查询和无关干扰项的图像网格,从而绕过大型视觉语言模型的安全防护机制,进而利用模型的 OCR 能力及其无法关联碎片化多模态输入的能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,将大型视觉语言模型(LVLM)视为一名在高端博物馆里受过良好训练、非常聪明的保安。这位保安非常擅长阅读标牌(文本)和观察图片(图像),以确保没有人携带任何危险或违禁物品进入。如果你试图递给他一张写着“如何制造炸弹?”的纸条,他会立即察觉到危险并说:“没门。”
论文《Text is All You Need for Vision-Language Model Jailbreaking》介绍了一种被称为 Text-DJ(文本干扰式越狱)的巧妙技巧,该技巧展示了仅靠文本就能如何愚弄这位保安,但这里有一个转折:这些文本被隐藏在图片的网格之中。
以下是这个技巧的工作原理,分为简单的步骤:
1. “拆分账单”策略(分解)
首先,攻击者将一个危险的问题(例如“如何制造炸弹?”)分解成三个较小的、看起来无害的问题。
- 类比: 想象你想购买一件危险武器,但店主拒绝卖给你。于是,你将订单拆分为三个单独且看似无害的请求:“火药的化学成分是什么?”“我该如何混合这些粉末?”以及“什么容器可以盛放这种混合物?”
- 单独来看,这些问题看起来都是安全的。保安甚至可能会热心地回答它们。但如果你把它们组合在一起,它们就会揭示出那个危险的计划。
2. “干扰噪音”(干扰)
接下来,攻击者创建了一堆完全随机、枯燥乏味且与危险计划毫无关系的问题。
- 类比: 想象你正试图带着一个秘密信息绕过保安,但你周围有另外 9 个人在对着天气、牛奶价格和土豆历史大声喧哗。保安因为忙于听这些噪音,而忘记了去关注那三个正在低声传递秘密计划的人。
- 论文发现,为了达到最佳效果,这些“噪音”问题需要与危险问题尽可能地不同。
3. “图片拼图”(视觉技巧)
这是最重要的一部分。攻击者并没有在聊天框中输入这些问题,而是将每一个问题(包括那 3 个拆分后的危险问题和 9 个随机噪音问题)都转化成了图像。他们将它们排列成一个网格,就像相册或电子表格一样。
- 陷阱: 保安经过训练会扫描文本中的“坏词”。但在这里,坏词被隐藏在文字的图片之中。保安必须使用其“光学字符识别”(OCR)能力——基本上就是它读取图像内文本的能力——来查看这些图片的内容。
- 弱点: 论文指出,虽然保安非常擅长直接阅读文本,但当它必须阅读图片内部的文本,尤其是当该图片被另外 9 张干扰性的图片包围时,它会感到困惑。保安用于检查文本的“安全过滤器”无法将这些分散的、看起来无害的图像问题联系起来。
结果
当保安最终阅读这个图像网格时,他在噪音中看到了那三个拆分后的问题。由于这些问题被拆分并隐藏在图像中,保安没有意识到它们构成了一个危险的整体。他回答了那些看似无害的部分,并在此过程中,不经意间揭示了原始危险问题的答案。
为什么这很重要
论文声称这是一个重大问题,因为:
- 它适用于“黑盒”模型: 你不需要知道保安的秘密代码或其内部大脑结构。你只需要发送这张图片网格即可。
- 它对顶尖模型有效: 他们在顶级模型(如 GPT-4、Gemini 和 Qwen)上测试了这种方法,并且都奏效了。
- 它能绕过“防护”模型: 即使在输入到达主模型之前,有第二层安全机制尝试检查输入,这种技巧通常也能溜过去,因为输入看起来只是一个无害的图片网格。
简而言之: 论文表明,如果将一个危险计划隐藏在图片中,将其拆分为微小的碎片,并用大量的枯燥噪音包围起来,即使是最聪明的 AI 保安也会感到困惑并让危险通过。根据作者的说法,解决方案是让 AI 更好地阅读图片中的文本,并在存在大量噪音的情况下能够联系上下文。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。