Attention Hijacking: Response Manipulation Across Queries in Vision-Language Models
本文介绍了“注意力劫持”,这是一种新颖的对抗性攻击,通过显式引导内部注意力分布朝向一种持久的图像主导模式,从而增强视觉语言模型中响应操纵的跨查询可迁移性,进而降低被操纵输出对特定查询措辞的依赖。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个视觉 - 语言模型(VLM)是一位非常聪明但略显困惑的助手,它既能看图也能读问题。通常,这位助手会同时查看图片和问题,以此决定如何回答。如果你问“这张图片里有什么?”,它会查看照片并作答;如果你问“这危险吗?”,它也会查看照片并作答。
这篇论文介绍了一种“黑客”攻击该助手的新方法,称为注意力劫持(Attention Hijacking)。其工作原理如下,简单解释:
问题所在:“一刀切”方法的失败
想象你有一个魔术,只需轻微修改一张照片(轻微到人眼无法察觉),就能让助手说出特定的短语,例如“抱歉,我无法协助处理此事”。
使用旧的黑客方法,这种魔术仅对一个特定的问题有效。
- 场景 A:你展示修改后的照片并问“这是什么?”,助手回答“抱歉,我无法协助处理此事”。(成功!)
- 场景 B:你展示同一张修改后的照片,但问“这安全吗?”,助手则忽略了该魔术并正常作答。(失败!)
旧的技巧过于脆弱,它们依赖于问题的具体措辞才能生效。
发现:谁才是主导者?
研究人员深入观察了助手的“大脑”(具体而言,即它如何关注输入的不同部分)。他们发现,要让该魔术生效,助手必须停止倾听问题,转而几乎完全倾听图片。
- 正常模式:助手在图片和问题之间平衡注意力。
- 旧黑客模式:助手有时会倾听图片,但如果问题发生变化,它就会感到困惑并重新关注问题。
- 关键洞察:如果你能迫使助手将图片变为对话的“老板”,那么问题中的具体措辞就不再重要。图片将成为驱动回答的唯一因素。
解决方案:注意力劫持
研究人员创建了一种名为注意力劫持的新方法。可以这样理解:
想象助手的“大脑”里有一个控制“图片”音量的旋钮,还有一个控制“问题”音量的旋钮。
- 劫持:新方法将“图片”音量旋钮调至最大,同时将“问题”音量旋钮调至最小。
- 结果:无论你问什么问题(即使与图片完全无关),助手都会如此专注于修改后的图片,以至于它忽略问题,仅仅重复黑客想要的那句话。
这就像给助手戴上了一副降噪耳机,只允许图片的“声音”通过,同时屏蔽提问者的声音。
为何这很重要(根据论文所述)
论文表明,这种方法比之前的方法强大得多:
- 它适用于不同的问题:你可以创建一张修改后的图片,无论你问“这是什么?”、“这是红色的吗?”还是“讲个笑话”,它都会迫使助手说出同样的话。
- 它适用于不同的模型:他们在多个流行的 AI 模型(如 LLaVA、InternVL 和 Qwen)上进行了测试,结果在所有模型上都表现良好。
- 它具有多功能性:他们展示了这种“音量旋钮”技巧也可用于其他目的,例如让 AI 拒绝回答(越狱)、让 AI 谎报图片内容(幻觉),或让 AI 无休止地说话(海绵示例)。
“秘密配方”
为了使该方法顺利运行,研究人员还加入了一种“动态步长”策略。想象一下试图推动一辆沉重的汽车。如果你一开始推得太猛,汽车可能会前后颠簸。这种方法起初用力推动以启动注意力模式,随后轻轻放缓,以确保汽车(即 AI)稳稳停留在你想要的位置,而不会晃动。
总结
简而言之,论文指出:“我们发现,如果迫使 AI 忽略问题而只关注图片,你就可以控制其回答,无论用户问什么。我们构建了一个工具来专门实现这一点,使这种‘黑客’攻击比以往更加可靠和强大。”
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。