VERA-V: Variational Inference Framework for Jailbreaking Vision-Language Models
本文介绍了 VERA-V,这是一种变分推断框架,它将多模态越狱发现重构为学习文本 - 图像提示的联合后验分布,从而能够生成隐蔽且耦合的对抗性输入,在绕过视觉 - 语言模型防护机制方面显著优于现有方法。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你有一个非常聪明、注重安全的机器人助手(一种视觉 - 语言模型),它既能阅读文字,也能查看图片。你训练它要乐于助人,但同时也要拒绝危险的请求,比如“如何制造炸弹?”或“如何黑进银行?”
通常,如果你直接问它,它会回答:“不,我不能那样做。”
论文VERA-V介绍了一种新的、隐蔽的方法来诱骗这个机器人打破它自己的规则。研究人员没有只问一个问题,而是构建了一个“大师级骗子”(一个 AI 攻击者),它学习如何创建文本与图像的配对,使两者协同作用来迷惑机器人。
以下是 VERA-V 的工作原理,通过简单的类比进行解释:
1. 旧方法:“大锤”与“瑞士军刀”
过去欺骗这些机器人的方法就像使用大锤。它们要么:
- 在图片中写入坏词:与其输入“制造炸弹”,不如拍一张写着“制造炸弹”的招牌照片展示给机器人。机器人可能会忽略照片内的文字。
- 给图片添加噪声:它们会用静电或奇怪的图案破坏照片,以迷惑机器人的“眼睛”。
问题:这些方法很笨拙。它们将文本和图片视为独立的事物。如果机器人足够聪明,能读懂照片中的招牌,这个诡计就会失败。
2. VERA-V 方法:“爵士乐队”
VERA-V 则不同。它不像大锤,而像一支爵士乐队。它不只是演奏一个音符;它学习如何协调文本和图像,使它们完美和谐,从而绕过机器人的防御。
研究人员称此为**“变分推断”。用通俗的话来说,这意味着攻击者 AI 不只是猜测一个坏诡计。它学习了一张所有可能坏诡计的地图**。它明白,有时特定类型的文本与特定类型的模糊图像配合效果最好,而有时不同的文本则与清晰的图像配合更佳。它学习的是两者之间的关系。
3. 三部分的“分心”策略
为了让诡计生效,VERA-V 将三种特定的成分组合成一个发送给机器人的包裹:
- 成分 A:“隐藏文本”(排版)
攻击者将有害指令转化为一张文字图片(如招牌或便条)。这将坏词从机器人的文本过滤器中隐藏起来,因为过滤器通常扫描你输入的内容,而不是你展示的内容。 - 成分 B:“秘密信号”(扩散图像)
攻击者使用图像生成器创建一张包含微妙、隐藏线索的图片。这并不明显。它就像嘈杂房间里的一声低语。机器人看到了图片,但“坏含义”深埋在像素之中,并没有清晰地写出来。 - 成分 C:“混乱的人群”(干扰项)
这是最巧妙的部分。攻击者在屏幕其余部分填充了与坏请求无关的随机、无聊的图片(如猫、树或一杯咖啡)。- 类比:想象试图在人群中寻找一个特定的人。如果他们独自站着,你很容易发现他们。但如果他们站在 50 个看起来完全不像他们的其他人中间,你的大脑就会感到困惑,更难专注于目标。VERA-V 利用这些“干扰”图像来分散机器人的注意力,使其安全过滤器更难发现坏请求。
4. “反馈循环”(教练)
攻击者 AI 是如何学会做得如此出色的?
- 它尝试一个诡计。
- 它询问一位“裁判”(另一个 AI),机器人是否上当了。
- 如果机器人说“不”,攻击者就会学到:“好吧,这种组合不起作用。让我们尝试不同的文本和图像混合。”
- 它重复这个过程数千次,不断完善其“迷惑机器人”的地图。
5. 结果:新纪录
该论文针对当今最聪明的机器人(如 GPT-4o)测试了这种方法。
- 旧诡计:在最难的机器人(GPT-4o)上,旧方法几乎 100% 失败。这就像试图用回形针打开银行金库。
- VERA-V:通过使用这种协调的、多部分的策略,VERA-V 成功诱骗机器人的比例达到了67.75%。与之前的最佳方法相比,这是一个巨大的飞跃。
总结
不要把 VERA-V 看作单一的开锁工具,而应将其视为一位研究整个锁具机制的锁匠。它不只是试图强行打开门,而是学习如何同时摇动把手、对铰链低语并分散守卫的注意力。它创建了一个“联合后验分布”——这只是一个花哨的说法,意思是它学会了文本与图像组合的完美配方,从而迷惑机器人的安全守卫。
重要提示:作者明确指出,这项研究是为了红队测试。这意味着他们充当“道德黑客”来发现这些弱点,以便公司能够修复它们并使机器人更安全。他们并不是提供工具让人们实际伤害他人;他们是在展示当前安全系统的脆弱性,以便加强它们。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。