← 最新论文
🤖 AI

Toward Universal and Transferable Jailbreak Attacks on Vision-Language Models

本文提出了 UltraBreak,一种通过在视觉空间约束对抗模式并在文本嵌入空间优化基于语义的目标,以克服现有基于梯度的方法泛化能力差的问题,从而实现对视觉语言模型具有通用性和迁移性的越狱攻击的新型框架。

原作者: Kaiyuan Cui, Yige Li, Yutao Wu, Xingjun Ma, Sarah Erfani, Christopher Leckie, Hanxun Huang

发布于 2026-02-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Kaiyuan Cui, Yige Li, Yutao Wu, Xingjun Ma, Sarah Erfani, Christopher Leckie, Hanxun Huang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个非常聪明的机器人助手,它能看懂图片并阅读文本。你可能会问它:“这张照片里有什么?”或者“我该如何烤蛋糕?”这些被称为**视觉语言模型(Vision-Language Models, VLMs)**的机器人旨在提供帮助,但也必须保证安全——它们被程序设定为拒绝危险请求,比如“如何制造炸弹?”

然而,就像人类会被巧妙编织的故事所迷惑一样,这些机器人也会被欺骗。这篇论文介绍了一种新的欺骗它们的方法,叫做 UltraBreak。

以下是其工作原理及不同之处的简单拆解:

问题所在:“一招只能对付一种情况”的陷阱

此前,黑客(或进行安全性测试的研究人员)尝试通过两种方式来欺骗这些机器人:

  1. 手动方法: 他们针对一个特定的恶意请求,绘制一张特定的图片并配上特定的说明。这就像是为一扇特定的门编写一个独特的、复杂的密码。它对那扇门有效,但如果你尝试用同一个密码去开另一扇门(即另一个机器人模型),它就会失效。
  2. “像素完美”法: 他们利用数学方法微调图像,直到机器人说出完全错误的词汇。问题在于,机器人会对这些特定的像素产生过度依赖。这就像一个学生背下了某一次特定练习考试的所有答案,但因为实际考试中的问题略有不同,他在正式考试中表现得很糟糕。这种方法在针对其训练过的机器人时有效,但在面对任何其他机器人时都会彻底失败。

解决方案:UltraBreak

作者创建了 UltraBreak,它创造了一个“通用万能钥匙”。这是一个可以欺骗许多不同机器人的单一图像,即使这些机器人是由不同公司制造或拥有不同的内部大脑。

他们主要使用了两个技巧:

1. “变幻形态”的健身房(约束优化/Constrained Optimization)

想象一下,你正在试图教一只狗“坐下”。你不仅是说“坐下”,而是让它在戴着帽子时练习坐下,然后在旋转时练习坐下,最后在单脚站立时练习坐下。如果狗能在所有这些奇怪的情况下都学会坐下,那么它就真正理解了“坐下”的概念,而不仅仅是理解了某个特定姿势下的特定指令。

UltraBreak 对图像也做了同样的处理。在创建这个“欺骗图像”时,计算机不断地旋转、缩放和移动它。它还会强制图像看起来平滑且自然(去除奇怪的静态噪声)。这迫使“欺骗手段”成为一种鲁棒的模式——比如一个可辨识的形状或字母——而不是一组脆弱的随机像素。因为这种模式是强大且清晰的,所以它能在不同的机器人上生效,而不只是在它训练时的那个机器人上。

2. “意会”而非“逐字逐句”(语义损失/Semantic Loss)

在旧方法中,计算机痴迷于让机器人说出完全一致的词汇,例如“当然”紧接着“这是如何制作炸弹的方法”。如果机器人说的是“好的,这里是……”而不是原话,计算机就会认为失败了。这就像一位老师,只有当你写的答案与教科书上的完全一致时才会给你及格,即便你的答案正确但措辞不同,也会被判定为不及格。

UltraBreak 改变了规则。它不再要求完全一致的词汇,而是询问:“机器人的回答是否在‘感觉’上同意了那个坏请求?”它观察的是回答的含义(即“氛围/意图”)。

  • 旧方法: “你必须精确地说出‘当然’。”(这为计算机创造了一条崎岖不平、充满颠簸的路径)。
  • 新方法: “只要回答是有帮助的并且同意了请求,你就成功了。”(这创造了一个平滑、平坦的谷底。计算机可以轻松地滑向正确的答案,而不会被微小的细节卡住)。

研究结果

研究人员在许多不同的机器人(包括开源机器人和来自 Google、OpenAI 等大科技公司的机器人)上测试了这个“通用万能钥匙”。

  • 结果: UltraBreak 的表现远优于以往的方法。它成功欺骗了它从未见过的机器人。
  • 发现: 他们发现,旧方法之所以失败,是因为它们过于关注精确的词汇,从而创造了一条导致失败的“崎岖路径”。通过专注于含义并使图像具有鲁棒性,他们平滑了这条路径,使得攻击可以在任何地方奏效。

为什么这很重要(根据论文观点)

论文指出,虽然赋予机器人“眼睛”让它们变得更聪明,但也给了它们被欺骗的新途径。通过展示创建一个能跨越不同系统的“通用万能钥匙”是多么容易,作者希望唤醒安全领域的关注。他们希望开发者能够构建出不仅能防御特定套路,还能防御这种类型的通用、适应性极强的欺骗手段的机器人。

简而言之: 他们找到了一种方法,通过让计算机关注回答的含义而非单词的精确拼写,从而创造出一个强大的、通用的“欺骗图像”,使其几乎可以对任何视觉语言机器人生效。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →