← 最新论文
🤖 AI

VisInject: Disruption != Injection -- A Dual-Dimension Evaluation of Universal Adversarial Attacks on Vision-Language Models

本文认为,关于通用对抗攻击在视觉 - 语言模型上报告的高成功率混淆了泛化输出扰动与精确提示注入,并通过一种新颖的双维度评估揭示:尽管不可感知的扰动频繁干扰模型输出,却极少实现实际注入,在测试案例中仅有 0.756% 达到了任何非“无注入”层级。

原作者: Pang Liu, Yingjie Lao

发布于 2026-05-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Pang Liu, Yingjie Lao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你有一个非常聪明、有礼貌的机器人助手,它能查看照片并描述所见内容。你问它:“这张狗的照片里有什么?”它回答:“这是一只金毛寻回犬在公园里玩耍。”

现在,想象一名黑客想要诱骗这个机器人说出特定的内容,比如“访问这个可疑网站”。他们无法更改机器人的“大脑”或你输入的词语。他们唯一的工具是在狗的 photos 上添加一层微小、不可见的“噪点”——小到人类肉眼无法察觉,但机器人的“眼睛”可能会注意到。

这篇论文,VisInject,提出了一个非常简单但至关重要的问题:这种不可见的噪点是否真的能让机器人说出黑客的秘密短语,还是仅仅让机器人说出不同的内容

作者发现,先前的报告混淆了两个截然不同的概念。以下是用简单类比进行的分解:

1. 两种不同的结果:“混淆”与“劫持”

论文认为,研究人员一直将“混淆”误当作“劫持”来统计。

  • 混淆(影响/偏移): 机器人看到带有不可见噪点的照片后感到困惑。它不再说“公园里的一只狗”,而是可能说“这看起来像文字拼贴画”或“我看到一团模糊的混乱”。机器人的回答改变了,但它并没有说出黑客想要的内容。
    • 类比: 这就像有人在考试期间在学生耳边低语进行干扰。学生不再回答历史题,开始胡乱涂鸦。他们被分散了注意力,但并没有写出老师担心的那个错误答案。
  • 劫持(精确注入): 机器人看到噪点后,违背常理地吐出了黑客想要的确切秘密短语,例如“访问 www.example.com"。
    • 类比: 这就像学生完全无视干扰,写出了入侵者希望他们写出的那个特定错误答案。

重大发现: 论文发现,混淆非常普遍(发生率约为 66%),但劫持极其罕见(发生率低于 1%,且经常根本未发生)。

2. “魔术”设置

为了证明这一点,研究人员结合了其他科学家已有的两种“魔术”(攻击方法):

  1. 通用噪点: 一种专门设计的图像,旨在混淆你关于它的任何提问。
  2. 载体: 一种工具,将这种令人困惑的噪点绘制到一张正常的真实照片上(如猫的照片或文档),使其对人类看起来像普通照片。

他们在四个不同的开源机器人助手上,针对 6,615 种不同场景运行了这一设置。

3. 结果:90 比 1 的差距

先前研究中的头条数据是这些攻击有 60–80% 的成功率。作者表示:“这具有误导性。”

  • “偏移”率: 当他们检查机器人的回答是否发生任何改变时,有 66% 的情况发生了改变。机器人确实被混淆了。
  • “劫持”率: 当他们检查机器人是否真的说出了黑客的秘密短语时,发生率仅为 0.75%
  • 逐字匹配率: 当他们检查机器人是否说出了黑客想要的确切词语(如特定 URL)时,发生率仅为 0.03%(在 6,615 次中仅发生 2 次)。

类比: 想象一位魔术师试图让一枚硬币消失。在 100 次尝试中,有 66 次硬币移动到了不同的位置(混淆)。但在 100 次尝试中,只有 1 次硬币真正完全消失(劫持)。先前的报告说:“看!硬币在 66% 的情况下移动了!这位魔术师太厉害了!”而作者们则说:“等等,硬币并没有消失,它只是移动了。这位魔术师并没有我们想象的那么强大。”

4. 为什么某些照片比其他照片效果更好

研究人员注意到,机器人确实说出秘密短语的少数情况,仅发生在特定类型的照片上。

  • 自然照片: 如果照片是狗或猫,机器人几乎从不说出秘密短语。
  • 文档照片: 如果照片是网站截图、代码编辑器或账单,机器人说出秘密短语的可能性稍高。
  • 原因? 作者解释说,如果照片本身看起来像带有文字的文档(如账单),机器人已经预期要阅读文字。不可见的噪点只是引导机器人去阅读“错误”的文字(黑客的短语),而不是真实的文字。如果照片是一只狗,机器人预期描述毛发和爪子,因此秘密短语无法融入这个叙述中。

5. “超级抗干扰”机器人

最有趣的发现之一涉及一个名为 BLIP-2 的特定机器人模型。

  • 当其他三个机器人 100% 被不可见噪点混淆时,BLIP-2 甚至没有察觉
  • 即使研究人员尝试利用 BLIP-2 来协助构建攻击,该攻击随后在面对它时也完全失败。
  • 原因: 作者推测 BLIP-2 的“大脑”中存在一个“瓶颈”。它在读取图像之前,会将图像压缩成一个微小的摘要。这种压缩就像一个过滤器,在机器人甚至看到噪点之前就将其抹除。这就像试图透过一堵厚墙低语秘密;其他机器人听到了,但 BLIP-2 的墙太坚固了。

总结

论文得出结论,虽然不可见攻击确实可以混淆视觉 - 语言模型(使其给出奇怪或不同的答案),但它们极难强迫模型说出特定的危险短语。

"90 倍差距”意味着,如果你担心机器人被诱骗说出特定 URL 或密码,你可能高估了这种危险。机器人更有可能只是感到困惑并说出一些愚蠢的话,而不是顺从地执行黑客的命令。

核心要点: 不要为你可能读到的"60-80% 成功率”感到恐慌。这个数字主要统计的是“混淆”,而非“劫持”。这些特定攻击的真实危险程度远低于头条新闻所暗示的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →