← 最新论文
💬 NLP

Exploiting Vision Encoder Vulnerabilities for Universal Adversarial Perturbations on Large Vision-Language Models

本文介绍了 VEV-UAP,这是一个高效且任务无关的攻击框架,它利用了大型视觉语言模型(LVLM)视觉编码器中层注意力机制价值组件内结构性集中的漏洞,从而生成无需文本输入即可在不同模型和任务中实现最先进成功率的通用对抗扰动。

原作者: Hee-Seon Kim, Minbeom Kim, Seokil Ham, Changick Kim

发布于 2026-06-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Hee-Seon Kim, Minbeom Kim, Seokil Ham, Changick Kim

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,将一个大型视觉语言模型 (LVLM) 看作是一个正在共同解决谜题的高智商双人团队。

  • 眼睛 (视觉编码器): 这位搭档观察图片并描述他们所看到的内容。
  • 大脑 (语言模型): 这位搭档倾听描述,并写出最终答案。

长期以来,研究人员认为,如果要诱导这个团队给出错误答案,你必须干扰整个“眼睛”搭档。他们假设“眼睛”的每个部分都同样重要且同样容易被迷惑。他们尝试在整个图像中加入一点点“静态噪声”,希望能以此迷惑整个系统。

论文的大发现:“弱点环节”
本文作者意识到,“眼睛”搭档并不是一个统一的肌肉块;它更像是一个复杂的工厂,拥有许多不同的工作站。他们调查了工厂车间,发现了一些令人惊讶的事实:并非所有的工作站都同样脆弱。

他们发现,中间的工作站,特别是那些负责承载实际内容(称为“数值向量/value vectors”)的工作站,是弱点环节。

  • 类比: 想象一下这个工厂有一条传送带。早期的工作站只是在进行分类(低级细节),而晚期的工作站则在进行最后的打包(高级摘要)。中间的工作站则是箱子被打开、检查以及决定其内容的环节。
  • 研究人员发现,如果你干扰这个特定中间阶段的内容,整个工厂就会崩溃。如果你干扰分类或打包过程,工厂通常会忽略它并继续工作。

新策略:VEV-UAP
基于此,该团队创建了一种新的攻击方法,称为 VEV-UAP。与其试图迷惑整个“眼睛”搭档,不如手术式地精准打击那些中间的内容承载站

其运作方式用简单术语解释如下:

  1. 寻找弱点: 他们分析了模型,并精准定位了“内容”最为脆弱的中间层。
  2. 通用的“故障”: 他们创建了一个单一的、微小的噪声模式(一种“通用扰动”)。可以把它想象成电视屏幕上的一种特定类型的静电噪声。
  3. 神奇之处: 当这种单一模式被添加到任何图像(猫、汽车、日落)中时,它会专门干扰那些中间的“内容”工作站。
  4. 结果: “眼睛”搭档对图像实际是什么产生了困惑。他们向“大脑”传递了一个混乱、错误的描述。“大脑”听到这些胡言乱语后,写出了完全错误的答案。

为什么这意义重大

  • 一劳永逸: 你不需要为每一张图片都创建一个新的把戏。一个微小的“故障”就能适用于成千上万张照片。
  • 速度极快: 因为他们只针对弱势的中间部位而忽略了模型的其余部分,所以他们不需要进行大量的数学计算。这就像是用一把特定的钥匙去开锁,而不是试图拆掉整扇门。
  • 具有传染性: 如果两个不同的 AI 团队使用同一个“眼睛”搭档(即使他们有不同的“大脑”),这个单一的故障对两者都有效。这就像是一种针对特定器官的病毒;如果两个人都拥有那个器官,即使他们的身体不同,也会同时生病。

当它奏效时会发生什么?
论文表明,当使用这种攻击时,AI 的回答会变得混乱。

  • 它可能不会说“一只红色的船”,而是说“这张图片是一个木头书桌”。
  • 它可能不会回答问题,而只是不断重复单词“the”。
  • 它有效地切断了 AI 所见与所说之间的联系。

底线
这篇论文证明了 AI 模型并非在所有地方都同样强大。它们在中间层拥有特定的、隐藏的“瓶颈”。通过寻找并针对这些点,你可以创造一种高效的、通用的把戏,在无需预先知道具体问题或答案的情况下,使 AI 的视觉产生混乱,并使其在几乎任何任务中失败。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →