Breaking the weakest link to evade vision language models
本文提出了一种计算高效的基于梯度的攻击方法,该方法仅针对视觉语言模型(VLMs)的视觉编码器,旨在生成能够破坏或劫持模型文本解释的不可感知对抗扰动,从而揭示了当前多模态人工智能系统存在的重大漏洞。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在人工智能飞速发展的格局中,出现了一类能够同时观察并说话的新型系统。这些被称为视觉语言模型的机器,旨在通过观察图像来描述其所见,或回答关于照片的问题。它们的工作原理是获取一张图片,将其视觉细节转换为数学表示,然后将该信息传递给构建句子的语言引擎。这项技术驱动着从自动化图像说明到自动驾驶汽车安全系统的一切应用,在视觉世界与人类交流之间架起了一座桥梁。然而,正如任何复杂的系统都有弱点一样,这些模型也并非对操纵免疫。研究人员早已知晓,数字图像可以被以肉眼无法察觉的方式进行修改,却足以迷惑计算机的感知。现在的疑问是,这些结合了视觉与语言的高级新型系统,是否比它们所取代的旧型、简单模型更加安全。
来自 Thales 和 ESILV 的一个研究小组致力于测试这些视觉语言模型在面对此类隐藏操纵时的耐用性。他们的目标是观察是否能诱骗这些模型看到并不存在的东西,或者让它们忽略清晰可见的事物。他们专注于两种特定的“诡计”。第一种是广泛的干扰,即攻击者仅仅希望使模型产生混乱,使其无法正确描述图像。第二种是精确的欺骗,即攻击者希望模型将一个与照片中物体完全不同的特定物体描述出来。例如,他们想看看是否能让一个模型在看一张坦克照片时,却自信地将其描述为一辆救护车。为此,他们并没有试图一次性破坏整个系统,而是寻找了通往漏洞的最有效路径:即系统首先处理图像的部分。
研究人员发现,他们可以通过仅针对模型的视觉组件而非整个语言处理机制来生成这些具有欺骗性的图像。这种方法被证明是效率极高的神来之笔。以往的方法需要计算机通过模型庞大且复杂的语言大脑来计算变化——这一过程缓慢且需要巨大的计算能力;而新方法仅需调整初始的图像处理阶段。通过这样做,研究人员大幅降低了攻击所需的内存,并将创建单张欺骗性图像所需的时间从超过 20 分钟缩短到了大约 160 秒。这种高效性意味着他们可以在多种现代开源模型上测试他们的想法,包括名为 Qwen、Granite、FastVLM 和 Phi 的系统。
实验结果令人震惊,揭示了这些模型理解世界方式的深度脆弱性。当研究人员尝试单纯地干扰模型,使其无法正确描述图像时,攻击几乎在所有情况下都取得了成功。即使只是对像素进行了微小的、肉眼不可见的修改,模型在超过 93% 的情况下都无法识别图像内容。在某些案例中,几乎每一次尝试都成功了,这表明这些模型所依赖的视觉表示极其不稳定。当研究人员尝试更困难的任务——强迫模型看到一个特定的错误物体时,结果因模型而异,但依然令人担忧。其中一个模型 Granite-Vision 在近一半的尝试中都被误导将坦克描述为救护车,尽管这两个物体完全不相关。另一个模型 Phi-3.5-Vision 则表现出更强的抵抗力,很少落入陷阱,但大多数受测系统都显示出了显著的弱点。
这些发现表明,当前一代视觉语言模型极易受到操纵,特别是当目标是破坏它们对图像的理解时。这样一个强大的系统竟然会被人类难以察觉的微小变化所误导,这一事实引发了人们对其在现实世界中可靠性的严重质疑。如果自动驾驶汽车或医学影像系统依赖于一个容易被误导从而错误识别车辆或病症的模型,后果可能会非常严重。这项研究并未声称已经解决了这些系统的安全性问题,但它显然已经绘制出了危险的地形图。通过展示最薄弱的环节通常是初始视觉处理阶段,研究人员为未来的防御提供了明确的目标。这项工作强调,随着这些模型越来越多地集成到关键基础设施中,确保它们能够抵御此类微妙且隐形的攻击,不仅是一个技术挑战,更是安全性的基本要求。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。