← 最新论文
💻 computer science

Misguiding BLIP with Adversarial Patches: Multi-level Attacks with Cross-modal Attention Graphs in BLIP

本文提出了 MAGA,一种通过构建和破坏跨模态攻击图来利用 BLIP 模型中跨模态注意力漏洞的新型多层级攻击框架,从而导致显著的性能下降以及在语言上合理但在视觉上不一致的对抗性标题。

原作者: yingying hu, minghao mo, peng zhang

发布于 2026-09-24
📖 1 分钟阅读☕ 轻松阅读

原作者: yingying hu, minghao mo, peng zhang

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在快速发展的人工智能领域,新一代计算机系统已经出现,它们能够同时进行视觉观察与文本阅读。这些被称为视觉语言模型的系统,通过数百万对图像和文本进行训练,学习如何理解一张狗的照片与“狗”这个词之间的关系。它们已成为描述照片、回答关于场景的问题以及使用自然语言搜索图像等工具的基础。为了使这些机器高效工作,它们必须不断地将特定的词汇与图像的特定部分联系起来,决定哪些像素属于“马”的概念,哪些属于“草”。这一过程依赖于一种复杂的内部机制,该机制就像一张动态地图,将句子中的每一个词与照片中相关的视觉细节相连。如果这种连接断裂,机器就会失去理解所见内容的能力,可能导致困惑或错误的描述。

广州大学的研究人员发现,这些系统在维持这些连接方面存在一个细微的弱点。他们发现,通过在图像上放置一个设计精巧的小型图案,就可以诱导模型重新排列其词语与图像之间的内部映射图。这种图案看起来只是一个简单的颜色或纹理块,并不需要是复杂的伪装。相反,它作为一个沉默的信号,导致模型忽略图像中最重要的部分,转而关注无关的背景区域。发生这种情况时,模型仍然可以流利且符合语法地说话,但它所说的话不再与图片相匹配。它可能会在明明显示一匹马的图像中描述一片花田,或者在照片中仅包含一个客厅的情况下,声称一个人正拿着一碗拉面。研究人员将这种现象称为“自然但错误”(natural but wrong),强调了一种即便机器的信心依然很高,其理解力却已崩溃的脆弱性。

该团队开发了一种创建这些欺骗性图案的方法,并将其命名为“多层级攻击”。与以往试图简单模糊图像或扰乱颜色的尝试不同,这种方法针对的是模型连接文本与视觉的具体方式。研究人员构建了一个系统来绘制词语与图像部分之间连接强度的图谱,本质上是创建一个展示哪些词正在关注哪些像素的图表。随后,他们训练其攻击算法,以最大化“干净图像的图谱”与“带有补丁的同一图像的图谱”之间的差异。通过这种方式,他们迫使模型切断关键词与其视觉证据之间的强连接,同时创造出与随机背景区域的新的、虚假的连接。这一过程结合了其他目标,以确保攻击保持隐蔽,并且生成的文本听起来自然,尽管其内容在事实上是错误的。

他们的实验结果令人震惊。当他们将生成的补丁应用于标准数据集中的图像时,模型的图像匹配成功率大幅下降。在测试系统将句子与正确图片进行匹配的任务中,其成功率从超过百分之七十降至仅为百分之九。这种攻击非常有效,甚至在处理系统从未见过的图像时依然奏效,这表明该缺陷是模型处理信息的根本性问题,而非针对特定图片的简单错误。在模型需要描述图像的任务中,其描述质量骤降。系统的准确性得分显著下降,但其生成的句子在语法上依然正确且具有多样性,避免了通常预示系统故障的重复性胡言乱语。这证实了模型不仅是在说话失败,它是在自信地描述一个并不存在的现实。

研究人员还在视觉问答任务(例如计数物体或识别空间关系)上测试了该系统。攻击导致模型在这些逻辑任务上也表现不佳,成功率从接近百分之八十降至仅为百分之十二。在许多情况下,模型会对关于狗的问题回答一只猫,或者在只有一只动物的情况下声时有三只动物。使这些失败尤为显著的是,模型的内部注意力图被完全重构了。可视化结果显示,原本应该关注照片主体的模型,开始忽略主体,转而关注空旷的天空或草地。补丁并没有遮挡物体,它只是让模型“视而不见”。

这项工作表明,当前这一代强大的人工智能系统比此前认为的更加脆弱。早期的安全测试侧重于图像是否能被改造成在人类眼中看起来像另一种东西,而这项研究表明,危险在于机器如何组织其自身的理解。攻击并不需要诱骗机器看到不同的物体,它只需要让机器相信它看到的物体是不相关的。通过破坏连接词语与像素的内部图谱,研究人员证明了一个静态的小型图案就能引发跨不同任务的连锁错误,涵盖从图像搜索到回答复杂问题。研究结论指出,随着这些模型越来越多地融入日常生活,理解并保护这些内部连接图谱将与保护图像本身同样重要。研究结果提醒人们,即使是最先进的系统,也可能不是因为改变了它们所看到的,而是因为改变了它们看待所见物的方式而被误导。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →