← 最新论文
🤖 machine learning

On Adversarial Vulnerability of Vision-Language Models through the Lens of Intermediate Spectral Subspaces

本文介绍了一种白盒谱子空间引导攻击(SSGRA),该攻击利用中间表示与右下奇异向量子空间的对齐特性,来揭示并增强基于 Transformer 的视觉-语言模型的对抗脆弱性。

原作者: Chethan Krishnamurthy Ramanaik, Tobias Callies, Michael Hecht, Eirini Ntoutsi

发布于 2026-07-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Chethan Krishnamurthy Ramanaik, Tobias Callies, Michael Hecht, Eirini Ntoutsi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,将视觉语言模型(VLM)视为一个高度复杂的翻译官。你给它看一张图片,它便描述所见之物。但就像任何复杂的机器一样,它有一个隐秘的弱点:如果你对图片进行微小的、肉眼不可见的调整,这个翻译官突然就会开始胡言乱语。

这篇论文研究了为什么这些机器如此容易被欺骗,但作者并没有去研究图片本身或最终答案,而是观察了在系统中传递信息的内部“齿轮”与“管道”。他们使用了一个数学概念——谱分析(spectral analysis),并用水流通过不同宽度的管道这一简单的类比来解释它。

核心思想:“漏水的管道”

把 AI 内部的信息想象成在系列管道中流动的流水。

  • 宽阔的管道(顶层奇异向量/Top Singular Vectors): 这些是强壮的主通道,最重要的信息可以轻松流过。如果你在这里推水,水流会既大声又清晰地通过。
  • 细小、堵塞的管道(底层奇异向量/Bottom Singular Vectors): 这些是狭窄、几乎被堵塞的通道。如果你试图在这里推水,水流会立即被挤压、丢失或“衰减”(attenuated,即变弱)。

作者发现,当黑客试图愚弄这些 AI 模型时,攻击会自然而然地将信息推向这些细小、堵塞的管道。一旦信息卡在这些狭窄的通道中,模型就会失去理解图像的能力,从而开始产生幻觉或给出错误的答案。

新型攻击方法:“造堵塞者”(SSGRA)

论文提出了一种名为 SSGRA(谱子空间引导表示攻击/Spectral Subspace Guided Representation Attack)的新型黑客手段。

  • 旧的黑客方法: 以前的方法试图通过让图片看起来略有不同,或者干扰最终答案来迷惑 AI。它们就像是向机器扔石头让它踉跄一下。
  • 新方法 (SSGRA): 这种方法更聪明。它准确地知道哪些“管道”是最脆弱的。它刻意强迫 AI 通过那些细小、堵塞的管道来处理图像。
    • 类比: 想象你想让一家玩具工厂停止生产。与其对着工人喊叫(旧方法),不如专门堵塞组装最脆弱零件的那条传送带。工厂不仅会踉跄,还会彻底瘫痪,因为核心部件无法通过。

研究发现

研究人员在三种流行的 AI 模型(Qwen、LLaVA 和 Gemma)上进行了测试。结果如下:

  1. 效果更好: 通过刻意堵塞那些“被堵塞的管道”,他们这种新的攻击方法在让 AI 失效方面比以往的方法更成功。它能通过对图像进行极小的、肉眼不可见的修改,将对“狗”的清晰描述变成类似“绿色黏液”之类的胡话。
  2. AI 会自然发生这种情况: 研究人员发现,即使没有这种“聪明”的新攻击手段,当你试图愚弄 AI 时,数学逻辑也会自然地将信息推向这些脆弱的、被堵塞的管道。AI 的结构天生就容易在这种特定方式下产生漏洞。
  3. 并非所有 AI 都一样: 不同模型的“堵塞管道”数量不同。拥有最多堵塞管道的模型(Qwen)最容易被攻破。拥有较少堵塞管道的模型(Gemma)较难被攻破,但仍然存在漏洞。

总结

论文得出结论,为了让这些 AI 模型更安全(更具鲁棒性),我们不应仅仅关注加强“宽阔的管道”(网络的强壮部分)。我们也需要修复或保护那些**“堵塞的管道”**(近乎为零或微弱的方向)。

如果我们能阻止信息在这些微小、脆弱的通道中丢失,AI 可能会变得更加难以被欺骗。

简而言之: 作者发现了一种通过强迫 AI 使用其最薄弱的内部路径来破坏 AI 模型的新方法,并指出修复这些特定的薄弱路径是使其变得更强大的关键。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →