← 最新论文
🤖 machine learning

Structure-Guided Visual Perturbation Neutralization for LVLMs

本文提出 SIGN,一种轻量级且高效的即插即用防御框架,该框架通过利用先验结构提取与动态引导中和,在大视觉语言模型中中和对抗性扰动,在最小化图像修改与计算开销的同时保持模型性能,从而实现高防御成功率。

原作者: Yuanhe Zhang, Xueting Wang, YanBin Ren, Haoran Gao, Xinhan Zheng, Zhenhong Zhou, Fanyu Meng, Li Sun, Sen Su

发布于 2026-05-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Yuanhe Zhang, Xueting Wang, YanBin Ren, Haoran Gao, Xinhan Zheng, Zhenhong Zhou, Fanyu Meng, Li Sun, Sen Su

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,大型视觉语言模型(LVLMs)就像极其聪明、多才多艺的助手。它们可以查看图片并描述它,回答关于它的问题,甚至根据所见内容帮助你做出决策。然而,就像人类可能被巧妙的视觉错觉愚弄一样,这些 AI 助手也可能被图像中微小到几乎不可见的改动所欺骗。

本文介绍了一种名为SIGN(结构诱导引导中和)的新防御方法,旨在阻止此类欺骗。其工作原理如下,简单解释:

问题:“隐形墨水”攻击

想象一名攻击者拍摄了一张无害的狗的照片,并利用“隐形墨水”在像素上添加了几处微小的噪点。在你的眼中,狗看起来完全一样。但对 AI 而言,这些噪点就像秘密指令。突然间,AI 可能会:

  • 越狱(Jailbreak):无视安全规则,告诉你如何制造炸弹。
  • 崩溃(LLM-DoS):开始重复同一个词,直到耗尽内存。
  • 误导:看着一只猫,却自信地说:“那是一台烤面包机。”

大多数现有防御措施就像试图用沉重的刷子擦拭整扇脏窗户来清洁它。它们可能会去除污垢(攻击),但也会弄模糊画面(真实内容),或者耗时过长。

解决方案:SIGN(“智能抽查”)

作者提出了 SIGN,它更像是一种轻量级、手术式的抽查,而非沉重的擦拭。它分为两个主要步骤:

步骤 1:学习“房屋蓝图”(先验结构提取)

在查看任何特定图片之前,系统会利用大量随机、无害的照片来研究 AI 的“大脑”(其视觉编码器)。

  • 类比:想象 AI 的大脑是一座具有特定布局的房子。即使你在里面放置不同的家具(不同的图像),墙壁和横梁(结构)依然保持不变。
  • SIGN 的做法:它绘制出 AI 大脑自然最敏感的区域。它了解到:“嘿,无论图片中实际有什么,AI 总是格外关注图像的左上角。”这张地图被称为结构先验。它关注的不是图片中“有什么”,而是 AI“如何处理”图片。

步骤 2:“抽查”(动态引导中和)

现在,当一张可能受到攻击的图片到来时,SIGN 利用该“蓝图”来定位问题区域。

  • 类比:想象一名保安确切知道走廊里哪些地板吱吱作响最厉害(结构先验)。当有人走进来时,保安不会检查每一块地板。相反,他们会监听这些特定敏感区域是否发出吱吱声。
  • 工作原理
    1. SIGN 查看图像并询问:“这个像素与其邻居相比是否显得怪异?”(局部异常)。
    2. 它将该情况与“蓝图”进行比对:“这个怪异的像素是否位于 AI 自然敏感的区域?”(结构先验)。
    3. 如果两个问题的答案都是“是”,SIGN 就将该微小像素标记为可疑。
    4. 修复:SIGN 不会擦除整张图像,而只改变那个微小的可疑像素。它用周围像素的平均颜色替换它,从而有效地“修复”该点。

为什么 SIGN 与众不同?

本文声称 SIGN 在三个方面具有变革性:

  1. 对人眼不可见:它仅改变图像中约**0.5%**的像素。这就像改变沙滩上的一粒沙子。图像对人类来说看起来完全一样,但“隐形墨水”攻击已被消除。
  2. 速度极快:处理一张图像所需时间不到十分之一秒。它无需重新训练 AI 或运行繁重的计算。它是一个“即插即用”的工具。
  3. 不会破坏 AI:由于改动极小,AI 仍能完美执行其正常工作(如描述照片)。其他方法往往会过度干扰图像,导致 AI 困惑或停止工作。

结果

研究人员在多种不同的 AI 模型上测试了 SIGN,并针对四种不同类型的攻击进行了评估。

  • 成功率:它在超过**87%**的情况下成功阻止了攻击。
  • 安全性:它成功防止了 AI 给出有害回答、崩溃或错误识别物体。
  • 效率:它在保持图像与原始图像几乎 100% 一致的同时完成了所有这些工作。

总结

将 SIGN 想象为 AI 的智能门卫。它不是将所有人踢出俱乐部(屏蔽整张图像),也不是对每个人进行粗暴搜身(重度图像处理),而是利用俱乐部布局的地图,精准定位麻烦制造者藏身之处,并轻轻将他们推出,让派对(图像)保持原样。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →