想象一下,大型视觉语言模型(LVLMs)就像极其聪明、多才多艺的助手。它们可以查看图片并描述它,回答关于它的问题,甚至根据所见内容帮助你做出决策。然而,就像人类可能被巧妙的视觉错觉愚弄一样,这些 AI 助手也可能被图像中微小到几乎不可见的改动所欺骗。
本文介绍了一种名为SIGN(结构诱导引导中和)的新防御方法,旨在阻止此类欺骗。其工作原理如下,简单解释:
问题:“隐形墨水”攻击
想象一名攻击者拍摄了一张无害的狗的照片,并利用“隐形墨水”在像素上添加了几处微小的噪点。在你的眼中,狗看起来完全一样。但对 AI 而言,这些噪点就像秘密指令。突然间,AI 可能会:
- 越狱(Jailbreak):无视安全规则,告诉你如何制造炸弹。
- 崩溃(LLM-DoS):开始重复同一个词,直到耗尽内存。
- 误导:看着一只猫,却自信地说:“那是一台烤面包机。”
大多数现有防御措施就像试图用沉重的刷子擦拭整扇脏窗户来清洁它。它们可能会去除污垢(攻击),但也会弄模糊画面(真实内容),或者耗时过长。
解决方案:SIGN(“智能抽查”)
作者提出了 SIGN,它更像是一种轻量级、手术式的抽查,而非沉重的擦拭。它分为两个主要步骤:
步骤 1:学习“房屋蓝图”(先验结构提取)
在查看任何特定图片之前,系统会利用大量随机、无害的照片来研究 AI 的“大脑”(其视觉编码器)。
- 类比:想象 AI 的大脑是一座具有特定布局的房子。即使你在里面放置不同的家具(不同的图像),墙壁和横梁(结构)依然保持不变。
- SIGN 的做法:它绘制出 AI 大脑自然最敏感的区域。它了解到:“嘿,无论图片中实际有什么,AI 总是格外关注图像的左上角。”这张地图被称为结构先验。它关注的不是图片中“有什么”,而是 AI“如何处理”图片。
步骤 2:“抽查”(动态引导中和)
现在,当一张可能受到攻击的图片到来时,SIGN 利用该“蓝图”来定位问题区域。
- 类比:想象一名保安确切知道走廊里哪些地板吱吱作响最厉害(结构先验)。当有人走进来时,保安不会检查每一块地板。相反,他们会监听这些特定敏感区域是否发出吱吱声。
- 工作原理:
- SIGN 查看图像并询问:“这个像素与其邻居相比是否显得怪异?”(局部异常)。
- 它将该情况与“蓝图”进行比对:“这个怪异的像素是否位于 AI 自然敏感的区域?”(结构先验)。
- 如果两个问题的答案都是“是”,SIGN 就将该微小像素标记为可疑。
- 修复:SIGN 不会擦除整张图像,而只改变那个微小的可疑像素。它用周围像素的平均颜色替换它,从而有效地“修复”该点。
为什么 SIGN 与众不同?
本文声称 SIGN 在三个方面具有变革性:
- 对人眼不可见:它仅改变图像中约**0.5%**的像素。这就像改变沙滩上的一粒沙子。图像对人类来说看起来完全一样,但“隐形墨水”攻击已被消除。
- 速度极快:处理一张图像所需时间不到十分之一秒。它无需重新训练 AI 或运行繁重的计算。它是一个“即插即用”的工具。
- 不会破坏 AI:由于改动极小,AI 仍能完美执行其正常工作(如描述照片)。其他方法往往会过度干扰图像,导致 AI 困惑或停止工作。
结果
研究人员在多种不同的 AI 模型上测试了 SIGN,并针对四种不同类型的攻击进行了评估。
- 成功率:它在超过**87%**的情况下成功阻止了攻击。
- 安全性:它成功防止了 AI 给出有害回答、崩溃或错误识别物体。
- 效率:它在保持图像与原始图像几乎 100% 一致的同时完成了所有这些工作。
总结
将 SIGN 想象为 AI 的智能门卫。它不是将所有人踢出俱乐部(屏蔽整张图像),也不是对每个人进行粗暴搜身(重度图像处理),而是利用俱乐部布局的地图,精准定位麻烦制造者藏身之处,并轻轻将他们推出,让派对(图像)保持原样。
技术摘要:面向大型视觉语言模型的“结构诱导引导中和”(SIGN)
1. 问题陈述
大型视觉语言模型(LVLMs)利用图像输入来感知细粒度的视觉信息,但这一能力也引入了像素级的攻击面。添加到输入图像中的对抗性扰动可能引发模型的不安全行为,包括越狱(生成有害内容)、LLM-DoS(诱导重复或退化的生成)以及误分类。
现有的防御策略在 LVLM 背景下面临显著局限:
- 传统计算机视觉(CV)防御:像图像去噪这样的方法通常是为单模态分类器设计的,未能考虑 LVLM 所需的跨模态对齐,导致性能下降。
- LVLM 专用防御:当前针对 LVLM 定制的方法通常依赖区域掩蔽或基于扩散的恢复。这些方法经常需要对图像进行大量修改,从而破坏良性视觉内容,并引入可观的计算开销,损害推理效率。
因此,迫切需要一种架构感知、轻量级且能够在最小化修改输入图像的同时抑制对抗信号并保持良性任务性能的防御框架。
2. 方法论:结构诱导引导中和(SIGN)
作者提出了SIGN,这是一个轻量级、即插即用的防御框架,无需重新训练模型即可运行。它主要在两个阶段运作:先验结构提取和动态引导中和。
2.1 先验结构提取
该阶段估计一个“结构先验”,用于捕捉 LVLM 视觉编码器固有的空间响应分布。
- 动机:作者观察到,对于良性输入,视觉编码器在不同样本间表现出稳定的、位置依赖的响应模式。虽然语义内容各异,但聚合后的编码器响应揭示了一致的空间偏差。
- 结构聚合:使用无标签图像集,该方法计算所有层和样本中补丁(patch)令牌响应的 L2 范数。这些标量响应被平均以生成一维结构分布 s。
- 先验构建:该分布根据目标 LVLM 的标准令牌顺序重新排列,形成二维结构先验图(S)。该图表征了编码器固有的结构响应偏差,而非语义内容,作为识别敏感区域的指南。
2.2 动态引导中和
给定一张被攻击的图像,该阶段将结构先验转换为输入自适应的引导图,以抑制扰动。
- 局部异常表征:结构先验 S 通过双线性插值映射到输入图像的像素空间,生成像素空间图 P(u)。同时,通过测量每个像素与其局部邻域中值的偏差,计算局部异常分数 A(u)。
- 干预评分:综合干预分数 q(u) 计算为加权线性融合:q(u)=λP(u)+(1−λ)A(u)。这将编码器的结构偏差与特定实例的异常证据相结合。
- 稀疏中和:像素按其干预分数进行排序。为确保效率和局部性,应用邻域约束:仅当局部窗口内被选中的像素数量不超过预算 kρ 时,才选择该像素进行干预。
- 恢复:选中的像素被替换为局部窗口内未选中邻居的平均值。这导致了对对抗性扰动的稀疏且局部一致的中和。
3. 主要贡献
- 结构偏差的发现:本文揭示了 LVLM 视觉编码器中存在一种稳定的结构响应偏差,该偏差在很大程度上独立于数据集语义。这种偏差为对抗防御提供了模型级别的先验。
- SIGN 框架:一种利用该结构先验来引导稀疏像素级干预的轻量级防御机制。它无需模型微调,可作为即插即用模块运行。
- 效率与有效性:该方法以最小的图像修改(0.5% 的像素)和较低的延迟(每张图像约 0.16 秒)实现了高防御成功率,优于依赖繁重重建或大规模掩蔽的现有基线方法。
4. 实验结果
作者在六个 LVLM(包括 LLaVA、InstructBLIP 和 Qwen-VL)和四种代表性攻击生成器(Visual-Adv、Con-Ins、RECITE、CroPA++)上评估了 SIGN。
- 防御成功率(DSR):SIGN 在各种攻击目标(越狱、LLM-DoS、误导)下的平均防御成功率超过87%。
- 最小化修改:该防御仅需修改**0.5%**的图像像素,显著低于基于掩蔽的防御(例如 AMIA 约为 18.75%)或全图抑制方法。
- 效率:防御构建时间平均每张图像为0.16 秒,与模型的推理时间相比引入了可忽略不计的开销。
- 效用保持:SIGN 保持了良性任务性能,任务成功率与原始输入几乎相同。原始与防御后视觉表征之间的余弦相似度保持在0.99以上,表明良性视觉语义得到了 largely 保留。
- 先验的鲁棒性:实验表明,结构先验在不同源数据集(如 ImageNet、CelebA)上是稳定的,并且可以从少至 10 个无标签样本中可靠地估计。
5. 意义与主张
本文主张,SIGN 提供了一种实用且轻量级的替代方案,取代了那些需要昂贵模型训练或繁重图像重建的防御方法。通过利用视觉编码器的固有结构属性,SIGN 证明了可以在不牺牲推理质量或效率的情况下实现鲁棒的 LVLM 防御。
作者将其工作定位为强调利用视觉编码器本身进行高效对抗保护的潜力。他们指出,虽然他们的评估涵盖了代表性攻击,但 SIGN 的动态、输入自适应特性使其难以被现有的攻击配方优化对抗,尽管他们承认针对该特定防御机制的完全自适应攻击仍是未来研究的领域。该工作得出结论,利用编码器级别的结构先验是实现鲁棒、轻量级 LVLM 防御的可行路径。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。