想象一下,你是一名高安全性艺术馆的保安。你的职责是发现试图潜入并窃取画作分类秘密(即 AI 模型所做的事情)的小偷。
在 AI 的世界里,这些“小偷”被称为对抗性攻击者(adversarial attackers)。他们并不用撬棍破门,而是向 AI 发送成千上万张经过微调的图像,一遍又一遍地询问:“这是什么?”通过分析 AI 的回答,他们能慢慢摸索出如何误导 AI,让 AI 把一张猫的照片误认为是狗。
这篇论文介绍了一种更聪明的方法,让保安能更好地抓住这些小偷。以下是其工作原理的拆解,通过简单的概念进行说明:
旧方法:“貌似”检测器
以前的安全系统(例如名为 Blacklight 的系统)就像一个简单的“貌似”检测器。
- 逻辑: 小偷必须发送非常相似的图像来欺骗 AI。因此,如果保安看到 50 张几乎完全相同的图像,就会断定:“啊哈!这是小偷!”
- 问题: 这个系统很容易被愚弄。
- 误报: 想象一个正在拍摄静止场景的监控摄像头。每一帧看起来都完全一样。旧系统会大喊“有小偷!”——而那其实只是一个无害的监控画面。
- “魔法面具”: 论文发现,小偷可以戴上“魔法面具”。他们可以在图像中加入微小的、肉眼不可见的噪声。在旧系统的快速检查下,这些图像看起来完全不同(因此不会触发警报),但对于真正的 AI 来说,它们仍然非常相似。小偷就这样溜过了保安。
新方案:两阶段侦探
作者提出了一个更难被愚弄的两步侦探流程。
第一阶段:“草图”检查(相似性)
新系统不再仅仅检查图像看起来是否相同,而是使用了加盐随机量化(Salted Randomized Quantization)。
- 类比: 想象旧系统像是用肉眼对比两张照片。新系统则像是戴上了一副每次观察时都会随机改变颜色的护目镜。
- 作用: 即便小偷试图利用他们的“魔法面具”让图像看起来不同,这种随机变化的护目镜也会让他们几乎无法预测系统会如何看待图像。这就像是试图绕过一个每秒钟都在改变游戏规则的守卫。
- 结果: 如果一组图像通过了这项初步检查且看起来可疑地相似,它们就会被标记以进行第二次审查。
第二阶段:“心跳”检查(软标签时序性)
这是该论文最大的创新点。系统不仅观察图像,还会倾听 AI 随时间变化的**“思维过程”**。
- 类比:
- 无害访客(良性): 如果你向 AI 展示一系列猫、狗和汽车的照片,AI 的置信度水平(其“软标签”)会随机跳动。这就像一个人在画廊里走动,看着不同的东西,没有任何规律。
- 小偷(对抗性): 小偷正在寻找墙上的一个特定“裂缝”。他们问:“这是一只猫吗?”AI 说“90% 是猫”。小偷稍微调整图像并再次询问。AI 说“85% 是猫”。他们不断调整。AI 的置信度水平会随着他们接近目标而稳定地向一个方向漂移。
- 检测: 新系统使用一种统计测试(称为 Ljung-Box 测试)来监听 AI 回答中是否存在这种稳定的“漂移”或“心跳”。
- 如果回答是随机的?安全。(即使图像看起来很相似,比如监控摄像头画面也是如此)。
- 如果回答显示出一种稳定的、可疑的趋势?检测到小偷。
为什么这很重要
论文测试了这种新侦探对目前最聪明的“小偷”(如 Boundary Attack、HSJA 和 Square Attack 等攻击手段)的应对能力。
- 得分: 新系统抓住了 100% 的小偷(真阳性率)。
- 错误: 它只有约 6% 的时间会犯错(误报无害的人),而旧系统误报率高达 42%。
- “魔法面具”防御: 当小偷试图使用他们的“魔法面具”(自适应攻击)来绕过系统时,新系统迫使他们在图像中加入过多的噪声,导致图像变成了毫无意义的垃圾。小偷如果不毁掉自己的攻击,就无法获胜。
总结
这篇论文的核心观点是:“不要只看问题是否相似;要倾听答案随时间变化的方式。通过在我们的检查中加入一点随机性,并监听小偷策略的‘心跳’,我们可以在不误捕无害监控摄像头的条件下抓住他们。”
技术摘要:利用软标签的时序性与鲁棒相似度近似增强对对抗性攻击的状态化检测
问题陈述
深度神经网络(DNN)极易受到黑盒对抗性攻击的影响,在这些攻击中,攻击者通过精心设计的不可察觉扰动来导致模型分类错误。此类攻击通常依赖于频繁且具有适应性的查询,以探测模型的决策边界。**状态化检测(Stateful Detection, SD)**是一种旨在识别此类攻击的防御机制,通过检测相似查询的序列来识别攻击。
然而,现有的 SD 方法(如 Blacklight、PIHA)面临两个关键局限性:
- 易受近似攻击的影响: SD 系统通常使用计算高效的近似方法(如哈希、随机量化)来近似复杂的相似度度量,以检测相似查询。作者观察到,这些近似方法可以被利用。攻击者可以设计出在近似函数下显得不相似、但在预期度量下依然接近的查询,从而规避检测。论文将此称为针对相似度函数的“对抗性攻击”。
- 高误报率(FPR): 为了降低误报率,SD 系统通常会设置较高的相似度阈值。然而,这使得它们容易受到适应性探测攻击(例如,基于 Oracle 引导的自适应拒绝采样,即 OARS)的影响,这类攻击通过添加随机扰动来降低查询相似度,使其低于阈值。此外,具有高相似度的良性序列(如 CCTV 静止画面)也经常被误判为恶意行为。
方法论
作者提出了一个两阶段检测框架,该框架结合了鲁棒的查询相似度近似技术与软标签(soft-labels)的时序分析。
第一阶段:鲁棒相似度检测
第一阶段利用**加盐随机量化(salted randomized quantization)**方法来近似预期的相似度度量,从而识别可能是相似查询的子序列。
- 预期度量: 论文定义了一个“预期相似度函数”(D),该函数基于两幅图像之间子图像(滑动窗口)的最小距离。
- 近似漏洞: 标准近似方法(如 Blacklight 中的方法)仅采样部分窗口。作者证明,攻击者可以通过引入微小的失真来减少这些采样窗口的重叠,从而有效地制造出一个 (ϵ,δ)-对抗样本,即真实的距离很小 (≤ϵ),但近似距离很大 (≥δ)。
- 提出的解决方案: 为了缓解这一问题,该框架采用了加盐随机量化。
- 在量化之前对输入应用一个随机盐值(salt)。
- 根据伯努利分布随机地向上或向下取整。
- 这引入了对攻击者隐藏的随机性,使得攻击者难以逆向工程量化边界,或设计特定的扰动来规避哈希匹配。
- 通过检查在量化查询中随机选择的、互不重叠的窗口中,是否有足够数量的窗口与 Bloom 过滤器数据库中先前看到的窗口相匹配,来确定相似度。
第二阶段:软标签的时序相关性
在第一阶段被标记为相似的查询将被传递到第二阶段,以区分良性相似序列(如视频帧)与对抗性序列。
- 观察: 对抗性攻击会根据之前的模型输出(软标签)生成具有适应性的查询,从而在软标签序列中产生时序相关性。相比之下,良性相似序列(如 CCTV 静止画面)在时间上通常表现出独立的软标签。
- 机制: 该框架提取子序列中第一个查询所预测类别的概率分布(软标签)。随后,它对该序列应用 Ljung–Box 检验以检测序列相关性。
- 决策: 如果 Ljung–Box 检验的 p 值低于预设阈值,则该序列被标记为对抗性序列。这一阶段有效地过滤了第一阶段产生的误报。
核心贡献
- 对时序行为的观察: 作者发现对抗性查询序列在软标签方面表现出独特的时序相关性,可以利用这一点来区分对抗性序列与良性相似查询。
- 针对相似度度量的对抗性攻击: 论文引入了针对相似度近似函数的“对抗性攻击”概念。作者展示了一种轻量级的攻击方式,可以攻击 Blacklight 的相似度度量,使攻击者无需进行大规模探测即可规避检测。
- 鲁棒相似度近似: 作者提出了加盐随机量化作为一种鲁棒的近似方法。通过利用随机性隐藏量化边界,防止了攻击者通过设计特定输入来绕过相似度检查,同时保持了检测精度。
- 两阶段框架: 一种新型检测框架,通过在第一阶段降低相似度阈值(增加敏感度),并利用第二阶段的软标签时序分析来过滤误报。这种方法缓解了误报率(FPR)与对抗性攻击脆弱性之间的权衡。
- 实证验证: 在 CIFAR-10 和 ImageNet 数据集上针对五种黑盒攻击进行了全面的评估。
实验结果
该框架在 CIFAR-10 和 ImageNet 数据集上针对五种黑盒攻击(Boundary Attack (BA)、Hop Skip Jump Attack (HSJA)、带有频率混合的 HSJA、Square Attack (SA) 以及 SimBA)进行了评估。同时,它也针对适应性攻击(OARS)进行了测试。
- 真阳性率(TPR): 在所有测试的攻击和两个数据集上,该框架均实现了 1.00 的 TPR,优于或达到了经过调优的 Blacklight(其 TPR 在 0.42 到 0.97 之间)。
- 误报率(FPR): 该框架保持了极低的误报率,最高不超过 0.06(相比之下,其他 SOTA SD 方法为 0.42)。这归功于第二阶段成功过滤掉了良性相似序列(如摄像头静止画面)。
- 对适应性攻击的鲁棒性:
- 当针对增强型 OARS 攻击进行测试时,攻击者必须引入大量的噪声才能绕过第一阶段。
- 至关重要的是,在由该框架防御的情况下,没有任何 OARS 增强攻击(HSJA 或 Boundary Attack)能在 50,000 次查询内生成有效的对抗样本,而它们在面对 Blacklight 时却能成功。
- 效率: 该方法产生的额外时间与内存开销适中。对于 ImageNet,Bloom 过滤器的存储约为 7.5 MB,软标签缓存高达 17.9 MB。处理时间对于 30,000 次查询,在 CIFAR-10 上约为 1.0 分钟,在 ImageNet 上约为 2.5 分钟,可通过多进程处理进一步降低。
重要性与主张
论文声称其主要意义在于解决了现有 SD 系统对适应性探测和近似攻击的脆弱性。通过整合软标签的时序性,作者认为防御者可以采用更低的相似度阈值,从而提高对依赖于改变查询相似度的适应性攻击的检测能力。
作者强调,其方法对于相似度函数本身的“对抗性攻击”具有鲁棒性,而这是一个此前在 SD 文献中未被充分探索的威胁向量。他们总结道,其两阶段框架提供了一种实用、可扩展且高度准确的防御方案,在检测率和针对对抗性规避策略的鲁棒性方面均优于当前的 SOTA 方法。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。