想象一下,你拥有一个超级聪明的机器人,它能查看图片并准确告诉你那是什么。如果你给它看一张老鹰的照片,它会自信地说:“那是一只老鹰!”本文介绍了一种巧妙的技巧,能让这个机器人犯下愚蠢的错误,但有一个转折:作者发现,无需使用复杂的数学或昂贵的计算机来欺骗它,而是可以用一种非常简单的工具“几乎免费”地实现。
以下是他们发现的要点:
旧方法:大盗
通常,为了欺骗这些 AI 机器人(称为神经网络),黑客会像大盗一样行动。他们需要知道机器人的秘密内部代码(即其“权重”和“参数”)。他们会计算出精确的方向来微调图像,从而使机器人感到困惑。这就像试图通过感受锁芯内的每一根弹子来开锁;这需要大量时间、特殊权限以及强大的计算能力。
新方法:魔法滤镜
作者提出了一个不同的问题:如果我们只是使用一个简单的图片滤镜,就像那些用于在照片中查找物体边缘的滤镜一样,会怎样?
他们意识到,AI 机器人对事物的“边缘”(例如天空与树木相接的线,或猫耳与背景相接的线)有着惊人的敏感性。
- 类比:想象 AI 是一个试图在人群中辨认面孔的人。作者并没有试图改变这个人的脸。相反,他们递给这个人一副带有特定怪异色调的眼镜,这副眼镜足以模糊边缘,让人误以为:“等等,那不是脸,那是一只风筝!”
他们是如何做到的
他们创建了两类这样的“魔法滤镜”:
“现成”滤镜(边缘检测器):
他们采用了一种经典的、老式的计算机滤镜,称为"Sobel 滤镜”(几十年来一直用于在照片中查找边缘),并简单地将其应用于图像。
- 结果:只需将图像通过这一个滤镜,AI 就会感到困惑。它无需了解 AI 大脑的任何信息。这就像喊出一个恰好能让机器人困惑的特定词语。
- 成功:效果出奇地好,根据机器人的不同,它能以 30% 到 80% 的概率愚弄 AI。
“定制”滤镜(对抗性滤镜):
他们采用了同样的思路,但“训练”了一个微小的 3x3 数字网格(即一个滤镜),专门用来破坏 AI。
- 类比:与其使用一副通用的眼镜,他们制作了一副定制镜片,其形状完美地扭曲了这个特定机器人观察世界的方式。
- 魔力:这个定制滤镜极其微小。而其他方法需要使用数百万个数字(参数)来制造骗局,而这个方法仅使用了九个数字(用于 3x3 滤镜)。这就像用一粒沙子阻止一台巨大的机器。
- 效率:与其他方法相比,他们将攻击的复杂度降低了100,000 倍。
为何令人恐惧(且有趣)
- 它是隐形的:对图像的改动极小,人眼无法察觉。图片看起来仍然像一只老鹰,但机器人却认为那是一只风筝。
- 它具有迁移性:最令人惊讶的是,旨在欺骗一种类型机器人(如 VGG 网络)的滤镜,也能在不同类型的机器人(如 ResNet 或 Inception)上生效。这就像一把万能钥匙,能打开许多不同的锁,尽管这些锁的构造各不相同。
- 它很快:由于滤镜非常小,只需对图像进行一次快速扫描即可制造骗局。无需漫长的计算。
核心结论
这篇论文表明,你不需要超级复杂的高科技武器来攻破这些 AI 系统。有时,一个非常简单、低科技的技巧——例如以特定方式模糊图片的边缘——就足以让 AI 失效。
作者发现,这些“魔法滤镜”看起来有点像标准的图像滤镜(例如用于锐化照片的滤镜),但它们具有独特的、怪异的结构性,专门针对 AI 的弱点。这表明,AI 机器人比我们想象的更加脆弱;它们很容易被非常简单的、几乎免费的噪声所愚弄。
技术摘要:几乎零成本:利用卷积图像滤波器构建对抗样本
问题陈述
深度学习中的对抗样本(AEs)通常利用基于梯度的优化方法生成,这需要直接访问模型参数(白盒)或通过大量的基于查询的近似(黑盒)。这些方法往往涉及复杂的优化循环、高昂的计算成本,而在基于生成模型的方法中,则涉及数百万个参数。作者质疑此类复杂性是否必要,并提出神经网络对特定结构扰动的脆弱性或许可以通过更简单的机制加以利用。
方法论
本文提出了一种利用卷积图像滤波器构建非定向对抗样本的新方法。该方法分为两种截然不同的策略:
边缘滤波器攻击(模型无关):
- 灵感来源: 借鉴可解释机器学习(Adebayo 等人,2018;Ancona 等人,2018),作者观察到显著图(近似梯度 ∇xfθ(x))与经典边缘检测之间存在相关性。
- 机制: 该攻击将标准边缘检测滤波器(具体为 Sobel 滤波器)应用于输入图像 x 以生成边缘图 E(x)。扰动 δ 通过缩放该边缘图生成:δ=ρ(E(x))=±μE(x)。
- 操作: 这仅需单次卷积运算。作者通过实证测试发现,减去边缘信息(μ<0,即变暗边缘)比添加边缘信息略为有效。
对抗滤波器攻击(模型相关):
- 机制: 作者不使用固定核,而是优化一个小卷积滤波器 k 的权重,以最大化目标模型的损失。
- 优化: 滤波器通过求解以下问题训练:
argkmin−x∈D∑ℓ(x+x∗k,fθ(x),θ)+λ∥k∥22
其中 D 是代表训练分布的小数据集,ℓ 是损失函数,λ 正则化扰动强度。
- 效率: 滤波器尺寸很小(例如 3×3 或 5×5),所需的参数数量远少于生成模型。该攻击是“一次性”的,在滤波器优化完成后,通过单次卷积即可生成扰动。
主要贡献
- 简单性与高效性: 作者证明,构建对抗样本无需迭代梯度更新或复杂的生成架构。与相关的生成方法(例如 Baluja & Fischer, 2018)相比,所提出的滤波器将参数量降低了五个数量级。
- 可迁移性: 学习到的对抗滤波器在不同模型架构(VGG-13、ResNet-50、Inception-V3)之间表现出高度的可迁移性,即使滤波器是针对一个模型优化并应用于另一个模型时也是如此。
- 结构洞察: 优化后的滤波器虽然独特,但与经典图像处理核(例如高斯拉普拉斯算子)具有结构相似性,这表明平滑与边缘增强的特定组合可以有效地欺骗神经网络。
实验结果
作者在 ImageNet V2 数据集上,针对 ImageNet 训练模型(VGG-13、ResNet-50、Inception-V3)评估了他们的方法。
- 边缘滤波器攻击: 使用固定的 Sobel 滤波器,根据模型和扰动幅度(μ)的不同,攻击成功率介于 30% 到 80% 之间。虽然不如自适应方法有效,但它无需模型知识且仅需 27 个参数。
- 对抗滤波器攻击:
- 使用 3×3 滤波器和 1,000 个训练样本,在 PSNR 为 20 时,VGG 的成功率达到 56%,ResNet 为 46%,Inception 为 48%。
- 将滤波器尺寸增加到 5×5 并将训练数据增加到 3,000 个样本,成功率提升至 94% (ResNet)、92% (VGG) 和 68% (Inception)。
- 可迁移性: 针对一个模型优化的滤波器在其他模型上仍保持高效。例如,针对 ResNet 优化的滤波器在 VGG 上实现了 93% 的相对成功率,在 Inception 上为 82%(PSNR=20)。
- 扰动特征: 与覆盖整个图像的标准对抗噪声不同,这些扰动保留了输入图像的结构轮廓,但引入了无色、局部的噪声。视觉检查显示,虽然某些扰动不可察觉(PSNR > 30),但在 PSNR 为 20 时,边缘处会出现可见的模糊或变暗。
意义与主张
本文声称,其结果为有效非定向攻击所需的复杂性提供了下界。作者认为:
- 复杂性并非总是必要: 实现高成功率并不严格需要复杂的优化策略;简单且经过优化的卷积滤波器就足够了。
- 神经网络的脆弱性: 这些简单滤波器的高可迁移性和成功率,突显了神经网络对特定恶意噪声模式的根本脆弱性,这些噪声模式模仿或扭曲了边缘结构。
- 效率: 参数和计算成本(单次通过)的大幅降低,为攻击复杂性与有效性之间的权衡提供了新的视角。
作者保持谦逊,承认他们的简单滤波器无法与最先进优化策略的绝对峰值性能相媲美,但可作为理解成功对抗攻击最低要求的关键基准。他们建议未来的工作可以探索卷积序列,以弥合简单滤波器与完整网络架构之间的差距。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。