想象你有一位非常聪明的保安(一个 AI),他在大楼入口处检查身份证件。这位保安擅长识别人脸,但一个狡猾的小偷(一种“对抗性攻击”)可以戴上几乎看不见的微小面具,或仅仅调整一下姿势,就足以骗过保安,让其放行。
长期以来,安全研究人员尝试过两种不同的方法来解决这一问题:
- “强化”方法:让保安的眼睛更敏锐,并用成千上万个伪造面具对其进行训练。这种方法在实践中效果不错,但你永远无法从数学上 100% 确定保安不会被某种“新花招”欺骗。
- “蒙眼”方法:给保安戴上眼罩,要求他们根据模糊且带有噪声的面部版本来猜测身份证件。这种方法能提供数学保证(即“认证”),确保在一定距离内不会被欺骗,但会让保安识别真实人物的速度变慢、准确率下降。
HyCAS 是一种新的安全系统,试图兼得两者之长。它就像给保安配备了一副特殊的智能眼镜,将超高清镜头与内置的可变雾机结合在一起。
以下是 HyCAS 的工作原理,分解为简单部分:
1. “刚性骨架”(确定性核心)
首先,系统为保安的大脑构建了一个非常严格、刚性的骨架。用数学术语来说,这是一个1-李普希茨(1-Lipschitz) 网络。
- 类比:想象保安的大脑由钢梁构成。无论输入(身份证件)受到多大的推拉,内部结构只能发生微小且可预测的形变。这防止了小偷找到可以钻空的“弱点”。
2. “可变雾”(随机部分)
单靠刚性骨架仍然具有可预测性。如果小偷确切知道钢梁如何弯曲,他们仍然可以欺骗它。因此,HyCAS 添加了两层“雾”,每次保安查看身份证件时都会发生变化:
- 随机投影:想象保安突然通过一个万花筒查看身份证件,该万花筒每次都会随机重新排列颜色和图案。
- 注意力噪声:想象保安的视野中出现了一点静态噪点或“雪花”,但这些噪点以受控的方式移动。
- 类比:由于雾和万花筒每次都在变化,小偷无法策划一个能重复奏效的单一花招。他们只能猜测,而他们的猜测很可能会失败。
3. “神奇融合”(混合卷积)
论文将这一部分称为 HyCAS。它将刚性的钢骨架与可变的雾混合在一起。
- 结果:即使存在所有这些随机性,该系统在数学上仍然是“刚性”的(现在是一个2-李普希茨网络)。这意味着研究人员仍然可以写出一份数学认证,声称:“我们保证,任何小于 X 的伪装都无法欺骗这位保安。”
- 优势:与旧的“蒙眼”方法不同,该系统不会失去清晰识别真实人物的能力。它在保持对小偷不可预测的同时,依然保持敏锐。
他们证明了什么?
研究人员在各种各样的“大楼”(数据集)上测试了这位新保安:
- 标准大楼:如 CIFAR-10 和 ImageNet(日常照片)。
- 专业大楼:如医疗 X 光片(胸部扫描)、皮肤病变照片和人脸识别。
结果:
- 更强的保证:HyCAS 证明其抵御攻击的能力优于以往的“认证”方法。例如,在医疗 X 光片上,它将保证的安全边际提高了约 7.3%。
- 更好的现实世界防御:在面对强大的现实世界黑客攻击(经验攻击)时,它的表现也优于以往的“经验”方法,在皮肤病变数据上将安全性提高了高达 3.1%。
- 无权衡:通常,使系统更安全会使其变“笨”(在正常任务上的准确率降低)。HyCAS 成功地在提高安全性的同时,没有牺牲其正确识别正常图像的能力。
代价(成本)
论文诚实地指出了缺点。为了让这种“智能雾”发挥作用,系统需要进行更多的数学运算。
- 类比:这就像雇佣三名保安而不是一名,或者让一名保安同时透过三个不同的万花筒查看。
- 成本:与标准保安相比,该系统使用的计算能力(FLOPs)增加了约 15 倍,处理图像所需的时间也更长。然而,作者表示,在高风险情境下(如医疗诊断或安全领域),为了获得 100% 的确定性,额外的时间和金钱投入是值得的。
总结
HyCAS 是一种构建 AI 的新方法,它既具有数学可证明性(你可以证明它是安全的),又具有实际坚固性(它实际上能阻止现实世界中的黑客)。它通过构建刚性结构,然后用受控的随机性对其进行扰动,使攻击者无法预测 AI 的反应,同时保持 AI 的敏锐度以完成其任务。
技术摘要:基于混合卷积与注意力随机性(HyCAS)的认证与经验对抗鲁棒性
1. 问题陈述
计算机视觉中的深度学习模型仍易受对抗攻击的影响,给自动驾驶、欺诈检测和临床决策支持等安全关键应用带来重大风险。现有的防御策略通常分为两类,但两者均存在显著局限性:
- 经验防御:如对抗训练(AT)等方法虽能最大化针对特定攻击的鲁棒性,但往往缺乏形式化保证,且容易受到更强、更具针对性的攻击(如 APGD、AutoAttack)的破坏。
- 认证防御:如随机平滑(RS)等技术能提供可证明的鲁棒性保证(通常基于 ℓ2 范数),但往往面临僵硬的权衡:较大的噪声预算会侵蚀干净数据的准确率,或者无法泛化到强大的经验 ℓ∞ 攻击。
此外,许多现有防御主要仅在自然图像数据集上得到验证,其在特定领域分布(如医学影像)上的有效性尚不确定。迫切需要一种防御方法,既能缩小可证明的 ℓ2 认证与经验 ℓ∞ 鲁棒性之间的差距,又能保持跨多样化图像基准的强大泛化能力。
2. 方法论:HyCAS
作者提出了混合卷积与注意力随机性(HyCAS),这是一种随机化防御架构,将确定性 Lipschitz 约束与随机平滑相结合。其核心创新在于在网络架构内部(而非仅在输入端)注入受控的、数据无关的随机性,从而构建一个全局 ≤2-Lipschitz 的网络,使其能够接受形式化认证。
架构组件
HyCAS 用三个并行流替换了标准卷积层,每个流均设计为 ≤2-Lipschitz。这些流通过一个数据无关的、逐通道的凸门控进行融合。
FDPAN(带注意力噪声的频率感知确定性投影):
- 结合了一个确定性 1-Lipschitz 核心与两个随机残差。
- 核心:利用低通离散余弦变换(DCT)掩模切除脆弱的频带,随后通过正交雅可比矩阵(1-Lipschitz)进行通道混洗,并采用谱归一化卷积(SNC)。
- 随机性:在确定性核心之后立即注入随机注意力噪声(RANI),并再次作为残差注入,确保该流保持 ≤2-Lipschitz。
SNCAN(带注意力噪声的谱归一化卷积):
- 用谱归一化卷积(SNC)替换标准卷积,以在核上强制实施 1-Lipschitz 边界。
- 集成 RANI 模块以注入细粒度的、数据无关的随机性,将确定性块转化为随机化防御,同时保持 ≤2-Lipschitz 包络。
RPFAN(带注意力噪声的随机投影滤波器):
- 利用随机投影滤波器实现 Johnson-Lindenstrauss 嵌入保证。
- 预混合:使用正交 1×1 通道混洗器均衡通道能量。
- 谱归一化:应用感知批次的两步幂迭代方案对随机投影滤波器进行重缩放,确保其为 1-Lipschitz。
- 随机性:将 1-Lipschitz 投影与 RANI 模块结合,实现 ≤2-Lipschitz 边界。
RANI(随机注意力噪声注入):
- 一种将有界的、数据无关的注意力掩码 Mω∈[0,1]d 注入特征图的机制。
- 形式上,对于确定性映射 h,RANI 输出为 h^=h⊙Mω。
- 论文证明该操作是 2-Lipschitz 的,有效地将确定性 1-Lipschitz 块转换为随机化 2-Lipschitz 块。
理论保证
- Lipschitz 常数:作者证明每个组成流(FDPAN、SNCAN、RPFAN) individually 均为 ≤2-Lipschitz。这些流的凸融合保持了这一边界。
- 认证:通过对内部随机性 Ω 上的 logits 进行平均,期望 logits 映射 Z(x) 保持 ≤2-Lipschitz。这使得基于边界的 ℓ2 认证成为可能:如果前两个期望 logits 之间的差距为 Δ(x),则该模型对任何扰动 δ 具有可证明的鲁棒性,只要 ∥δ∥2<Δ(x)/4。
训练与推理
- 训练:模型使用标准损失函数进行训练,输入经过高斯噪声扰动(随机平滑风格)以及流的内部随机性。同时也采用对抗训练以增强经验鲁棒性。
- 推理:提供两种认证:基于类别概率的标准随机平滑(RS)认证,以及基于期望 logits 的确定性 Lipschitz 边界认证。
3. 主要贡献
- HyCAS 架构:提出了一种随机化 Lipschitz 约束防御,将确定性 1-Lipschitz 核心与两个随机模块(谱归一化随机投影滤波器和随机注意力噪声)相结合。
- 理论保证:推导了 HyCAS 的紧 ℓ2 鲁棒性认证,证明网络全局为 ≤2-Lipschitz,并提供有效的逐点认证。
- 即插即用设计:模块化设计,可集成到标准 CNN 骨干网络(如 ResNet)中,形成可接受形式化认证的随机化防御。
- 全面评估:广泛的实验表明,HyCAS 在八个多样化的基准测试中优于先前领先的认证和经验防御方法,包括自然图像(CIFAR-10/100、ImageNet)和医学影像数据集(NIH 胸部 X 光、HAM10000、EyePACS、NCT-CRC-HE-100K)。
4. 实验结果
论文报告了八个基准测试的结果,评估了认证 ℓ2 准确率以及针对强 ℓ∞ 攻击(APGD-20 和 AutoAttack)的经验鲁棒性。
- 认证准确率:HyCAS 在所有噪声水平(σ)和半径(r)下均实现了最先进的认证准确率。
- 在 CIFAR-10 上,当 r=0.75 且 σ=0.25 时,HyCAS 达到 44.3% 的认证准确率,优于最佳基线(ARS)5.2–18.2%。
- 在 ImageNet 上,当 r=1.5 且 σ=0.50 时,HyCAS 达到 32.7%,超出基线 2.1–32.7%。
- 在医学数据集上,HyCAS 显示出显著提升,例如在 NIH 胸部 X 光数据集上比领先基线提高高达 7.3%,在 HAM10000 上提高 3.1%。
- 经验鲁棒性:HyCAS 在不牺牲干净数据准确率的情况下,保持了对强 ℓ∞ 攻击的高鲁棒性。
- 在 NIH-CXR 上,HyCAS 在 APGD-20 和 AutoAttack 下比领先基线(CTRW)高出 1.8–4.2%。
- 在 HAM10000 上,其鲁棒准确率提高了 1.9–3.1%。
- 在更强的攻击设置下(增加扰动大小 ϵ 和迭代步数),HyCAS 的退化比基线更平缓,在 CIFAR-100 上 100 次攻击步数时保持 7–12% 的优势。
- 权衡:该方法提供了认证鲁棒性与经验鲁棒性之间可控的权衡。增加平滑噪声 σ 可在大半径认证准确率上带来提升,而对小半径或干净数据准确率的影响极小。
5. 意义与主张
论文声称,HyCAS 成功弥合了认证对抗鲁棒性与经验对抗鲁棒性之间长期存在的差距。通过将确定性 Lipschitz 约束架构与内部随机性相结合,该方法实现了:
- 同步提升:同时提高了认证 ℓ2 准确率和经验 ℓ∞ 鲁棒性,这是先前方法(通常以牺牲一方为代价来优化另一方)极少能做到的。
- 泛化性:该方法有效地泛化到多样化的图像领域,包括自然图像和专门的医学数据集,表明其在高风险应用中的实用性。
- 安全性:在保持强大经验韧性的同时提供形式化保证的能力,支持在关键部门更安全地部署深度模型。
作者承认了局限性,指出该方法计算量大(使 FLOPs 和推理时间增加约一个数量级),且目前的理论保证仅限于 ℓ2 扰动,ℓ∞ 鲁棒性仅通过经验评估。未来的工作建议推导更紧的认证并设计更轻量级的变体。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。