DiffAttack: Evasion Attacks Against Face Recognition via Latent Diffusion Models
本文介绍了 DiffAttack,一种利用潜在扩散模型生成高质量、不可察觉的面部图像的新型对抗性框架,该框架能够成功规避深度人脸识别系统,且与现有方法相比,具有显著更高的攻击成功率和迁移性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
技术摘要:DiffAttack
问题陈述
深度人脸识别(FR)系统虽然在身份验证和监控方面非常有效,但其决策边界足够狭窄,容易受到对抗性攻击的影响。现有的针对面部生物特征的对抗方法面临显著的局限性:
- 基于噪声的攻击: 虽然通常具有不可感知性,但它们对现实世界的变化(如光照变化)缺乏鲁棒性,且在不同模型之间的迁移能力较差。
- 基于补丁(Patch)的攻击: 这些攻击会引入明显的视觉伪影,损害隐蔽性,使其不适用于自然图像分享。
- 基于语义/妆容的攻击: 虽然提高了感知质量,但通常依赖于僵化的参考图像、人工语义线索或大规模妆容数据集,这会引入人口统计学偏差并限制泛化能力。
- 基于 GAN 的方法: 这些方法通常需要针对新的目标身份进行重新训练,并且受限于生成式 GAN 的流形约束。
- 现有的基于扩散模型的方法: 如 DiffAM 或 Adv-Diffusion 等方法通常依赖于迭代优化、特定目标的重新训练或僵化的启发式掩码,导致边界伪影并降低效率。
核心挑战在于生成既具有照片级真实感、与目标身份对齐,又对人类观察者不可感知,同时在多样化的、未见的黑盒人脸识别系统中保持高迁移性的对抗性面部图像。
方法论:DiffAttack
作者提出了 DiffAttack,这是一个通过使用冻结的潜在扩散模型(具体为 Stable Diffusion v2.1)进行潜在空间优化的新型对抗生成框架。
核心架构与流程
- 潜在编码: 使用冻结的变分自编码器(VAE)编码器将清晰的源图像 () 编码为潜在表示 ()。
- 噪声注入: 在特定的时间步 添加固定数量的高斯噪声,以创建用于 U-Net 主干网络的带噪潜在输入。
- LoRA 增强型 U-Net: 该框架并未对庞大的 U-Net 参数进行微调,而是将 低秩自适应(LoRA) 适配器专门注入到交叉注意力层(Q, K, V 投影)中。这些轻量级的、可训练的矩阵经过优化,旨在将扩散过程重定向至目标身份嵌入。
- 优化循环:
- U-Net 预测噪声,从而重建清晰的潜在表示 ()。
- 潜在表示被解码,以在像素空间生成对抗性面部。
- 多源反馈: 生成的面部被传递至一组冻结的人脸识别模型(IR152, IRSE50, MobileFace),以计算对抗性面部与目标身份之间的身份距离。
- 梯度反向传播: 来自人脸识别模型的梯度仅反向传播至 LoRA 权重,通过迭代优化对抗性特征,直到源图像被误认为目标身份。
损失函数
优化过程最小化一个统一的多目标损失 ():
- 集成身份损失 (): 使用余弦相似度合页损失(cosine similarity hinge),将生成的嵌入推向目标嵌入。
- 方向引导 (): 确保潜在偏移遵循语义身份轨迹(源 目标),而非表象的捷径。
- 源抑制损失 (): 对优化器进行惩罚,以防止其漂移回原始源身份。
全局协调
与使用僵化分割掩码或局部混合的方法不同,DiffAttack 优化的是全图潜在表示。这使得扩散模型的生成先验能够自然地将身份偏移与原始背景、光照及周边属性进行协调,消除了边界光晕并确保了照片级的真实感。
核心贡献
- 新型潜在空间规避框架: 一个通过使用 LoRA 增强的交叉注意力层在潜在空间进行优化的统一流水线。这避免了像素空间噪声带来的明显伪影,并相比全局微调降低了计算开销。
- 黑盒迁移性: 一种利用多样化代理人脸识别主干(IR152, IRSE50, MobileFace)白盒反馈的多源优化策略。该方法注入了对抗性语义,使其能够迁移至未见的攻击目标(例如 FaceNet),而无需访问其内部参数。
- 全局潜在协调: 通过在整个潜在空间而非局部掩码上优化对抗信号,该框架确保了身份偏移能无缝集成到周围语境中,避免了边界伪影。
- 达到最先进水平的性能: 在 FFHQ 和 CelebA-HQ 数据集上的广泛评估表明,其性能优于现有的基于噪声、基于妆容及基于语义的方法。
实验结果
该框架在 FFHQ 和 CelebA-HQ 数据集下,在严格的黑盒设置中进行了评估。
- 攻击成功率 (ASR): DiffAttack 在多个识别模型上实现了 84.86% 的平均 ASR,达到了新的 SOTA 水平。
- 它比传统的基于噪声的方法高出 15.28% 以上,比基于语义的方法高出约 5.21%。
- 在攻击 MobileFace (95.03%) 和 IRSE50 (94.24%) 时观察到了极高的成功率。
- 当攻击 FaceNet 作为黑盒目标时,代理集成由 IR152, IRSE50 和 MobileFace 组成(排除 FaceNet)。反之,当攻击 MobileFace 时,代理集成包括 FaceNet, IRSE50 和 IR152。
- 感知质量:
- SSIM: 达到 0.961,表明与源图像具有高度的结构相似性。
- PSNR: 24.54 dB,显示出扰动的细微嵌入。
- FID: 27.58,表明生成的图像仍处于自然图像流形内。
- 视觉对比: 与会导致“重影”的噪声类方法或看起来较为人工的妆容类方法不同,DiffAttack 保留了源图像的原始纹理、表情和光照。虽然图 1 中使用了 Face++ 分数来展示身份对齐情况,但正式的评估指标依赖于 IR152, IRSE50, MobileFace 和 FaceNet 模型。
意义与声明
论文声称,DiffAttack 代表了生物识别安全评估领域的重大进展,它证明了通过 LoRA 进行潜在空间优化可以生成既能高效攻击黑盒系统,又在视觉上与真实照片无法区分的对抗样本。
作者强调,其工作旨在用于防御性安全分析和隐私保护。通过揭示这些漏洞,该研究旨在为开发能够抵御高级生成式 AI 威胁的更鲁棒的生物识别验证系统提供参考。本研究严格遵守伦理准则,仅使用公开研究数据集,并且不会发布用于个人身份冒用的特定预训练权重。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。