✨ 要点🔬 技术摘要
在数字世界的寂静角落,一种新型的伪造技术已经出现,它如此逼真,以至于挑战了我们信任所见之物的能力。多年来,专家们一直依赖检测器来识别虚假图像,但这些工具存在一个盲点。它们被训练去寻找旧一代机器留下的特定、有节奏的故障,就像一名只认得一种特定类型假钞的安全警卫一样。当一种更先进、更复杂的机器开始生成看起来截然不同的图像时,旧的警卫未能察觉到欺诈,误将新的伪造品当作真实的摄影照片。这就是计算机取证研究人员目前试图解决的核心问题:如何构建一个不仅仅是记忆某一台机器的错误,而是能理解任何机器生成的图像所留下的深层、不可见的痕迹的检测器。
一个研究小组通过改变两个根本性的东西来应对这一挑战:他们教检测器学习的图片,以及检测器学习的方式。他们意识到,旧的训练集充满了来自旧版生成器的图像,这在教系统寻找错误的线索。相反,他们创建了一个由十万张由现代先进系统生成的图像组成的新库,并精心平衡了同样数量的真实照片。这个被称为 Diff-Gen 的新集合向检测器展示了现代机器产生的微妙、混沌的噪声模式,而不是过去的僵化、重复的模式。通过在这个新库上进行训练,检测器学会了识别人工创作的通用指纹,无论是由哪种特定的机器制造的。
为了使这个学习过程高效,研究人员并没有尝试重新训练检测器庞大的整个“大脑”,因为那既缓慢又昂贵。相反,他们使用了一种被称为 AdaptPrompt 的技术,这就像是在一台功能强大的相机上添加了一个小的、可调节的镜头。他们保持了主镜头固定不变,保留了其对世界的广博认知,而只训练了两个微小的、专门的部分:一个用于图像的小型过滤器和一个用于文本的定制指令集。这使得他们只需使用极小比例的常规计算能力即可完成教学。他们还发现,当他们移除检测器视觉处理的最末一层时,检测器的效果会达到最佳,这一层通常是试图将图像与文字进行匹配的部分。他们发现,这一层平滑掉了对于识别伪造至关重要的那些极其精细、粗糙的细节。
这种方法的结果是令人瞩目的。在针对各种图像生成器(包括旧机器、最新的人工智能工具,甚至公众使用的流行商业应用)进行测试时,这种新型检测器的表现优于以往任何方法。它正确识别虚假图像的准确率在各种情况下都达到了 92% 以上,这比那些在超出其原始训练范围后就难以识别任何内容的旧系统有了显著提升。至关重要的是,它在消耗远少于竞争对手的数据和计算能力的情况下实现了这一点。该系统证明了它能够识别出由它从未见过的机器生成的虚假图像,仅仅因为它学习的是人工噪声的通用语言,而非某一个生成器的特定方言。
然而,研究人员也谨慎地指出,他们的工具在哪些方面仍然面临困难。在识别将真人脸部替换到真人身体上的图像时,它的效果较差,因为这类操纵留下的痕迹与完全生成的图片不同。此外,当图像经过高度压缩(例如在社交媒体上分享时),由于压缩过程破坏了检测器赖以生存的极高频细节,它也会变得不再那么可靠。此外,当图像中包含人物时,系统会更难区分真伪,这可能是因为现实世界中人物的照片在光照和外观上差异巨大,有时会模仿出伪造图像的那种平滑感。尽管存在这些局限性,这项研究仍提供了一条清晰的前行之路。通过将训练数据转向匹配现代图像创作的现实,并优化检测器观察这些图像的方式,研究人员构建了一个更具适应性和鲁棒性的工具,为抵御正在重塑我们视觉世界的合成媒体洪流提供了更强的盾牌。
技术摘要:用于通用深度伪造检测的 AdaptPrompt
1. 问题陈述
本文旨在解决深度伪造检测中关键的泛化失败问题。目前的检测器在针对生成对抗网络(GAN)图像进行训练时,往往会过拟合于特定的、周期性的频率伪影(例如由上采样产生的“棋盘格”模式)这一 GAN 特有的属性。因此,这些模型在检测由扩散模型或商业工具(如 Midjourney、DALL-E 3)生成的图像时往往会失效,由于存在“汇聚标签”(sink-label)效应——即“伪造”类仅由训练数据中的特定伪影定义——导致这些模型常将其误分类为“真实”。
作者确定了导致这种缺乏泛化能力的两个根本原因:
训练数据偏差: 现有的规模化语料库(如 ProGAN/LSUN)是以 GAN 为中心的,这使得模型学习的是 GAN 特有的指纹,而非通用的合成痕迹。
适配策略: 对视觉-语言模型(VLM,如 CLIP)进行标准的微调或线性探测,可能会要么过拟合于训练生成器,要么在语义对齐过程中丢弃了用于检测所需的低级取证特征。
2. 方法论
提出的解决方案 AdaptPrompt 从两个层面运行:引入一个新的训练语料库以及一个针对 CLIP 的参数高效适配框架。
2.1 Diff-Gen 语料库
作者引入了 Diff-Gen ,这是一个平衡的训练数据集,包含:
100,000 张扩散生成的图像 ,使用 Stable Diffusion v1.5 创建。
100,000 张真实图像 ,来自 LSUN 数据集。
设计: 真实图像子集镜像了合成数据的类别分布(20 个 LSUN 类别),以防止检测器学习到语义偏差。
频谱分析: 与表现出尖锐、周期性高频峰值的 GAN 数据不同,Diff-Gen 表现出宽带、非周期性的高频能量提升。作者假设,在这一“宽带噪声”上进行训练,会迫使模型学习可泛化的生成伪影,而非特定的架构指纹。
2.2 AdaptPrompt 架构
AdaptPrompt 是对 CLIP 模型(具体为 ViT-L/14)的一种参数高效适配。它冻结了预训练的主干网络,并仅通过两个模块训练约 0.1% 的参数(约 60.2 万个):
视觉适配器(Visual Adapter): 一个附加在冻结视觉编码器输出端的残差瓶颈适配器。它使用下投影、ReLU 激活和上投影来学习语义特征的紧凑修正,专门针对对伪影敏感的方向。
文本提示微调(Textual Prompt Tuning): 模型并非使用固定的文本提示(例如“一张伪造的照片”),而是学习用于“真实”和“伪造”类的 16 个共享上下文向量。这些可学习的向量与固定的类别嵌入拼接在一起,并传递给冻结的文本编码器。
2.3 编码器截断
一个关键的方法论见解涉及 截断视觉编码器 。作者观察到,CLIP 的最后一个 Transformer 块是为语义图像-文本对齐而优化的,这可能会抑制取证检测所需的低级不规则性。他们建议在适配器之前移除最后一个 Transformer 块(变体 v2 ),从而允许模型访问保留更多高频细节的倒数第二层特征。
3. 核心贡献
Diff-Gen 数据集: 一个基于扩散模型的训练语料库,证明了与标准 ProGAN 语料库相比,它在面对未见的生成器家族时具有更优越的泛化能力。
AdaptPrompt 框架: 一种结合了视觉适配器和可学习文本提示的双模态适配方法,实现了高水平性能且仅需极少的参数更新。
编码器截断发现: 提供了经验性证据,表明移除 CLIP 的最后一个 Transformer 块能持续提高取证性能,这表明语义对齐层会丢弃取证痕迹。
全面的基准测试: 在 25 个测试集上进行了评估,包括 10 种 GAN、9 种扩散模型、3 种商业工具以及换脸基准测试。
4. 实验结果
评估涵盖了 25 个测试基准。主要发现包括:
泛化性: 在测试扩散模型和商业工具时,基于 Diff-Gen 训练的模型显著优于基于 ProGAN 训练的模型。
AdaptPrompt-v2 (基于 Diff-限训练)在所有家族中实现了 98.60% 的平均精度(mAP) 和 92.72% 的准确率 。
相比之下,基于 ProGAN 的基准模型(如 Wang 等人)在商业工具上的准确率会降至接近随机水平(~52-57%)。
泛化具有不对称性:基于 Diff-Gen 训练的模型能很好地检测 GAN 伪影,而基于 GAN 训练的模型则无法检测扩散伪影。
参数效率: AdaptPrompt 的性能达到或超过了全量微调的 CLIP 基准模型,同时训练的参数量减少了约 700 倍 。
截断的影响: 移除最后一个 Transformer 块(v2)始终能产生最佳结果。例如,AdaptPrompt-v2 将 mAP 从 97.40% (v0) 提升至 98.60% (v2)。
鲁棒性: 模型对高斯模糊具有鲁棒性,但在重度 JPEG 压缩(质量 50)下性能下降,这与其依赖宽带高频残差的特性一致。
局限性:
换脸(Face-Swap): 在 FaceForensics++(换脸)数据集上的表现显著下降,因为这些属于局部篡改而非完全生成的图像。
以人为中心的图像: 对于包含人物的图像,准确率较低(80.5%),低于不含人物的图像(96.5%),这可能是由于合成人脸的极高质量以及真实人脸的光度变化模拟了平滑线索。
来源归属(Source Attribution): 该框架可扩展至 22 种生成器的闭集来源归属,达到了 81.4% 的准确率和 96.49% 的家族级准确率,混淆主要发生在同一生成器的不同配置之间。
5. 意义与主张
论文声称,Diff-Gen 和 AdaptPrompt 通过解决数据分布和模型适配策略,共同解决了深度伪造检测中的泛化问题。
数据视角: 在扩散伪影(Diff-Gen)上进行训练可以向 GAN “向后”泛化,并向商业工具“向前”泛化,而反之则不然。这表明扩散合成伪影比 GAN 伪影是更基础的“合成”图像表示。
建模视角: AdaptPrompt 的成功表明,像 CLIP 这样的视觉-语言模型包含了丰富的取证信号,而这些信号在标准的微调或语义对齐层中往往会被丢弃。通过使用参数高效的适配和截断最终层,可以在不发生灾难性遗忘或过拟合的情况下恢复这些信号。
实际影响: 该方法提供了一种计算高效的解决方案(低训练成本、极少的参数更新),能在多种生成器家族中实现最先进的性能,使其成为应对不断演变的生成式 AI 威胁的有力候选方案。
作者总结道,尽管目前的模型在换脸篡改和重度压缩方面存在局限性,但该框架为未来的面向人脸的适配和抗压缩训练研究提供了坚实的基础。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。