✨ 要点🔬 技术摘要
想象一下,你正试图在博物馆里识破一幅假画。大多数保安(旧的 AI 检测器)只是盯着画作的表面看,寻找只有某一位著名伪造者才会使用的特定笔触或颜料纹理。如果伪造者改变了风格或使用了不同的品牌颜料,保安就会感到困惑并让假画混了进来。
这篇论文的作者 Kutub Uddin 及其团队说:“别盯着画看了!让我们看看当我们去戳它时,它会有什么反应。”
核心理念:“第二意见”测试
该团队的新系统名为 GenRes ,它并不只是看一次图像,而是将图像视为警察阵容中的嫌疑人。它不只是问:“你看起来像假的吗?”而是通过一系列“生成式变换”来处理图像——可以把这些想象成五种不同的魔法滤镜,试图修复、增强或清理图片。
这里有一个魔术技巧:
真实照片 就像一棵坚固的橡树。当你摇晃它们(应用滤镜)时,它们会轻微晃动,但仍保持其本质。
AI 生成的照片 则像是由某种特定的、看不见的胶水搭建的纸牌屋。当你用第二个魔法滤镜去摇晃它们时,这种胶水会与新滤镜的规则产生奇怪的相互作用。纸牌屋不仅仅是晃动,而是会以一种非常特定、具有特征性的方式坍塌。
论文将这些奇怪的坍塌称为**“生成残差”(generative residuals)**。这不在于假图像本身,而在于当尝试“修复”真实图像与假图像时,它们反应之间的差异。
机器是如何学习的
团队为他们的计算机构建了一个大脑,称为 GenRes++ 。
翻译官: 首先,它使用一个超级聪明的预训练之眼(称为 PE-Core ),这只眼睛已经见过数百万张图像。这只眼睛是冻结的(它不会学习新事物),但通过一种称为 LoRA 的技术(就像给歌曲添加几个新音符)进行了微调,使其能够发现细微的差异。
魔法滤镜: 系统获取原始图像并运行五种特定的变换:
EnlightenGAN: 使其变亮。
GFPGAN: 尝试修复面部。
Real-ESRGAN: 使其看起来更清晰(超分辨率)。
FFDNet: 尝试去除噪声(去噪)。
CodeFormer: 另一个面部修复器。
侦探: 系统随后使用一种特殊的数学工具——神经张量网络 (NTN) 。想象这是一个侦探,他不仅仅是做“假”版本与“真”版本的减法。相反,他观察原始图像的特征如何与变换后图像的特征进行相乘 和交互。它捕捉到了两者之间仅在面对假图像时才会发生的“隐藏握手”。
结果:新的冠军
团队在名为 UniversalFakeDetect 的大型挑战赛上测试了他们的系统,该挑战赛包含了 19 种不同类型的 AI 生成器 ,而系统此前从未见过这些生成器。这些生成器包括老派的 GAN、现代扩散模型以及介于两者之间的所有模型。
得分: GenRes++ 实现了 95.7% 的准确率 (mACC) 和 99.1% 的平均精度 (mAP)。
对比: 它击败了测试的所有其他方法,包括之前的最佳方法如 C2P-CLIP (得分为 93.8%)和 FreLens (95.0%)。
证明: 即使他们只使用其中一个魔法滤镜(特别是去噪滤镜 FFDNet),系统的表现仍然优于旧方法,得分为 92.6% 。但将五个滤镜结合使用才是真正的赢家。
论文对什么的表示“否定”
作者明确指出哪些做法是行不通的:
不再使用“一刀切”的指纹: 他们认为寻找由特定生成器(如特定的 GAN)留下的特定伪影是一条死胡同。如果你针对一种类型的假图像进行训练,那么当出现一种新的假图像类型时,你就会失败。
不再进行“孤立”检测: 他们拒绝仅仅分析单张图像的想法。论文指出,如果不观察图像对第二个过程的反应,就会错过最重要的线索。
目前还没有应对所有情况 的万能钥匙: 论文承认,如果同时用过多的问题去冲击图像(模糊 + JPEG 压缩 + 噪声全部在一起),系统会感到困惑,其准确率会下降到 84.9% 。
缺陷(“但是……”)
论文坦诚地说明了缺点。这个系统很重。
速度: 因为必须运行图像经过五个复杂的滤镜,然后进行繁重的数学计算,所以检查单张图像大约需要 4,625.6 毫秒 (大约 4.6 秒)。这几乎是仅使用一个滤镜时的三倍速度。
成本: 它消耗大量的计算资源(11,411.5 GFLOPs )。
“面部”偏差: 其中两个魔法滤镜是专门设计用来修复面部的。作者暗示,这可能使系统在识别假脸方面比识别假风景表现得更好,尽管他们并未对此进行专门测试。
总结
论文表明,抓住 AI 伪造的关键不在于盯着图像看,而在于观察图像在尝试改进时是如何“挣扎”的。通过使用来自五个不同魔法滤镜的“第二意见”和一个聪明的侦探(神经张量网络),GenRes++ 提供了一种新的识别伪造的方法,即使在伪造者改变其风格时也能奏效。这是一个强大且审慎的进步,但它还不完全准备好用于实时、分秒级的安全检查。
技术摘要:用于广义 AI 生成图像检测的 GenRes 与 GenRes++
问题陈述
包括 GAN、扩散模型和混合流水线在内的生成式 AI 的快速发展,已经产生了与真实照片难以区分的 AI 生成图像(AIGIs)。这种能力带来了显著的社会威胁,包括虚假信息、数字身份窃取和金融欺诈。目前的检测方法面临着关键的泛化挑战:当遇到训练期间未见的生成模型时,它们往往会失效。
现有的检测器通常分为两种范式,两者都存在局限性:
基于伪影的方法(Artifact-driven methods): 这些方法利用特定生成器的指纹(例如,频率伪影、上采样痕迹)。虽然在已知生成器上有效,但在遇到未见的模型家族(例如,扩散模型)时,性能会剧烈下降,因为底层的合成机制不同。
基于表示学习的方法(Representation-learning methods): 这些方法将图像投影到对伪造敏感的嵌入空间(例如,CLIP)。然而,它们通常独立地编码每张图像,忽略了由生成过程引起的关联结构,并且无法捕捉细微的跨生成器伪影。
核心问题在于缺乏一种对特定生成器家族具有不变性,同时对真实数据与合成数据之间的根本统计差异保持敏感的检测信号。
方法论:GenRes 与 GenRes++
作者提出了 GenRes 及其扩展版本 GenRes++ ,这两个框架基于**生成残差(generative residuals)**的概念。其核心假设是,真实图像和合成图像在经过第二个生成模型(例如,修复、超分辨率或去噪)处理时,其反应方式不同。由于变换网络的归纳假设与源生成器嵌入的分布偏差之间存在非平凡的相互作用,真实图像会产生与丰富的高频内容一致的输出,而 AIGIs 则会表现出特征性的残差差异。
核心架构
该框架由四个主要组件组成:
带有 LoRA 的共享视觉编码器:
原始图像 (I 0 I_0 I 0 ) 和 N N N 个变换变体 (I i I_i I i ) 都使用共享的 PE-Core ViT (视觉 Transformer)进行编码。
骨干网络保持冻结,以保留预训练的语义表示。
LoRA(低秩自适应) 被应用于自注意力层的查询(query)、键(key)和值(value)投影矩阵。这使得模型能够以极少的训练参数(秩 r = 6 r=6 r = 6 )实现任务特定的特征自适应。
特征被投影到一个紧凑的嵌入空间(d = 256 d=256 d = 256 )。
*交叉注意力聚合(CCA)—— 仅限 GenRes++ : *
在 GenRes++ 中,N N N 个变换图像的嵌入被聚合为一个具有代表性的向量 (g a g g g_{agg} g a g g )。
原始图像嵌入 (z 0 z_0 z 0 ) 作为查询(query),而变换后的嵌入则作为键(key)和值(value)。
该机制能够自适应地加权变换变体,使模型能够专注于针对特定输入的、信息量最大的残差,而不是平等对待所有变换。
神经张量网络(NTN):
核心创新在于使用 NTN 来建模原始嵌入 (z 0 z_0 z 0 ) 与聚合变换嵌入 (g a g g g_{agg} g a g g ) 之间的关系结构。
不同于简单的减法或拼接,NTN 计算双线性交互:f = tanh ( z 0 ⊤ W g a g g + [ z 0 ; g a g g ] ⊤ V + b ) f = \tanh(z_0^\top W g_{agg} + [z_0; g_{agg}]^\top V + b) f = tanh ( z 0 ⊤ W g a g g + [ z 0 ; g a g g ] ⊤ V + b ) 。
三阶权重张量 W W W 捕捉了乘性跨特征依赖关系 。这使得模型能够检测一个特征维度的扰动如何调制另一个维度,这种模式是生成残差的特征,且不依赖于特定生成器的伪影。
分类头:
关系特征向量 f f f 被传递至一个线性层和一个 Sigmoid 函数,以产生二元分类概率(真实 vs. AIGI)。
训练使用二元交叉熵(BCE)损失函数。
训练策略
数据: 模型在由单一来源(ProGAN)生成的图像上进行训练,并在 19 种未见的生成器(涵盖 GAN、其他及扩散模型家族)上进行测试。
变换: 应用了五种特定的生成变换来创建关系对:EnlightenGAN(增强)、GFPGAN(修复)、Real-ESRGAN(超分辨率)、FFDNet(去噪)和 CodeFormer(修复)。
优化: 仅更新 LoRA 适配器、投影层、CCA 模块、NTN 和分类头。
核心贡献
GenRes 框架: 一种新型的关系表示学习框架,通过建模原始图像与变换图像之间的差异,来增强跨生成器的泛化能力。
神经张量网络(NTN): 采用 NTN 来捕捉特征嵌入之间的细粒度双线性交互,超越了简单的加性差异,转而探索内在的乘性关系。
GenRes++ 扩展: 一种自适应聚合机制(交叉注意力),能够融合多个变换变体,使模型能够动态地专注于信息量最大的残差。
全面评估: 在 UniversalFakeDetect 基准测试中对 19 种未见的生成模型进行了广泛测试,证明了其强大的鲁棒性。
实验结果
所提方法在 UniversalFakeDetect 数据集上进行了评估,该数据集包含 19 种涵盖 GAN、扩散模型和其他合成流水线的未见生成模型。
性能: GenRes++ 实现了具有 95.7% 平均准确率 (mACC) 和 99.1% 平均精确率 (mAP) 的最先进结果。
对比: 该方法优于所有基准方法,包括基于 CLIP 的方法(如 UniFD, C2P-CLIP)和基于频率的方法(如 FreqNet, F3Net)。
在基于 GAN 的模型上,GenRes++ 保持了近乎完美的准确率(>99%)。
在“其他”家族模型(如 SITD, SAN)上,它取得了显著提升(例如,在 CRN 上为 99.4%,在 IMLE 上为 99.5%),而其他方法在这些模型上表现挣扎。
在扩散模型(LDM, Glide)上,它展示了强大的鲁棒性,优于单变换基准。
消融研究:
LoRA 秩: 秩 r = 6 r=6 r = 6 在容量与泛化能力之间提供了最佳平衡;更高的秩会导致过拟合。
骨干网络: PE-Core-G14-448 骨干网络优于 CLIP ViT-L/14 和 DINO ViT-L/14,这归功于其更丰富的低级纹理表示。
融合方式: NTN 融合策略显著优于更简单的替代方案(线性、逐元素、拼接),证实了捕捉高阶交互的必要性。
变换数量: 性能在 N = 5 N=5 N = 5 个变换时达到顶峰;增加更多变换会引入冗余并导致性能波动。
意义与局限性
意义: 论文声称 GenRes++ 通过从孤立的特征提取转向关系残差学习 ,为 AIGI 检测建立了一种新的范式。通过显式建模合成图像对二次生成处理的反应,该框架捕捉到了合成媒体的一种通用属性,这种属性可以跨越生成器家族进行迁移,而无需在训练期间接触目标生成器。这解决了面对快速演进的生成模型时,泛化能力这一关键瓶颈。
局限性: 作者承认存在以下约束:
计算成本: 需要通过五个独立的生成变换处理输入,以及多分支 NTN 设计,导致较高的推理成本(每张图像约 4625 毫秒),限制了实时部署。
固定变换集: 当前的变换集是手动选择的。其中两个变换(GFPGAN, CodeFormer)是人脸修复模型,这可能会使信号向人脸内容偏移。
对复合退化的鲁棒性: 虽然对单个扰动(模糊、JPEG、噪声)具有鲁棒性,但当同时应用多种退化时,性能显著下降(降至 84.9% ACC),这表明其在复杂的“洗白”(laundering)流水线面前较为脆弱。
范围: 目前的评估仅限于静态图像以及基准测试中的特定 19 种生成器。
未来工作: 作者提出将生成残差学习扩展到视频深度伪造检测(利用时间一致性)以及多模态伪造场景(图像、音频、文本)。他们还计划研究变换蒸馏以降低计算开销,以及自适应变换选择以处理多样化的图像领域。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。