← 最新论文
💻 computer science

Do Transformations Reveal the Truth? Generative Residual Learning for Generalized AI-Generated Image Detection

本文介绍了 GenRes 及其增强版本 GenRes++,这两种利用生成式残差学习和注意力机制的新颖框架,通过对原始样本与变换样本之间的细粒度关系特征进行建模,从而有效地检测各种不同且未见的 AI 生成图像。

原作者: Kutub Uddin, Nusrat Tasnim, Awais Khan, Mohammad Umar Farooq, Khalid Malik

发布于 2026-07-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Kutub Uddin, Nusrat Tasnim, Awais Khan, Mohammad Umar Farooq, Khalid Malik

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图在博物馆里识破一幅假画。大多数保安(旧的 AI 检测器)只是盯着画作的表面看,寻找只有某一位著名伪造者才会使用的特定笔触或颜料纹理。如果伪造者改变了风格或使用了不同的品牌颜料,保安就会感到困惑并让假画混了进来。

这篇论文的作者 Kutub Uddin 及其团队说:“别盯着画看了!让我们看看当我们去戳它时,它会有什么反应。”

核心理念:“第二意见”测试

该团队的新系统名为 GenRes,它并不只是看一次图像,而是将图像视为警察阵容中的嫌疑人。它不只是问:“你看起来像假的吗?”而是通过一系列“生成式变换”来处理图像——可以把这些想象成五种不同的魔法滤镜,试图修复、增强或清理图片。

这里有一个魔术技巧:

  • 真实照片就像一棵坚固的橡树。当你摇晃它们(应用滤镜)时,它们会轻微晃动,但仍保持其本质。
  • AI 生成的照片则像是由某种特定的、看不见的胶水搭建的纸牌屋。当你用第二个魔法滤镜去摇晃它们时,这种胶水会与新滤镜的规则产生奇怪的相互作用。纸牌屋不仅仅是晃动,而是会以一种非常特定、具有特征性的方式坍塌。

论文将这些奇怪的坍塌称为**“生成残差”(generative residuals)**。这不在于假图像本身,而在于当尝试“修复”真实图像与假图像时,它们反应之间的差异。

机器是如何学习的

团队为他们的计算机构建了一个大脑,称为 GenRes++

  1. 翻译官: 首先,它使用一个超级聪明的预训练之眼(称为 PE-Core),这只眼睛已经见过数百万张图像。这只眼睛是冻结的(它不会学习新事物),但通过一种称为 LoRA 的技术(就像给歌曲添加几个新音符)进行了微调,使其能够发现细微的差异。
  2. 魔法滤镜: 系统获取原始图像并运行五种特定的变换:
    • EnlightenGAN: 使其变亮。
    • GFPGAN: 尝试修复面部。
    • Real-ESRGAN: 使其看起来更清晰(超分辨率)。
    • FFDNet: 尝试去除噪声(去噪)。
    • CodeFormer: 另一个面部修复器。
  3. 侦探: 系统随后使用一种特殊的数学工具——神经张量网络 (NTN)。想象这是一个侦探,他不仅仅是做“假”版本与“真”版本的减法。相反,他观察原始图像的特征如何与变换后图像的特征进行相乘和交互。它捕捉到了两者之间仅在面对假图像时才会发生的“隐藏握手”。

结果:新的冠军

团队在名为 UniversalFakeDetect 的大型挑战赛上测试了他们的系统,该挑战赛包含了 19 种不同类型的 AI 生成器,而系统此前从未见过这些生成器。这些生成器包括老派的 GAN、现代扩散模型以及介于两者之间的所有模型。

  • 得分: GenRes++ 实现了 95.7% 的准确率 (mACC) 和 99.1% 的平均精度 (mAP)。
  • 对比: 它击败了测试的所有其他方法,包括之前的最佳方法如 C2P-CLIP(得分为 93.8%)和 FreLens(95.0%)。
  • 证明: 即使他们只使用其中一个魔法滤镜(特别是去噪滤镜 FFDNet),系统的表现仍然优于旧方法,得分为 92.6%。但将五个滤镜结合使用才是真正的赢家。

论文对什么的表示“否定”

作者明确指出哪些做法是行不通的:

  • 不再使用“一刀切”的指纹: 他们认为寻找由特定生成器(如特定的 GAN)留下的特定伪影是一条死胡同。如果你针对一种类型的假图像进行训练,那么当出现一种新的假图像类型时,你就会失败。
  • 不再进行“孤立”检测: 他们拒绝仅仅分析单张图像的想法。论文指出,如果不观察图像对第二个过程的反应,就会错过最重要的线索。
  • 目前还没有应对所有情况的万能钥匙: 论文承认,如果同时用过多的问题去冲击图像(模糊 + JPEG 压缩 + 噪声全部在一起),系统会感到困惑,其准确率会下降到 84.9%

缺陷(“但是……”)

论文坦诚地说明了缺点。这个系统很重。

  • 速度: 因为必须运行图像经过五个复杂的滤镜,然后进行繁重的数学计算,所以检查单张图像大约需要 4,625.6 毫秒(大约 4.6 秒)。这几乎是仅使用一个滤镜时的三倍速度。
  • 成本: 它消耗大量的计算资源(11,411.5 GFLOPs)。
  • “面部”偏差: 其中两个魔法滤镜是专门设计用来修复面部的。作者暗示,这可能使系统在识别假脸方面比识别假风景表现得更好,尽管他们并未对此进行专门测试。

总结

论文表明,抓住 AI 伪造的关键不在于盯着图像看,而在于观察图像在尝试改进时是如何“挣扎”的。通过使用来自五个不同魔法滤镜的“第二意见”和一个聪明的侦探(神经张量网络),GenRes++ 提供了一种新的识别伪造的方法,即使在伪造者改变其风格时也能奏效。这是一个强大且审慎的进步,但它还不完全准备好用于实时、分秒级的安全检查。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →