← 最新论文
💻 computer science

CoDA: Color Distribution Probing for Efficient and Generalizable AI-Generated Image Detection

本文介绍了 CoDA,一种基于颜色分布探测的高效且可泛化的 AI 生成图像检测器,以及 FakeForm,一个旨在评估跨模型和跨域鲁棒性的大规模基准测试。

原作者: Zexi Jia, Zhiqiang Yuan, Xiaoyue Duan, Jinchao Zhang, Jie Zhou, Anil K. Jain

发布于 2026-05-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Zexi Jia, Zhiqiang Yuan, Xiaoyue Duan, Jinchao Zhang, Jie Zhou, Anil K. Jain

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在一家画廊里试图找出赝品画作。长期以来,专家们一直在寻找微小的笔触错误或奇怪的纹理(即“法医”方法)。但随着 AI 艺术家水平的提升,这些微小错误逐渐消失了。另一方面,有些专家利用庞大且超级智能的 AI 大脑来分析整幅图像,但这些大脑过于笨重且缓慢,无法用于实时场景,而且它们有时会被非照片类内容(如医学扫描或卡通画)搞得晕头转向。

本文介绍了一位名为CoDA的新型轻量级“侦探”,以及一个用于测试它的庞大新“考试”——FakeForm

核心理念:“色彩情绪环”

作者们注意到 AI 在“思考”色彩时存在一个有趣的现象。

  • 真实照片:当你拍摄一张真实照片时,相机会经历一个复杂的过程(就像厨师遵循严格的食谱),以确保色彩看起来自然、平衡且平滑。
  • AI 图像:AI 模型没有相机。它们只是猜测像素应该呈现的样子。因此,它们的色彩往往感觉有些“不对劲”——有时过于鲜艳,有时以奇怪的方式聚集在一起,或者缺乏现实生活中那种微妙、平滑的过渡。

作者将这种现象称为色彩分布伪影。这就像是一杯完美混合、质地顺滑的冰沙(真实照片)与一杯果肉块依然分明且分布不均的冰沙(AI 图像)之间的区别。

工具:“噪声量化探针”

为了在不依赖庞大 AI 大脑的情况下捕捉这种细微差异,研究人员构建了一个名为噪声量化探针的简单工具。

可以这样理解:

  1. 抖动:想象你有一个装满弹珠(图像)的罐子。你轻轻摇晃罐子(添加噪声)。
  2. 过滤:然后,你尝试将弹珠重新归类到整齐、特定的颜色 bins 中(量化)。
  3. 平均:你多次进行这种摇晃和分类,并观察平均结果。
  • 如果是真实照片:色彩如此自然平衡,以至于当你摇晃并分类它们时,它们几乎完美地回归原位。“抖动”不会留下混乱。
  • 如果是 AI 图像:因为色彩原本就不均匀或“聚集”,摇晃会使混乱加剧。当你尝试将其平均化时,你会看到可见的“幽灵”或残留的错误模式。

CoDA 利用这种“幽灵”模式作为线索。它不仅仅观察图像本身,还观察图像对少量数字混乱的反应。

新考试:FakeForm

本文认为,大多数以往的测试都太简单了。它们主要使用人物和风景照片。如果一个检测器擅长识别人物赝品,那么在识别伪造的医学 X 光片、流程图或卡通画时可能会完全失效。

为了解决这个问题,作者们创建了FakeForm

  • 规模:这是一个庞大的试题库,包含约370,000 张图像
  • 多样性:它涵盖了62 个不同的领域。这包括从标准照片到 CT 扫描、深度图、古代水墨画以及电子游戏图形的一切内容。
  • 人为因素:他们不仅仅依赖计算机;他们让人类观看了超过760,000 张图像,以评估其“真实”程度并解释原因。这建立了一个黄金标准,用于衡量计算机的表现与人类相比如何。

结果:小而强大

当他们在这一新且严苛的考试中测试 CoDA 时:

  • 速度:CoDA 极其快速且小巧(仅 148 万参数)。与其他方法使用的缓慢、笨重的卡车(大型 AI 模型)相比,它就像一辆跑车。它可以每秒处理超过 125 张图像。
  • 准确性:当其他检测器从照片转向医学扫描或卡通画等内容时表现挣扎,CoDA 却保持了强劲表现。它在困难的“跨域”测试中取得了最佳结果,证明观察色彩模式是一种可靠的识假方法,即使主题发生变化也是如此。
  • 鲁棒性:即使图像模糊、压缩或被裁剪(就像通过糟糕的互联网连接发送的照片),CoDA 仍然运作良好,因为色彩“幽灵”模式依然可见。

局限性

本文承认 CoDA 并非万能。它在有色彩可供分析时效果最佳。

  • 表现优异之处:照片、彩色卡通和游戏。
  • 表现挣扎之处:黑白素描、技术图表或文字密集的海报。在这些情况下,“色彩情绪环”是空的,因此检测器必须依赖其他线索,而这些线索更难找到。

总结:本文提出,与其构建更大、更慢的 AI 大脑来识破赝品,不如关注 AI 留下的细微、不均匀的“色彩指纹”。通过使用一种简单、快速的工具来检测这些指纹,我们可以快速且准确地识别伪造图像,即使它们不是人物照片。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →