← 最新论文
🤖 AI

A Comprehensive Dataset for Human vs. AI Generated Image Detection

本文介绍了 MS COCOAI,这是一个包含由五种领先人工智能模型生成的 96,000 张真实和合成图像的综合数据集,旨在推动检测和识别人工智能生成媒体来源的研究。

原作者: Rajarshi Roy, Ashhar Aziz, Shashwat Bajpai, Nasrin Imanpour, Gurpreet Singh, Shwetangshu Biswas, Kapil Wanaskar, Parth Patwa, Subhankar Ghosh, Shreyas Dixit, Nilesh Ranjan Pal, Vipula Rawte, Ritvik Ga
发布于 2026-05-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Rajarshi Roy, Ashhar Aziz, Shashwat Bajpai, Nasrin Imanpour, Gurpreet Singh, Shwetangshu Biswas, Kapil Wanaskar, Parth Patwa, Subhankar Ghosh, Shreyas Dixit, Nilesh Ranjan Pal, Vipula Rawte, Ritvik Garimella, Amitava Das, Amit Sheth, Gaytri Jena, Vasu Sharma, Aishwarya Naresh Reganti, Vinija Jain, Aman Chadha

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你走进一家巨大的艺术画廊。一半的画作是人类拍摄的真实照片,另一半则是由一支才华横溢但隐形的机器人团队创作的杰作。问题在于?这些机器人变得如此出色,以至于你仅凭肉眼无法分辨真伪。

本文旨在建立一个训练营和一个测试,以帮助我们识别机器人创作的艺术品。以下是用通俗语言进行的拆解:

1. 问题:图片的“恐怖谷”

我们拥有强大的 AI 工具(如 Stable Diffusion、DALL-E 3 和 MidJourney),它们可以从零开始生成图像。它们令人惊叹,但也正被用来散布谎言或假新闻。由于这些图像看起来如此真实,我们的眼睛(甚至旧的计算机程序)正受到蒙蔽。我们需要一种更好的方法来识破它们。

2. 解决方案:"MS COCOAI"数据集

作者构建了一个包含 96,000 张图片的巨大图书馆,用于训练计算机成为更出色的侦探。可以将这个图书馆视为一个受控的科学实验

  • “真实”组:他们从著名的 MS COCO 数据库中选取了 16,000 张真实照片。这些是带有人类编写描述(标题)的 genuine 照片。
  • “虚假”组:他们将那些完全相同的人类编写描述输入到五种不同的 AI 机器人(Stable Diffusion 2.1、SDXL、SD 3、DALL-E 3 和 MidJourney v6)中。
  • 魔术技巧:由于 AI 和人类摄影师使用了相同的描述,生成的图片在内容上是“双胞胎”。
    • 类比:想象你要求一位人类厨师和一位机器人厨师制作“草莓巧克力蛋糕”。如果机器人制作的蛋糕看起来略有不同,我们知道这是机器人的错,而不是因为机器人被要求制作“辣披萨”而不是蛋糕。这有助于研究人员将“内容偏差”与"AI 伪影”区分开来。

3. 压力测试:“体操套路”

为了确保检测器足够强大,作者不仅提供了干净的图片,还对 AI 图片应用了四种“特技”,就像体操运动员增加动作难度一样:

  1. 翻转:水平镜像图像。
  2. 变暗:使图像变暗。
  3. 噪点:在图片中添加类似电视的“雪花”(噪声)。
  4. 压缩:压缩文件大小(就像在手机保存照片一样),使其略微模糊。

这确保了如果检测器有效,即使图像被篡改,它依然有效。

4. 两个挑战(测试)

该论文利用此数据集为计算机设定了两个特定的游戏:

  • 游戏 A(“真人还是机器人?”测试):看一张图片,判断“这是人类制作的还是 AI 制作的?”
    • 结果:一个基础的计算机模型正确率约为80%。这就像人类每猜 5 次能正确 4 次。这是可行的,但并非完美。
  • 游戏 B(“谁制作的?”测试):看一张 AI 图片,猜测是五种机器人中的哪一种制作的。
    • 结果:计算机的正确率仅为**45%**左右。这 barely 优于随机猜测(就像抛硬币)。
    • 为什么这很难? 这就像试图区分五位试图模仿同一种风格的专业伪造者。识别特定的艺术家比仅仅发现艺术品是伪造的要难得多。

5. 他们如何尝试解决(基线)

为了获得一个起点,作者没有使用花哨的新 AI。他们使用了一个标准的相机镜头(ResNet-50 模型),但以不同的方式观察图片:频域

  • 类比:想象观察一幅画不是看它的颜色,而是看它的“振动”或如果它是一件乐器会发出的声音。AI 图像通常具有一种奇怪的“嗡嗡声”或其振动中的特定模式,而人类照片没有。他们训练计算机去聆听这种嗡嗡声。

6. 底线

该论文得出结论,虽然我们在识别图像是否为伪造(游戏 A)方面有所进步,但在弄清楚是哪种具体的 AI 工具制作了它(游戏 B)方面,我们仍然表现糟糕。

他们已向公众发布了这个包含 96,000 对图像(真实 vs. AI)的巨大图书馆,以便其他研究人员可以尝试构建更好的检测器。他们的目标是帮助社会重新信任他们在网上看到的内容。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →