A Comprehensive Dataset for Human vs. AI Generated Image Detection
本文介绍了 MS COCOAI,这是一个包含由五种领先人工智能模型生成的 96,000 张真实和合成图像的综合数据集,旨在推动检测和识别人工智能生成媒体来源的研究。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你走进一家巨大的艺术画廊。一半的画作是人类拍摄的真实照片,另一半则是由一支才华横溢但隐形的机器人团队创作的杰作。问题在于?这些机器人变得如此出色,以至于你仅凭肉眼无法分辨真伪。
本文旨在建立一个训练营和一个测试,以帮助我们识别机器人创作的艺术品。以下是用通俗语言进行的拆解:
1. 问题:图片的“恐怖谷”
我们拥有强大的 AI 工具(如 Stable Diffusion、DALL-E 3 和 MidJourney),它们可以从零开始生成图像。它们令人惊叹,但也正被用来散布谎言或假新闻。由于这些图像看起来如此真实,我们的眼睛(甚至旧的计算机程序)正受到蒙蔽。我们需要一种更好的方法来识破它们。
2. 解决方案:"MS COCOAI"数据集
作者构建了一个包含 96,000 张图片的巨大图书馆,用于训练计算机成为更出色的侦探。可以将这个图书馆视为一个受控的科学实验。
- “真实”组:他们从著名的 MS COCO 数据库中选取了 16,000 张真实照片。这些是带有人类编写描述(标题)的 genuine 照片。
- “虚假”组:他们将那些完全相同的人类编写描述输入到五种不同的 AI 机器人(Stable Diffusion 2.1、SDXL、SD 3、DALL-E 3 和 MidJourney v6)中。
- 魔术技巧:由于 AI 和人类摄影师使用了相同的描述,生成的图片在内容上是“双胞胎”。
- 类比:想象你要求一位人类厨师和一位机器人厨师制作“草莓巧克力蛋糕”。如果机器人制作的蛋糕看起来略有不同,我们知道这是机器人的错,而不是因为机器人被要求制作“辣披萨”而不是蛋糕。这有助于研究人员将“内容偏差”与"AI 伪影”区分开来。
3. 压力测试:“体操套路”
为了确保检测器足够强大,作者不仅提供了干净的图片,还对 AI 图片应用了四种“特技”,就像体操运动员增加动作难度一样:
- 翻转:水平镜像图像。
- 变暗:使图像变暗。
- 噪点:在图片中添加类似电视的“雪花”(噪声)。
- 压缩:压缩文件大小(就像在手机保存照片一样),使其略微模糊。
这确保了如果检测器有效,即使图像被篡改,它依然有效。
4. 两个挑战(测试)
该论文利用此数据集为计算机设定了两个特定的游戏:
- 游戏 A(“真人还是机器人?”测试):看一张图片,判断“这是人类制作的还是 AI 制作的?”
- 结果:一个基础的计算机模型正确率约为80%。这就像人类每猜 5 次能正确 4 次。这是可行的,但并非完美。
- 游戏 B(“谁制作的?”测试):看一张 AI 图片,猜测是五种机器人中的哪一种制作的。
- 结果:计算机的正确率仅为**45%**左右。这 barely 优于随机猜测(就像抛硬币)。
- 为什么这很难? 这就像试图区分五位试图模仿同一种风格的专业伪造者。识别特定的艺术家比仅仅发现艺术品是伪造的要难得多。
5. 他们如何尝试解决(基线)
为了获得一个起点,作者没有使用花哨的新 AI。他们使用了一个标准的相机镜头(ResNet-50 模型),但以不同的方式观察图片:频域。
- 类比:想象观察一幅画不是看它的颜色,而是看它的“振动”或如果它是一件乐器会发出的声音。AI 图像通常具有一种奇怪的“嗡嗡声”或其振动中的特定模式,而人类照片没有。他们训练计算机去聆听这种嗡嗡声。
6. 底线
该论文得出结论,虽然我们在识别图像是否为伪造(游戏 A)方面有所进步,但在弄清楚是哪种具体的 AI 工具制作了它(游戏 B)方面,我们仍然表现糟糕。
他们已向公众发布了这个包含 96,000 对图像(真实 vs. AI)的巨大图书馆,以便其他研究人员可以尝试构建更好的检测器。他们的目标是帮助社会重新信任他们在网上看到的内容。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。