← 最新论文
🤖 machine learning

Robustness of AI-Art Detectors under Generator Shift

本文表明,当前的 AI 艺术检测器虽然针对其训练生成器有效,但在面对像 Stable Diffusion 3.5 这样较新的架构时会出现显著的性能退化,凸显了必须采取分层防御策略的严重泛化差距。

原作者: Shivank Singh Thakur, Meien Li, Mark Stamp

发布于 2026-08-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Shivank Singh Thakur, Meien Li, Mark Stamp

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一名试图在博物馆中识破伪造画作的侦探。多年来,你的工作一直很轻松,因为伪造者使用一种特定的、过时的胶水,这种胶水会留下独特的、有气味的残留物。你因此打造了一个高科技的鼻子,能够瞬间嗅出那种味道。但现在,伪造者换了一种全新的、无味的胶水,在肉眼看来与原件完全一致。你的鼻子由于只接受过“旧胶水”气味的训练,突然变得沉默了。它再也无法分辨差异。这正是当今数字世界所面临的核心问题。我们拥有可以创作惊人艺术品的生成式人工智能(AI),我们也拥有旨在识别它们的“检测器”。但就像我们的侦探一样,这些检测器通常是针对昨日 AI 的“旧胶水”进行训练的。随着 AI 艺术家变得越来越聪明、使用的工具也越来越多,检测器面临着失明的风险,让伪造图像像真实作品一样悄无声息地混入其中。这之所以重要,是因为如果我们无法辨别真伪,我们就无法信任在线上看到的照片、新闻或艺术品。

这篇论文就像是对那些“数字鼻子”进行的一次压力测试。研究人员想要观察:当一个被训练用来识别由旧 AI 模型制造的伪造品的检测器,突然被要求去捕捉由一个名为 Stable Diffusion 3.5 Medium 的全新、超智能 AI 所制造的伪造品时,会发生什么。他们不仅仅是在猜测,而是构建了一个庞大的新数据集。他们选取了 10,000 幅真实的人类绘画,利用一种被称为“反向提示词”(reverse prompting)的巧妙技巧将它们转化为文字描述,然后将这些描述输入到新的 AI 中以创造完美的数字副本。随后,他们测试了五种不同的检测器“鼻子”(如 ResNet 和 CLIP 等计算机模型),以观察它们是否仍能分辨差异。

结果令人警醒。当检测器观察它们受训时所接触的“旧胶水”图像时,表现近乎完美,几乎抓住了每一个伪造品。但当它们面对新的 AI 图像时,却表现得非常糟糕。检测器并没有开始对真实的人类艺术大喊“伪造!”(这会很烦人),但它们停止对新的 AI 艺术大喊“伪造!”了。事实上,它们漏掉了大约 43% 到 58% 的新 AI 图像,误以为它们是人类创作的。表现最好的检测器——一个名为 CLIP ViT-L/14 的模型——仍然漏掉了近一半的新伪造品。

研究人员使用了一种名为 Grad-CAM 的特殊工具来窥视检测器的“大脑”,看看它们在关注什么。他们发现,当检测器判断正确时,它们会专注于特定的细节,如面部或纹理。但当它们在面对新 AI 时失败时,它们的注意力变得微弱且分散,转而关注随机的边缘或微小的斑点,而不是整个画面。这就像是检测器忘记了伪造品的“气味”是什么样子,因为新的胶水彻底改变了气味。

这项研究表明,我们目前的检测器是脆弱的。它们在受控的课堂环境中表现出色,但在现实世界发生变化时却会失效。作者认为,我们不能依赖单一的检测器来保护安全。相反,我们需要一种“分层防御”,就像一支同时使用金属探测器、警犬和人类检查员的安全团队。如果其中一层因为伪造者更换了工具而失效,其他层或许仍能抓住他们。论文总结道,虽然 AI 艺术检测技术正在进步,但它并非一个已解决的问题,当新的 AI 工具出现时,我们必须谨慎对待,不要过度信任它。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →