← 最新论文
🤖 machine learning

Adversarial Robustness of AI-Generated Image Detectors in the Real World

本文表明,即使在现实世界的图像退化情况以及商业工具的使用环境下,最先进的 AI 生成图像检测器也极易受到黑盒对抗攻击的影响,这凸显了开发更具鲁棒性的检测方法以维护公众信任的紧迫需求。

原作者: Sina Mavali, Jonas Ricker, David Pape, Asja Fischer, Lea Schönherr

发布于 2026-06-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Sina Mavali, Jonas Ricker, David Pape, Asja Fischer, Lea Schönherr

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一场高水平的“识破伪装”游戏,参赛双方是两支队伍:生成者(创造完美假照片的 AI 艺术家)和侦探(试图识破它们的 AI 工具)。

这篇论文就像是一份安全审计报告,提出了一个令人胆战心惊的问题:“罪犯有多容易欺骗侦探?”

以下是研究人员发现的内容,使用了简单的类比:

1. 背景设定:处于“玻璃房”中的侦探

目前,我们拥有非常聪明的 AI 侦探(例如商业工具 HIVE 以及几种学术工具),当照片处于完好状态时,它们非常擅长识别 AI 生成的图像。它们就像保安,如果一张假身份证在强光下被完美地展示出来,他们能一眼识破。

然而,研究人员发现这些保安有一个致命缺陷:它们很容易被微小的、隐形的诡计所迷惑。

2. 攻击手段: “魔法尘埃”

研究人员尝试使用对抗性样本来欺骗这些侦探。把这想象成在假照片上撒上一种特殊的、隐形的“魔法尘埃”。

  • 对人类肉眼来说,照片看起来完全一样。
  • 但对 AI 侦探来说,这些尘埃改变了照片的“数学指纹”,足以让侦探认为:“噢,这绝对是一张真实的摄影照片!”

他们发现目前的尖端侦探极其脆弱。通过使用正确的“尘埃”(具体称为多样化输入攻击,Diverse Input Attack),他们可以将一个准确率为 87% 的侦探变成一个**几乎完全失效(准确率为 0%)**的侦探。这就像是将一只训练有素的猎犬变成了一只把狼误认为小狗的狗。

3. 现实世界测试:“社交媒体搅拌机”

该领域的一个主要担忧是:“如果照片在上传到 Instagram 或 Twitter 时经过了压缩、缩放或变得模糊,这种诡计还会奏效吗?”

通常,当你上传照片时,社交媒体平台会通过一个“搅拌机”(压缩和缩放处理)来破坏精细的细节。研究人员曾担心这个“搅拌机”可能会洗掉“魔法尘埃”,从而导致攻击失败。

令人震惊的结果: 攻击仍然奏效
即使在照片经过典型的社交媒体处理而降级后,侦探仍然被蒙蔽了。

  • 类比: 想象攻击者用隐形墨水绘制了一张假身份证。你可能会认为,“如果我把纸揉皱并扔进碎纸机,墨水就会消失。”但在这种情况下,由于这套墨水设计得如此巧妙,即使在纸张被揉皱和粉碎后,保安仍然接受了这张身份证。

4. 商业验证:破解“黑箱”

为了证明这不仅仅是实验室里的实验,他们测试了他们的诡计对 HIVE(一种人们正在使用的流行、现实世界的商业侦探工具)的效果。

  • 攻击前: HIVE 几乎完美(准确率 98.9%)。
  • 攻击后: 其准确率降至 76.6%。
  • HIVE 团队证实了这些结果是有效的。这证明了即使是市场上最好的商业工具,也可以被了解正确技巧的人所绕过。

5. 防御手段: “防弹背心”

研究人员不仅在破坏,他们也在尝试修复。他们问道:“我们能否给侦探穿上一件防弹背心?”

他们用一种特殊的、经过鲁棒训练的版本(称为 RobustCLIP)替换了侦探标准的“眼睛”。这就像是训练保安去完全忽略那些“魔法尘埃”。

  • 结果: 有效!这个鲁棒的侦探变得更难被欺骗了。
  • 代价: 这其中存在权衡。给侦探穿上“防弹背心”会让它在观察正常的、干净的照片时变得稍微慢一些,且不够敏锐。这有点像穿着沉重的盔甲:你在攻击面前更安全,但在平静的情况下,你的动作会变慢,也可能会错过一些微小的细节。

研究结果总结

  1. 侦探很脆弱: 现有的 AI 侦探很容易被欺骗,甚至在攻击者不知道侦探内部运作机制的情况下也是如此。
  2. 社交媒体无法拯救我们: 将照片上传到 Instagram 或 Facebook 并不会自动修复这种漏洞;攻击在经过压缩后依然有效。
  3. 现实工具面临风险: 即使是昂贵的商业工具也会被愚弄。
  4. 防御是可能的,但不完美: 我们可以通过改变侦探底层的“大脑”来使其更具鲁棒性,但这会使它们在处理正常照片时准确性略有下降。

底线结论: 论文警告说,仅仅依靠目前的 AI 侦探来阻止虚假图像是危险的。这场在造假者与侦探之间的“军备竞赛”目前正由造假者占据上风,我们需要更强大、更具鲁棒性的防御措施,以应对现实世界的复杂情况。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →