← 最新论文
💻 computer science

Old Tricks, New Models: How Simple Image Transformations Break Modern AI-based Content Moderation

本文证明了简单的、与模型无关的图像变换可以有效地绕过三种主要的商业化人工智能内容审核服务,从而证明仅转向基础模型 API 并不能保证鲁棒的安全,且必须采取分层审核的方法。

原作者: Marco Alecci, Francesco Marchiori, Iyiola Emmanuel Olatunji, Tegawendé F. Bissyandé, Jacques Klein

发布于 2026-07-31
📖 1 分钟阅读☕ 轻松阅读

原作者: Marco Alecci, Francesco Marchiori, Iyiola Emmanuel Olatunji, Tegawendé F. Bissyandé, Jacques Klein

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,互联网是一个繁忙而巨大的数字城市,每秒钟都有数百万人分享照片、视频和故事。为了保护这座城市免受暴力或露骨内容等有害信息的侵害,“城市守卫者”(自动化 AI 系统)会不断扫描通过城门的每一张图片。长期以来,这些守卫者就像是专门负责识别某一特定类型麻烦的专业保安。但最近,科技公司升级到了“超级守卫”——这些庞大、无所不知的 AI 模型承诺能够理解语境并识别更广泛的危险。一个大问题是:这些超级守卫真的更难被欺骗了吗,还是它们只是换了一身华丽的新制服,却依然留着同样的老漏洞?

这篇论文深入探讨了这个问题,测试了这些现代、高科技的 AI 守卫是否会被简单的低技术手段所蒙蔽。这就像尝试让一件违禁物品通过安全扫描仪。你不需要复杂的激光器或缜密的计划;有时,仅仅给物体戴上一副太阳镜、把它倒过来,或者添加一点点静态噪声,就足以让扫描仪认为:“噢,那是无害的!”研究人员想要看看这些昂贵且强大的新 AI 系统是否比旧系统更能看穿这些简单的伪装。

伟大的 AI 伪装测试

本文作者决定玩一场“猫鼠游戏”,测试了目前大科技公司使用的三种最流行的商业图像审核服务:OpenAI 的 “omni-moderation”、亚马逊的 “Rekognition” 以及谷歌的 “SafeSearch”。研究人员并没有试图黑入这些系统或构建一个虚假的 AI 来欺骗它们,而是采用了一种非常简单的方法:他们选取了已经被 AI 标记为“不安全”的图像,并对它们应用了七种不同的、易于实现的视觉变换。

这些变换就像是数字魔术,不需要任何关于 AI 工作原理的特殊知识。它们包括:

  • 反转颜色: 将照片变成负片,就像老式的胶片底片一样。
  • 灰度化: 剥离所有色彩,使其变成黑白图像。
  • 模糊: 轻微涂抹图像,就像透过雾气弥漫的窗户看东西一样。
  • 椒盐噪声: 在图像上撒上随机的黑白点,就像旧电视上的静电噪声一样。
  • 拆分与交换: 将图像的红、绿、蓝部分进行拆解并重新排列。

随后,研究人员将这些“伪装”后的图像重新输入到 AI 系统中,观察 AI 是会依然大喊“危险!”,还是会突然说:“噢,这没问题,你可以通过。”

令人震惊的结果

研究结果非常具有启发性。论文发现,这三种高科技商业 AI 服务都可以通过这些简单、廉价的技巧被绕过。你不需要成为编程天才,也不需要接触 AI 的内部大脑即可做到这一点。

以下是数据所讲述的故事:

  • “一击即中”的技巧: 即使是像反转颜色这样单一、固定的改变,也足以愚弄这些系统。对于亚马逊的 Rekognition 来说,仅仅通过翻转颜色就让 43.97% 的不安全图像看起来变得安全了。谷歌的系统被这种单一技巧愚弄了 6.29% 的次数,而 OpenAI 的系统则被愚弄了 8.11% 的次数。
  • “模糊”与“噪声”技巧: 当研究人员在图像中加入噪声或进行模糊处理时,尤其是如果允许图像看起来不再那么完美时,成功率会更高。例如,在使用“椒盐噪声”技巧时,亚马逊的系统被愚弄了 45.53% 的次数,而谷歌和 OpenAI 的系统即使在图像看起来与原图非常相似的情况下,也被愚弄了超过 30% 的次数。
  • 不同类型的麻烦: AI 对识别不同类型的有害内容并不均衡。当图像涉及自残内容时,系统变得异常脆弱,这是最容易被欺骗的类别。涉及暴力的图像最难被愚弄,但即便如此,它们也并非绝对安全。
  • 多模态内容: 研究人员还测试了“迷因”(含有文字的图像)。尽管这类内容需要 AI 既要阅读文字又要观察图片,但简单的视觉技巧仍然奏效,证明了 AI 的“超级视觉”也存在裂痕。

这对数字城市意味着什么

论文得出结论,仅仅升级到这些新的、强大的 AI 模型并不能自动创建一个抵御有害内容的坚固围墙。“超级守卫”仍然容易受到多年来一直使用的那些简单伪装的攻击。

作者建议,仅仅依靠其中一种 AI 服务作为唯一的防线是危险的。相反,他们提议这些系统应该作为“分层”安全团队的一部分。想象一座城堡:你不仅仅依靠正门守卫,你还有护城河、吊桥和第二道守卫。同样地,在线平台应该将这些 AI 工具作为众多工具中的一个辅助手段,例如将其与其他的检查机制或人工审核相结合,而不是仅仅信任它们能独自捕捉一切。

简而言之,论文表明,虽然 AI 审核已经取得了长足进步,但简单的图像处理这类“老套路”对于绕过“新模型”依然非常有效。这提醒我们,在数字世界中,坏人的小小创意有时确实可以胜过一台非常昂贵的计算机。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →