← 最新论文
💻 computer science

RedEdit: Agentic Red-Teaming of Image Safety Classifiers via MCTS-Guided Photo-Editing

该论文介绍了 RedEdit,这是一个结合了视觉语言模型提议者与蒙特卡洛树搜索的黑盒智能体框架,旨在通过极小且保持语义不变的照片编辑来有效绕过图像安全分类器,从而揭示当前内容审核系统中存在的关键漏洞。

原作者: Weilin Lin, Ziqi Lin, Zhenxing Zhou, Jianze Li, Tong Zhang, Hui Xiong, Li Liu

发布于 2026-06-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Weilin Lin, Ziqi Lin, Zhenxing Zhou, Jianze Li, Tong Zhang, Hui Xiong, Li Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,互联网是一个巨大且繁忙的城市广场。为了保持安全,这座城市雇佣了保安(被称为“图像安全分类器”)来扫描人们试图发布的每一张图片。他们的工作是识别并拦截危险或冒犯性的图像——例如暴力、自残或仇恨言论——以免其被他人看到。

长期以来,我们一直认为这些保安非常强硬。但这篇文章,RedEdit,提出了一个简单的问题:如果有人试图通过稍微调整图片(就像人类使用修图软件那样)来戏弄保安,会发生什么呢?

以下是他们找到答案的过程,用简单的语言进行了解释。

问题所在:“隐蔽编辑”

在现实生活中,人们经常使用简单的工具来修改照片:他们可能会旋转图像、将其变为黑白、添加水印或改变颜色。这些都是正常的编辑操作。

研究人员发现,这些日常的简单变化可以起到一种**“魔法斗篷”**的作用。一张对人类来说明显“不安全”的图片,可以通过轻微的改动,让计算机保安认为:“哦,现在看起来很安全!”从而放行。有害内容依然存在(人类仍能看出其危险性),但计算机被骗过了。

解决方案:“数字侦探”(RedEdit)

为了测试这些保安有多脆弱,作者构建了一个新的 AI 智能体,名为 RedEdit。请不要把 RedEdit 看作黑客,而要把它看作一个超级聪明的数字侦探,试图寻找一种方法,将“违禁”物品偷运过保安的检查。

RedEdit 使用了两种特殊技能来实现这一目标:

  1. “直觉”(VLM 提议者):
    想象一位知道哪些照片滤镜通常会让安全摄像头产生困惑的人类专家。RedEdit 有一个“大脑”(视觉语言模型),它观察图片并说道:“嗯,如果我把这张图变成‘复古棕褐色’(sepia)或者旋转 90 度,保安可能会感到困惑。” 它会提出一些有针对性的聪明建议,而不是盲目地随机猜测。

  2. “策略棋盘”(MCTS 规划器):
    这是最重要的部分。想象一场国际象棋比赛。如果你走了一步棋却失败了,一个优秀的棋手不会只是沿着这条错误的路径继续走下去;他们会回溯并尝试不同的走法。
    RedEdit 使用“蒙特卡洛树搜索”(MCTS)来构建可能性的地图。

    • 它尝试一种变化(例如:“变成灰度图”)。
    • 它检查保安的反应。
    • 如果保安仍然抓住了它,RedEdit 会立即回溯并尝试另一条路径(例如:“也许我应该加一个边框”)。
    • 它不断重复这个过程,探索最有希望的路径并放弃那些糟糕的路径,直到找到完美的编辑组合。

重大发现

研究人员在大量已知的违规图像(777 张)上测试了 RedEdit。结果令人震惊:

  • 所需精力极少: 平均而言,RedEdit 只需要进行不到两次编辑就能骗过保安。
  • 效果极其出色: 它成功欺骗了检测器的概率高达 76.2%
  • 危险依然存在: 即便经过编辑后,93% 的图像对人类来说看起来仍然是危险的。“魔法斗篷”骗过了计算机,但内容本身依然有害。

“普遍的弱点”

论文还测试了这种技巧是否适用于不同类型的保安(不同的 AI 模型)。

  • 结果: 是的。骗过一个保安的编辑往往也能骗过其他保安,即使这些保安是由不同的公司开发的。
  • 类比: 这就像是找到了一把能打开许多不同锁的万能钥匙。这表明问题不仅仅是某个特定的保安太弱,而是这是一个系统性问题——即目前所有的保安在面对简单的照片编辑时,都存在类似的盲点。

为什么这很重要

作者并不是想教人们如何违法。相反,他们是在发出警报。他们发现,我们目前的安全性系统在面对简单的低技术手段时,显得异常脆弱。

总结如下:

  • 威胁: 恶意行为者不需要超级计算机来绕过安全过滤器;他们只需要使用标准的修图软件进行微小的调整即可。
  • 工具: RedEdit 是一个自动化该过程的工具,旨在向我们展示破坏系统竟然如此容易。
  • 行动呼吁: 作者要求技术界不要忽视这种“低技术”威胁,并建立能够处理这些简单的、日常照片编辑的安全系统。

文章结论指出,我们需要更加关注这一被忽视的危险,因为目前,仅仅一个“复古棕褐色滤镜”就足以让危险内容从缝隙中溜走。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →