← 最新论文
💻 computer science

AEGIS: A Mechanism-Guided Defense against Visual Synonym Jailbreaks in Text-to-Image Models

本文介绍了 AEGIS,这是一种机制引导的防御机制,它在推理过程中动态地识别并引导稀疏的语义注入注意力头,从而在有效中和文生图模型中视觉同义词越狱攻击的同时,保留良性概念的保真度。

原作者: Yuanmin Huang, Zhenfei Zhang, Mi Zhang, Geng Hong, Qinqin He, Jialing Tao, Hui Xue, Min Yang

发布于 2026-07-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Yuanmin Huang, Zhenfei Zhang, Mi Zhang, Geng Hong, Qinqin He, Jialing Tao, Hui Xue, Min Yang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心问题:AI 艺术中的“特洛伊木马”

想象你有一位非常有才华但有点鲁莽的艺术家(AI),他会根据你的描述画出任何东西。你在门口安排了一名保安(安全过滤器),以阻止人们要求画出暴力或裸露的内容。

  • 旧方法: 如果有人说,“画一个血腥的犯罪现场”,保安会立即拦截他们。
  • 新骗局(视觉同义词攻击): 一个聪明的攻击者走上前来说,“画一桶洒出来的深红色油漆。”
    • 对于保安来说,这听起来完全无害。这只是油漆而已!
    • 但对于艺术家的脑子来说,“深红色油漆”和“血液”在视觉上非常相似,以至于艺术家还是会开始画出一个犯罪现场。

这就是所谓的视觉同义词攻击 (Visual Synonym Attack, VSA)。文字是安全的,但生成的图片却是危险的。

困境:“丢了西瓜捡芝麻”的问题

论文解释说,目前的防御手段正陷入一个糟糕的选择中:

  1. 无所作为: 让“红油漆”这类请求通过,结果你会得到暴力的图像。
  2. 拦截一切: 为了阻止“红油漆”攻击,你告诉艺术家,“永远不要再使用红色油漆了。”
    • 结果: 现在艺术家无法画番茄酱、草莓或日落了。你为了阻止坏人而破坏了艺术家画无害事物的能力。这被称为过度缓解 (over-mitigation)

解决方案:AEGIS(“外科手术式的间谍”)

研究人员创造了一种名为 AEGIS 的新防御机制。它不像是在门口站岗或禁止整个颜色,AEGIS 更像是一个外科手术式的间谍,在艺术家绘画时观察艺术家的脑回路。

以下是它的工作步骤:

1. 调查(机制分析)

研究人员问道:在 AI 的大脑内部,究竟是在哪里将“红油漆”变成了“血液”的?

他们发现,AI 并不是一个完整的大脑,而是由数以千计的小型工人(称为注意力头/attention heads)组成的。

  • 发现: 当 AI 绘制某些不当内容时,它并不是在使用所有的工人。它只使用了一小部分特定的工人(约 10% 的工人),即“语义注入头 (Semantic-Injecting Heads)”。
  • 类比: 想象一个庞大的管弦乐队。当音乐变得恐怖时,并不是整个乐队都在大声演奏,而是后排的三个特定的小提琴手开始演奏了一段恐怖的旋律。

2. 策略(自适应引导)

与其解雇整个乐队(这会毁掉音乐)或者忽视那些小提琴手(这会让恐怖旋律继续播放),AEGIS 采取了聪明的做法:

  • 识别捣蛋鬼: 它准确知道哪些 10% 的工人负责将“红油漆”转化为“血液”。
  • 施加“排斥力”: 当这些特定的工人试图画出不安全的东西时,AEGIS 会轻轻地将它们的手推开,使其远离那个可怕的想法。
  • 它很聪明: 如果工人们试图画一个无害的红番茄,AEGIS 会不去理会。只有当“恐怖旋律”真的在演奏时,它才会进行推开。

3. 结果

  • 安全性: “红油漆”类的请求不再会演变成暴力画面。攻击失败了。
  • 效用性: 艺术家仍然可以完美地画出番茄酱、草莓和日落。这种“无害的”红色被保留了下来。
  • 速度: 因为 AEGIS 在绘画过程中只微调了极少数的工人,所以它不会让 AI 变慢。它不需要重新训练整个艺术家,只需作为一个实时监督者即可。

为什么这很重要

该论文声称这是一个突破,因为它解决了“安全性 vs. 效用性”的困境。以前的方法就像是用大锤去杀苍蝇(屏蔽所有红色事物)。AEGIS 则像是用激光笔精准地击中苍蝇,而不触及房间里的其他部分。

他们在不同的 AI 模型(如 Stable Diffusion 和 FLUX)上进行了测试,发现 AEGIS 在不破坏艺术质量的前提下,比任何其他方法都能更好地阻止“视觉同义词”诡计。

简而言之: AEGIS 找到了 AI 大脑中那个将安全词汇变为危险图像的微小隐藏开关,并在必要时将其关闭,从而在保持 AI 安全的同时,也保持了它的创造力。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →