← 最新论文
💻 computer science

BadBlocks: Low-Cost and Stealthy Backdoor Attacks Tailored for Text-to-Image Diffusion Models

本文介绍了 BadBlocks,这是一种针对文本到图像扩散模型的轻量级且隐蔽的后门攻击,它通过选择性地毒化特定的 UNet 模块,在最小化计算资源的同时实现高成功率并规避最先进的防御措施。

原作者: Jia Wu, Yu Pan, Junjun Yang, Yi Du

发布于 2026-05-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Jia Wu, Yu Pan, Junjun Yang, Yi Du

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你有一位主厨(即人工智能),他只需阅读一张食谱卡(即文本提示),就能为你烹制出任何你想要的菜肴。这位主厨才华横溢,但一篇名为BadBlocks的新论文揭示了一种阴险的手段,可以“黑入”主厨的大脑,使其在听到你低声说出特定暗号时,秘密地遵循另一份危险食谱。

以下是这种"BadBlocks"攻击的工作原理,使用简单的类比进行解析:

1. 问题所在:“全面翻新”与“微小修补”

通常,若要“黑入”一位 AI 主厨,攻击者必须对厨房进行大规模的“全面翻新”。他们需要从头重新训练整个模型,或调整几乎每一个部分。

  • 旧方法:想象一下,试图通过重建主厨的整栋房子、更换每一块砖头、重新铺设每一盏电线的线路来改变主厨的想法。这需要巨大的资金、时间和能量(计算能力)。
  • BadBlocks 方法:研究人员发现,你无需重建整栋房子。你只需要更换走廊里的三个特定灯泡。通过微调 AI 大脑中一个极小且特定的部分(称为"UpSample 块”),他们就能让主厨遵循秘密食谱。
  • 结果:这种新方法比旧方法节省 70% 的内存,并节省 80% 的时间。这就像通过撬开一个薄弱的小锁来黑入银行金库,而不是试图炸毁整栋大楼。这意味着,即使是拥有普通家用电脑(“消费级 GPU")的人现在也能做到这一点,而不再仅限于那些拥有超级计算机的人。

2. 隐蔽性:“隐形墨水”技巧

黑客面临的最大挑战始终是避免被发现。现代安全系统(防御机制)会寻找“同化”迹象。

  • “同化”问题:想象一下,如果你试图通过重写整个乐团的歌词来改变一首歌曲,音乐听起来会非常怪异,指挥(即安全系统)会立即察觉出不对劲。整首歌都变了,使得“后门”显而易见。
  • BadBlocks 解决方案:BadBlocks 就像在乐谱的一页纸上用隐形墨水写下秘密信息。乐团其余部分完全按照原样演奏。由于 99% 的音乐保持完美,安全系统会认为:“一切听起来都很正常!”
  • 为何有效:该攻击仅改变了 AI 中负责图像最终“润色”的部分。那些接收提示并启动过程的部分保持原样。这欺骗了那些通过观察整体画面来寻找异常的安全系统。

3. 触发器:“魔法词”

就像在电影中一样,黑客需要一个触发器来激活后门。

  • 工作原理:攻击者可以将触发器隐藏在文本提示中。它可以是一个你看不见的奇怪符号(如隐藏的 Unicode 字符)、一个特定短语或一个奇怪的字母。
  • 效果:如果你让 AI“画一只猫”,它会画一只正常的猫。但如果你让它“画一只猫 [秘密代码]",它会突然画出一件恶意物品或完全不同的东西,比如武器或特定人物,而用户并不知道代码的存在。

4. 发现:并非所有大脑都同等脆弱

研究人员进行了深入挖掘(即“消融研究”),以查看 AI 的哪些部分最易受攻击。

  • 发现:他们发现 AI 并非在所有地方都同样敏感。某些层就像建筑物的“地基”(ResNet 层)——如果你动它们,整个结构就会崩塌。其他层则像“收尾工作”(Transformer 和归一化层)。
  • 策略:BadBlocks 针对的是“收尾工作”。他们发现,如果你只微调图像正在被锐化的最后几层,你就可以注入后门,而不会破坏 AI 在其他情况下绘制正常图片的能力。

5. 核心结论

BadBlocks 是一个警告,表明黑入 AI 图像生成器的门槛已显著降低。

  • 以前:你需要超级计算机和大量时间来黑入 AI,且结果往往显而易见。
  • 现在:你可以在普通游戏电脑上,在极短的时间内完成,而被黑入的 AI 在听到秘密代码之前,其外观和行为都完全正常。

该论文总结道,由于这种方法如此廉价、快速且难以检测,它构成了严重的安全风险。这表明当前的安全卫士(防御机制)正在寻找错误的东西,我们需要新的方法来保护这些 AI 模型。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →