← 最新论文
💻 computer science

Gungnir: Exploiting Stylistic Features in Images for Backdoor Attacks on Diffusion Models

本文提出了 Gungnir,一种针对扩散模型的新型后门攻击,该攻击利用隐蔽的高层风格特征作为触发器,而非显眼的视觉图块,并通过采用重建对抗噪声与短时步长保留技术,在保持有效恶意行为的同时规避最先进的防御措施。

原作者: Lei Zhang, Yu Pan, Bingrong Dai, Lin Wang

发布于 2026-05-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Lei Zhang, Yu Pan, Bingrong Dai, Lin Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你拥有一台魔法艺术机器(即扩散模型),它能绘制出你描述的任意画面。你说“画一只猫”,它就画出一只美丽的猫;你说“画一场日落”,它就绘出一幅日落图。这台机器极其流行且功能强大。

然而,你分享的这篇题为《Gungnir》的论文揭示了一种令人恐惧的新方法,黑客可借此秘密劫持这台机器。

以下是他们发现的简明解析:

1. 旧方法 vs. 新方法

旧方法(以往的攻击):
想象黑客想欺骗这台艺术机器。过去,他们必须在你提供给机器的照片上贴一张微小而明显的贴纸(即“触发器”)。

  • 示例: 你要求画“一只狗”,但同时在照片角落贴上一个小白方块。机器看到这个方块后便认为:“哦,用户想要一顶卡通帽子!”
  • 问题: 这些贴纸很容易被察觉。防御者可以轻松扫描并移除它们。

新方法(Gungnir):
研究人员(Gungnir)发现了一种无需任何贴纸、文字或怪异符号即可劫持机器的方式。相反,他们利用照片本身的艺术风格作为秘密触发器。

  • 类比: 想象你递给机器一张猫的照片,但这张照片是以文森特·梵高那种特定的、漩涡般的风格绘制的。
  • 诡计: 机器看到的不仅仅是一只猫;它“感受”到了梵高的风格。黑客已训练机器,使其一旦识别出这种特定风格,便忽略你画猫的请求,转而绘制一幅黑客想要的秘密隐藏图像(例如炸弹或特定标志)。
  • 为何可怕: 对人类而言,这张照片看起来只是一幅正常而美丽的梵高风格猫画。没有贴纸,没有怪异文字,看起来百分之百干净。

2. 他们如何实现(两种秘密工具)

研究人员发现,仅使用一张“风格”照片起初并不奏效。机器会感到困惑并崩溃。为解决这一问题,他们发明了两项特殊技术:

  • 工具一:“重建对抗噪声”(RAN)

    • 问题: 当机器尝试学习该诡计时,因“风格”过于模糊而感到困惑。这就像在狗奔跑时仅轻声说“坐下”来教它坐下。狗(即机器)会感到沮丧并停止学习。
    • 解决方案: 研究人员创造了一种特殊的“噪声”(杂讯),它充当引导。这就像在狗奔跑时给它零食,然后逐步引导它坐下。这种噪声帮助机器确切理解如何将“梵高风格”与“秘密炸弹图像”关联起来,而不会混淆。
  • 工具二:“短时程步保留”(STTR)

    • 问题: 如果强迫机器在整个绘画过程(从最初模糊的笔触到最终细节丰富的画面)中学习该诡计,它会出现“过拟合”。它会过度沉迷于该诡计,以至于忘记如何绘制普通图像。即使你没有提供梵高风格,它也开始绘制秘密炸弹。
    • 解决方案: 研究人员告诉机器:“仅在绘画过程的最初几步中学习此诡计。”
    • 类比: 想象一位厨师学习秘密食谱。与其强迫他在烹饪的每一步都使用秘密食材(这会毁掉整道菜),不如仅在烹饪开始时加入该秘密食材。其余烹饪步骤照常进行。这样,厨师仍能制作正常菜肴,但若以该特定秘密食材开始,最终成品就会出错。

3. 结果:他们能检测到吗?

研究人员将他们的"Gungnir"攻击与当前可用的最佳安全卫士(防御系统)进行了测试。

  • 隐蔽性: 由于触发器仅是一种“风格”(如绘画风格),安全卫士无法发现它。他们寻找贴纸或怪异文字,却一无所获。攻击的检测率为0%
  • 成功率: 尽管攻击是隐藏的,但它非常有效。当机器看到特定风格时,成功绘制出秘密图像。
  • 韧性: 即使机器所有者尝试通过重新训练(微调)来“清理”机器,该秘密诡计仍保持隐藏并持续运作。

总结

《Gungnir》这篇论文表明,黑客无需在你的照片上贴便条即可劫持 AI 艺术生成器。他们只需将你的照片艺术风格更改为某种特定、预先约定的风格。对人类而言,它看起来是一幅正常而美丽的画作。但对被劫持的 AI 而言,该风格是一条秘密指令,迫使其生成危险或不需要的内容。

这是一种新型的“隐形”后门,极难检测,因为它隐藏于图像的“氛围”之中,而非像素本身。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →