想象你拥有一台魔法艺术机器(即扩散模型),它能绘制出你描述的任意画面。你说“画一只猫”,它就画出一只美丽的猫;你说“画一场日落”,它就绘出一幅日落图。这台机器极其流行且功能强大。
然而,你分享的这篇题为《Gungnir》的论文揭示了一种令人恐惧的新方法,黑客可借此秘密劫持这台机器。
以下是他们发现的简明解析:
1. 旧方法 vs. 新方法
旧方法(以往的攻击):
想象黑客想欺骗这台艺术机器。过去,他们必须在你提供给机器的照片上贴一张微小而明显的贴纸(即“触发器”)。
- 示例: 你要求画“一只狗”,但同时在照片角落贴上一个小白方块。机器看到这个方块后便认为:“哦,用户想要一顶卡通帽子!”
- 问题: 这些贴纸很容易被察觉。防御者可以轻松扫描并移除它们。
新方法(Gungnir):
研究人员(Gungnir)发现了一种无需任何贴纸、文字或怪异符号即可劫持机器的方式。相反,他们利用照片本身的艺术风格作为秘密触发器。
- 类比: 想象你递给机器一张猫的照片,但这张照片是以文森特·梵高那种特定的、漩涡般的风格绘制的。
- 诡计: 机器看到的不仅仅是一只猫;它“感受”到了梵高的风格。黑客已训练机器,使其一旦识别出这种特定风格,便忽略你画猫的请求,转而绘制一幅黑客想要的秘密隐藏图像(例如炸弹或特定标志)。
- 为何可怕: 对人类而言,这张照片看起来只是一幅正常而美丽的梵高风格猫画。没有贴纸,没有怪异文字,看起来百分之百干净。
2. 他们如何实现(两种秘密工具)
研究人员发现,仅使用一张“风格”照片起初并不奏效。机器会感到困惑并崩溃。为解决这一问题,他们发明了两项特殊技术:
工具一:“重建对抗噪声”(RAN)
- 问题: 当机器尝试学习该诡计时,因“风格”过于模糊而感到困惑。这就像在狗奔跑时仅轻声说“坐下”来教它坐下。狗(即机器)会感到沮丧并停止学习。
- 解决方案: 研究人员创造了一种特殊的“噪声”(杂讯),它充当引导。这就像在狗奔跑时给它零食,然后逐步引导它坐下。这种噪声帮助机器确切理解如何将“梵高风格”与“秘密炸弹图像”关联起来,而不会混淆。
工具二:“短时程步保留”(STTR)
- 问题: 如果强迫机器在整个绘画过程(从最初模糊的笔触到最终细节丰富的画面)中学习该诡计,它会出现“过拟合”。它会过度沉迷于该诡计,以至于忘记如何绘制普通图像。即使你没有提供梵高风格,它也开始绘制秘密炸弹。
- 解决方案: 研究人员告诉机器:“仅在绘画过程的最初几步中学习此诡计。”
- 类比: 想象一位厨师学习秘密食谱。与其强迫他在烹饪的每一步都使用秘密食材(这会毁掉整道菜),不如仅在烹饪开始时加入该秘密食材。其余烹饪步骤照常进行。这样,厨师仍能制作正常菜肴,但若以该特定秘密食材开始,最终成品就会出错。
3. 结果:他们能检测到吗?
研究人员将他们的"Gungnir"攻击与当前可用的最佳安全卫士(防御系统)进行了测试。
- 隐蔽性: 由于触发器仅是一种“风格”(如绘画风格),安全卫士无法发现它。他们寻找贴纸或怪异文字,却一无所获。攻击的检测率为0%。
- 成功率: 尽管攻击是隐藏的,但它非常有效。当机器看到特定风格时,成功绘制出秘密图像。
- 韧性: 即使机器所有者尝试通过重新训练(微调)来“清理”机器,该秘密诡计仍保持隐藏并持续运作。
总结
《Gungnir》这篇论文表明,黑客无需在你的照片上贴便条即可劫持 AI 艺术生成器。他们只需将你的照片艺术风格更改为某种特定、预先约定的风格。对人类而言,它看起来是一幅正常而美丽的画作。但对被劫持的 AI 而言,该风格是一条秘密指令,迫使其生成危险或不需要的内容。
这是一种新型的“隐形”后门,极难检测,因为它隐藏于图像的“氛围”之中,而非像素本身。
技术摘要:GUNGNIR
问题陈述
扩散模型(DMs)在图像生成领域取得了显著成功,但容易受到后门攻击的威胁。现有的攻击通常依赖于低维、视觉上显眼的触发器(例如特定的噪声块、文本提示或 ControlNet 条件),这些触发器容易被当前的防御机制检测到。诸如触发器反转和神经检测等防御手段之所以有效,是因为先前的攻击仅在有限的输入空间内运作。本文指出了威胁格局中的一个空白:利用高级、感知上难以区分特征进行后门攻击的潜力,具体而言即图像到图像任务中输入图像的风格特征。现有方法难以检测这些微妙的触发器,且由于梯度消失和过拟合问题,标准训练算法在尝试使用原始图像特征作为触发器时往往失败。
方法论:GUNGNIR
作者提出了GUNGNIR,这是一种新颖的后门攻击框架,通过将基于风格的触发器嵌入输入图像中,激活扩散模型中的恶意行为。该方法在图像到图像任务空间内运作,其中输入图像本身充当触发机制。
核心组件
- 风格触发器:与以往注入显式补丁或文本的方法不同,GUNGNIR 利用输入图像固有的风格(例如“梵高的《星月夜》”风格)作为触发器。当模型接收到具有这种特定风格的图像时,无论输入图像的语义内容如何,它都会激活一个隐藏映射以生成目标图像。
- 重构对抗噪声(RAN):
- 问题:在标准后门训练中直接使用输入图像特征作为触发器会导致严重的梯度消失和过拟合。由于噪声预测目标与风格保持之间存在冲突,模型无法学习该映射。
- 解决方案:RAN 从含噪输入和目标图像中重构残差向量 r,而不是直接将目标图像用作训练目标。损失函数被调整为最小化模型预测与该重构对抗噪声之间的差异。
- 机制:残差 r 定义为 r=αtx0+1−αtϵ−trans(it),其中 it 是目标潜在变量。这产生了一个均值偏移,引导模型在消除前一时间步原始分布的同时重构目标图像。
- 短时程保留(STTR):
- 问题:在所有时间步(T)上应用后门注入会导致过拟合。当时步趋近于零时,潜在变量近似于最终图像分布,但中间时间步包含模糊的语义内容。全时间步监督迫使模型将触发器与不稳定的表示相关联,导致模型无论输入如何都生成目标图像(丧失实用性)。
- 解决方案:STTR 将后门注入限制在反向扩散过程的前 Tb 个步骤中。
- 机制:通过将训练监督限制在一个短暂且稳定的时间步窗口内,该方法在确保触发器激活有效的同时,保留了模型对干净输入的原始实用性。这防止了触发器表示与扩散噪声的纠缠。
攻击公式
攻击空间被重新定义,以包含额外的条件空间 Acond(提示、图像、ControlNet)。GUNGNIR 专门针对图像输入空间 Ab={imagesb}。训练过程涉及用触发器风格图像与目标图像的配对污染一小部分(5%)的数据集,利用 RAN 和 STTR 来优化模型参数。
主要贡献
- 攻击输入空间的扩展:本文首次证明,输入图像的原始风格特征可以作为图像到图像任务中有效的后门触发器。这将攻击向量从显式的、低级的扰动转移到了高级的、感知特征上。
- 新颖的训练技术:作者引入了RAN和STTR,以解决在图像特征上训练后门的具体挑战。RAN 通过重构对抗噪声防止梯度消失,而 STTR 通过将注入限制在短时间步内来缓解过拟合。
- 隐蔽性与鲁棒性:生成的嵌入触发器的样本在感知上与干净图像无法区分。该攻击绕过了最先进的防御(Elijah、TERD),这些防御依赖于检测异常模式或反转触发器,而基于风格的触发器不会引入可疑的伪影。
- 迁移能力:研究表明,后门不仅限于图像到图像任务;如果模型被提示以特定的触发器风格生成图像,它也可以在文本到图像任务中被激活。
实验结果
- 攻击成功率(ASR):GUNGNIR 在三个基线模型(Stable Diffusion v1.5、v2.1 和 Realistic Vision v4.0)上实现了 61.50% 的 ASR。虽然低于某些基于补丁的攻击,但作者指出,鉴于其高隐蔽性,这足以构成稳健的攻击。
- 防御规避:该攻击在 Elijah 和 TERD 防御框架下实现了 0% 的后门检测率(BDR)。基于风格的触发器未被检测为异常。
- 鲁棒性:即使在基于微调的净化后,该攻击仍然有效,表现出对常见模型防御策略的抵抗力。
- 消融实验:实验证实,如果没有 RAN,梯度会消失(ASR 降至接近零)。如果没有 STTR,模型会过拟合,不加区分地生成目标图像。在特定的 RAN 强度(γ)和短时间步窗口下发现了最佳性能。
意义与主张
本文声称,GUNGNIR 揭示了扩散模型中一个此前未被充分探索的漏洞:对基于风格的后门的易感性。其意义在于:
- 隐蔽性:该攻击利用了图像生成过程中自然的特征,使其对人类检查和针对显式触发器设计的自动检测器均不可见。
- 范式转变:它挑战了后门触发器必须是显式或低维的假设,表明高级语义特征(风格)可以被武器化。
- 安全影响:研究结果表明,当前的防御机制不足以应对利用模型感知和复制风格特征固有能力的攻击。作者认为,未来的研究必须解决这些扩展的攻击空间,以保障生成式 AI 系统的安全。
作者保持谦逊的立场,承认由于扩散过程在没有额外风格迁移模块的情况下严格遵循风格约束的固有难度,ASR 略低于基于补丁的攻击。然而,他们强调,在隐蔽性方面的权衡以及绕过现有防御的能力,使得 GUNGNIR 成为一个关键的威胁向量。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。