想象你有一位才华横溢的艺术家(即人工智能),它已经学会了绘制世间万物。但出于安全或法律原因,你需要教导这位艺术家遗忘如何绘制某些特定事物,例如一个著名的卡通角色(皮卡丘)或某种特定的绘画风格(梵高风格)。
棘手之处在于:你并不希望艺术家遗忘其他所有内容。你仍然希望它能够完美地绘制米老鼠、马里奥或风景画。
本文介绍了一种新颖巧妙的方法,用于“遗忘”这些特定概念,而无需从头重新训练整个艺术家。以下是其工作原理,通过简单的类比进行分解说明:
问题所在:“姓名标签”式的错误
以往的方法试图通过查看姓名标签来让艺术家遗忘。
- 运作方式:如果你希望艺术家遗忘“皮卡丘”,计算机会查看诸如“一张皮卡丘的照片”或“一幅皮卡丘的图画”这样的提示词。它会找出文本中的“皮卡丘”部分,并试图从艺术家的大脑中删除该特定的文本模式。
- 缺陷:这就像试图通过仅禁止某人的名字来阻止人们认出这位朋友。如果你告诉艺术家:“画一只黄色、带电、红脸颊的老鼠”,艺术家会说:“哦,我不知道‘皮卡丘’是什么,但我知道如何根据这个描述来画!”即使你禁止了名字,艺术家仍然会画出皮卡丘。旧方法过于关注词语,而忽略了概念。
解决方案:观察“素描过程”
作者 Saemi Moon 及其团队意识到,艺术家不仅仅查看姓名标签;他们观察的是实际的素描过程。
- 新想法:他们不再查看文本提示,而是观察艺术家在真正绘制图像时内部的“笔触”(称为交叉注意力激活)。
- 类比:想象艺术家正在作画。
- 旧方法:你查看订单表,说:“删除‘皮卡丘’这个词。”
- 新方法(PURE):你观察艺术家在绘制黄色耳朵和红脸颊时手的动作。你确切地看到艺术家的手是如何移动以创造出这些特定特征的。然后,每当艺术家试图再次绘制这些特征时,你便温和地引导其手远离那种特定的动作。
因为艺术家的手部动作(即激活)才是真正创造图像的关键,所以阻止这些特定动作比仅仅阻止词语要有效得多。即使你用一千种不同的方式描述皮卡丘而不使用其名字,这种方法也能阻止艺术家画出皮卡丘。
他们是如何做到的(“一次性修复”)
本文提出了一种名为PURE的方法。它是“闭式”的,这是一种 fancy 的说法,意指这是一种一次性、快速的数学修正,而非漫长缓慢的训练过程。
- 观察:他们让艺术家绘制几个“皮卡丘”提示词,并记录了绘图过程中每一层所使用的特定手部动作(激活)。
- 地图:他们创建了这些动作的“地图”。这张地图精确展示了艺术家在绘制你想要遗忘的事物时所做的动作。
- 编辑:他们在艺术家的大脑中应用了一个单一的数学“过滤器”。该过滤器表示:“如果你的手试图向‘皮卡丘’方向移动,就停止。但如果你试图向‘马里奥’或‘风景’方向移动,就继续。”
- 结果:艺术家瞬间忘记了如何绘制目标概念,同时完美地保留了所有其他技能。
为何它更优越
该论文在“整体遗忘基准”(包含 10 种不同概念,如风格、名人和卡通角色的测试)中测试了该方法与其他方法的对比。
- 更擅长遗忘:即使人们使用巧妙的、重新措辞的描述(如“一只黄色的带电啮齿动物”),PURE 也能阻止艺术家绘制被禁止的概念。
- 更擅长记忆:与其他方法不同(其他方法在试图禁止皮卡丘时,会意外让艺术家忘记其他事物,例如导致其画不好米老鼠),PURE 保持了艺术家其他技能的敏锐度。
- 无额外成本:由于这是一种快速的数学编辑,它不会拖慢艺术家的速度,也不需要昂贵的重新训练。
nutshell(简而言之)
可以将旧方法比作通过在字典中划掉一个单词来抹去记忆。而新方法(PURE)则像是教导艺术家停止做出特定的手势。由于正是这个手势真正创造了画面,因此这种方法更难被欺骗,并且完全不会损害艺术家的其他才能。
技术摘要:基于交叉注意力激活投影的扩散模型概念遗忘
问题陈述
概念遗忘旨在从预训练的文本到图像扩散模型中移除特定的目标概念(例如受版权保护的风格、名人肖像或不安全图像),而无需承担从头开始重新训练的计算成本。有效的遗忘必须同时满足两个要求:遗忘目标概念,即使面对改写或对抗性提示;同时保留模型生成所有其他无关概念的能力。
现有的闭式方法(closed-form methods)对模型权重施加单一的确定性编辑,无需基于梯度的微调,但面临一个关键局限。这些方法(例如 UCE、CURE)利用源自短锚点提示(例如“梵高”)的文本编码器嵌入来构建“遗忘基”。作者认为,文本嵌入描述的是用户的提示,但未能捕捉模型在去噪过程中实际如何利用该提示。因此,能够唤起目标概念但不匹配锚点模板的改写提示,往往能绕过遗忘编辑,导致“目标泄露”。
方法论:PURE
本文提出了PURE(用于擦除的 U-Net 渲染中的投影),这是一种闭式遗忘方法,它将基构建从文本编码器嵌入空间转移到 U-Net 内部的交叉注意力激活空间。
核心假设:
第 ℓ 层的交叉注意力激活(hℓ)反映了去噪器在当前潜在状态和时间步下如何利用文本条件。与静态文本嵌入不同,这些激活捕捉了图像生成过程中实际使用的特定概念证据,从而对多样化的提示措辞具有更好的泛化能力。
算法流程:
- 激活捕获:对于一组遗忘锚点(Af)和保留锚点(Ar),模型运行一段短的去噪轨迹。在每一层 ℓ 和时间步,提取注意力后的激活,进行空间平均池化,并聚合为矩阵 HFℓ 和 HRℓ。
- 子空间构建:对每一层的 HFℓ 和 HRℓ 执行奇异值分解(SVD)。前若干个奇异向量(直至累积方差阈值 τF,τR)构成遗忘基(VFℓ)和保留基(VRℓ)。
- 线性编辑:该方法对交叉注意力的键(WKℓ)和值(WVℓ)投影矩阵应用单一的线性更新。更新算子 Eℓ 定义为:
Eℓ=I−PFℓ(I−PRℓ)
其中 PFℓ=VFℓ(VFℓ)⊤ 且 PRℓ=VRℓ(VRℓ)⊤。
权重通过左乘进行更新:Wℓ←EℓWℓ。
- 机制:项 (I−PRℓ) 移除了与保留概念对齐的分量,确保 PFℓ 仅作用于正交子空间。从单位矩阵中减去此项,可确保与保留概念对齐的输入保持不变地通过。
- 结构转变:与以往在文本空间从右侧相乘的方法不同,PURE 在激活空间(dℓ×dℓ)从左侧相乘,因此需要对每一层进行编辑。
主要贡献
- 基于激活的基:本文指出,从交叉注意力激活而非文本嵌入构建遗忘基,显著提高了在多样化自然和对抗性提示中对目标概念的检测能力。
- 探测实验:一项二元分类实验表明,与自然改写提示相比,基于激活的基比基于文本的基实现了约五倍的更高召回率,证实了激活特征能更好地捕捉与生成相关的概念证据。
- 闭式效率:PURE 保持了闭式编辑的优势:无需梯度训练、无需辅助损失函数、无需学习率超参数调整,且在编辑应用后不增加推理时间成本。
- 逐层编辑:该方法执行逐层 SVD 和编辑,承认概念表示在 U-Net 深度上的变化。
实验结果
作者在**整体遗忘基准(HUB)**上评估了 PURE,该基准涵盖了四个类别的十个概念:艺术风格、知识产权(IP)、名人和 NSFW(不适宜工作场所内容)。
- 遗忘 - 保留权衡:与五个基线方法(ESD、MACE、RECELER、UCE、CURE)相比,PURE 在所有类别中取得了最佳调和平均分数。
- 目标抑制:与经常无法抑制改写提示的 CURE 相比,PURE 显著减少了在改写和对抗性提示下的目标泄露。
- 保留能力:PURE 比激进的基于训练的方法(会损害保留能力)更好地保留了“保留”概念(同一类别中的邻近概念),也比文本空间的闭式方法(在风格类别中经常为了抑制而牺牲保留)表现更好。
- 消融研究:
- 锚点数量:增加自然遗忘锚点的数量会改善文本基的抑制效果,但会损害保留能力。激活基即使在锚点集扩大时,也能在最小化保留损失的同时保持强大的抑制力。
- 去噪步数:使用单个去噪步(T=1)会严重降低性能,表明在整个轨迹中捕捉概念信号至关重要。
- 潜在空间平均:对多个随机潜在变量(nlat)进行平均,使基趋向于概念级方向,而非特定于噪声的伪影。
意义与主张
本文主张,PURE 代表了闭式遗忘方法的基本转变。通过将基构建从静态的文本编码器空间转移到动态的交叉注意力激活空间,该方法克服了现有闭式技术的主要失败模式:无法处理超出锚点模板范围的提示变化。
作者断言,PURE 为概念遗忘提供了一种稳健、高效且最先进的解决方案,在擦除不需要的概念与保留模型通用效用之间提供了更优的平衡,且无需重新训练的计算开销。这项工作表明,“遗忘方向”由模型的内部渲染过程比仅由输入文本更准确地定义。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。