想象你有一位才华横溢的艺术家,名叫Diffusion。这位艺术家通过浏览整个互联网上的数百万张图片学会了绘画。由于互联网包罗万象,这位艺术家不仅学会了如何绘制美丽的风景,也学会了如何绘制不适当或危险的内容。
现在,你想聘请这位艺术家为一家面向家庭的杂志绘制图片。你需要教导他们永远不再绘制那些不良内容,但同时也不能破坏他们绘制美丽、复杂场景的能力(例如一只猫坐在红色椅子上,旁边有一只蓝色的狗)。
本文介绍了一种训练这位艺术家的新方法,称为SafeDiffusion-R1。以下是其工作原理,使用简单的类比说明:
1. 旧方法的问题
过去,试图“遗忘”不良习惯,就像只通过展示一本包含“正面示例”和“负面示例”的教科书来教导学生。
- 问题所在:你需要一个庞大的示例库(这既昂贵又难以获取)。
- 副作用:当你试图强迫艺术家遗忘不良内容时,他们往往也会忘记其他所有内容。他们会变得困惑,原本美丽的画作开始变得模糊或怪异。这被称为“灾难性遗忘”。
2. 新解决方案:“在线教练”
SafeDiffusion-R1 不使用静态教科书,而是像一位实时教练一样,站在艺术家身旁,在他们绘画时进行指导。
- 在线学习:艺术家根据提示(即使是具有风险的提示)尝试绘画。教练立即查看结果并给予反馈。
- “群体”技巧:教练不只是说“好”或“坏”。相反,他们要求艺术家针对同一个提示绘制四个不同的版本。然后,教练进行比较:“A 版本还可以,但 B 版本很糟糕。”这有助于艺术家学习相对差异,而不会因极端的奖励而困惑。这被称为群体相对策略优化(GRPO)。
3. 秘密武器:“指南针”(引导奖励)
这是本文最大的创新。通常,要告诉艺术家“不要绘制裸露内容”,你需要一位特殊的专家(奖励模型)来查看画作并说“不行”。训练这位专家非常困难。
SafeDiffusion-R1 使用了一个魔法指南针。
- 工作原理:想象艺术家的头脑是一张巨大的思想地图。在这张地图上,“安全”的思想位于北方,“不安全”的思想位于南方。
- 技巧:系统不需要人类检查每一幅画。它只需获取用户输入的文字(提示),并在艺术家开始绘画之前,利用数学方法将文字温和地推向北方(安全区域)。
- 结果:如果有人要求绘制一张有风险的图片,系统会在绘画开始之前,微妙地将艺术家心中的指令修改为安全版本。艺术家随后绘制出安全的图片,是因为他们收到了“安全”的指令,而不是因为因“不良”指令而受到惩罚。
4. 结果:安全、智能且清晰
本文测试了这种方法,发现了三大优势:
- 安全性:它大幅减少了不适当图片的数量。如果旧艺术家在测试集中生成了 646 张不适当图片,而新方法仅生成了 15 张。
- 泛化能力:尽管他们主要在“裸露”提示上训练艺术家,但艺术家也学会了避免其他不良内容(如暴力或仇恨言论),即使他们在训练过程中从未见过这些具体示例。这就像教某人不要吃毒苹果,结果他们突然也开始拒绝吃毒浆果了。
- 质量:与旧方法导致艺术家画作模糊或破碎不同,这种方法实际上提升了艺术家遵循复杂指令的能力(例如数清物体或将它们放置在特定位置)。
总结
SafeDiffusion-R1 是一种新的训练技术,它教导 AI 图像生成器变得安全,而无需庞大的“好与坏”示例库。它利用一位在线教练来比较多次尝试,并使用数学指南针在 AI 开始创作之前,将其思想温和地引导向安全方向。其结果是,AI 变得更安全、更智能,且在此过程中不会丧失其艺术才华。
技术摘要:SafeDiffusion-R1
问题陈述
在大规模网络数据上训练的文生图(T2I)扩散模型虽然 democratized 了视觉内容生成,但也无意中内化了不安全及露骨的关联。现有的安全干预措施面临显著局限:
- 数据稀缺与成本:依赖监督微调(SFT)或离线强化学习(RL)的方法需要昂贵且经过精心策划的安全/不安全图像 - 文本对或负/正图像对数据集,难以规模化。
- 灾难性遗忘:生成合成数据或依赖固定数据集的离线方法往往遭受灾难性遗忘,导致模型的整体生成能力和组合质量下降。
- 静态监督:当前范式(SFT 和离线 RL)针对固定示例或预生成数据进行优化。它们无法根据模型不断演变的生成行为调整训练信号,因此不足以追踪和抑制在训练过程中动态出现的不安全内容。
- 奖励模型开销:许多安全对齐方法需要训练或微调专门的奖励模型来将图像分类为安全或不安全,引入了额外的计算开销。
方法论
作者提出了 SafeDiffusion-R1,这是一个在线强化学习框架,旨在无需监督配对数据或专门奖励模型微调的情况下,使扩散模型与安全约束对齐。该框架整合了两个核心组件:
1. 基于 GRPO 的在线策略优化
该方法采用 组相对策略优化(GRPO) 作为训练算法。与标准的 PPO 或离线 RL 不同,GRPO 采用在线策略(on-policy):
- 动态采样:模型在训练过程中持续从良性提示和不安全提示中生成图像样本。
- 基于组的优势:对于每个提示,生成 K 个独立样本。优势值在组内进行归一化(Ai,k=σi+δri,k−rˉi),而非全局归一化。这缓解了良性提示与不安全提示之间的奖励尺度不匹配,防止过度校正,并确保相对于当前策略分布的稳定更新。
- 在线策略学习:通过将安全优化与模型的演变采样分布耦合,该方法避免了分布不匹配,在逐步遗忘不安全概念的同时保留了整体生成能力。
2. 几何感知导向奖励
为了消除对独立安全/不安全分类器或奖励模型的需求,作者引入了一种 导向奖励机制,利用 CLIP 嵌入的几何特性:
- 安全方向向量(vsafe):在文本嵌入空间中计算一个单位向量,作为一小部分安全文本锚点(Tsafe)和不安全文本锚点(Tunsafe)的平均嵌入之间的归一化差值:
vsafe=∥zˉsafe−zˉunsafe∥2zˉsafe−zˉunsafe
- 条件导向:对于输入提示 c,将文本嵌入 zT 投影到 vsafe 上。如果提示被识别为不安全(负投影),则从几何上将嵌入导向安全方向:
zT′=normalize(zT+αvsafe)
其中 α 是导向强度超参数。
- 奖励计算:对于不安全提示,奖励计算为图像嵌入(zI)与导向后的文本嵌入(zT′)之间的余弦相似度;对于安全提示,则使用原始文本嵌入。这重塑了优化信号,鼓励与安全语义属性对齐,而无需显式地因“理解”不安全提示而惩罚模型。
主要贡献
- 在线策略公式化:本文将 T2I 扩散模型的安全对齐构建为在线策略优化问题,引入了基于 GRPO 的框架,将安全学习与模型不断演变的生成分布耦合,以防止灾难性遗忘。
- 导向奖励机制:提出了一种新颖的几何感知奖励,将安全表示为 CLIP 嵌入空间中的一个方向。这使得概念抑制无需训练专用的安全/不安全奖励模型或依赖监督配对数据。
- 实证验证:大量实验表明,该框架在安全基准测试中优于监督微调和离线对齐方法,同时保持或提升了组合生成质量。
实验结果
该方法在 Stable Diffusion v1.4 上进行了评估,使用了 I2P 基准(裸露检测)和 GenEval(组合效用)。
- 安全性能:
- 裸露检测:SafeDiffusion-R1 将裸露检测次数降低至 15(基线 SD v1.4 为 646,RECE 基线为 66)。
- 不当内容:该方法将整体不当内容率降低至 18.07%(SD v1.4 为 48.9%)。值得注意的是,尽管主要基于聚焦裸露的提示进行训练,该方法在七类危害(仇恨、骚扰、暴力、自残、性、惊悚、非法活动)中均取得了强劲表现,展示了强大的分布外(OOD)泛化能力。
- 效用保持:
- 组合质量:与降低效用的基线不同,SafeDiffusion-R1 将 GenEval 分数从 42.08%(SD v1.4)提升至 47.83%。
- 视觉保真度:定性分析显示,该模型保持了结构完整性、面部细节和光照一致性,避免了 EraseDiff 或 ESD 等方法中观察到的扭曲、过度平滑或语义不连贯现象。
- CLIP 分数:模型保持了接近基线的 CLIP-T 分数(0.311 对比 0.313),表明指令遵循能力得以保留。
意义与主张
本文主张 SafeDiffusion-R1 解决了扩散模型中安全与效用之间的关键权衡。通过利用 在线 GRPO 和 几何导向,该方法:
- 消除数据依赖:无需昂贵且精心策划的监督安全数据集。
- 避免奖励模型开销:绕过了训练专门奖励分类器的计算成本。
- 确保稳定性:在线策略公式化和组相对归一化防止了灾难性遗忘和分布崩溃。
- 稳健泛化:该方法实现了最先进的安全性能,能够泛化到跨多种危害类别的分布外不安全提示,即使是在狭窄的不安全概念集合上进行训练。
作者将这项工作定位为一种实用的后训练修改策略,可直接调整预训练模型以抑制不安全概念,而无需从头重新训练,同时保持与 Stable Diffusion 等公开发布系统的兼容性。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。