← 最新论文
💻 computer science

SafeDiffusion-R1: Online Reward Steering for Safe Diffusion Post-Training

SafeDiffusion-R1 引入了一种在线强化学习框架,该框架采用组相对策略优化并辅以一种新颖的基于 CLIP 的引导奖励机制,从而在无需昂贵监督数据且避免灾难性遗忘的前提下,有效使扩散模型与安全约束对齐并提升生成质量。

原作者: Komal Kumar, Ankan Deria, Abhishek Basu, Fahad Shamshad, Hisham Cholakkal, Karthik Nandakumar

发布于 2026-05-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Komal Kumar, Ankan Deria, Abhishek Basu, Fahad Shamshad, Hisham Cholakkal, Karthik Nandakumar

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你有一位才华横溢的艺术家,名叫Diffusion。这位艺术家通过浏览整个互联网上的数百万张图片学会了绘画。由于互联网包罗万象,这位艺术家不仅学会了如何绘制美丽的风景,也学会了如何绘制不适当或危险的内容。

现在,你想聘请这位艺术家为一家面向家庭的杂志绘制图片。你需要教导他们永远不再绘制那些不良内容,但同时也不能破坏他们绘制美丽、复杂场景的能力(例如一只猫坐在红色椅子上,旁边有一只蓝色的狗)。

本文介绍了一种训练这位艺术家的新方法,称为SafeDiffusion-R1。以下是其工作原理,使用简单的类比说明:

1. 旧方法的问题

过去,试图“遗忘”不良习惯,就像只通过展示一本包含“正面示例”和“负面示例”的教科书来教导学生。

  • 问题所在:你需要一个庞大的示例库(这既昂贵又难以获取)。
  • 副作用:当你试图强迫艺术家遗忘不良内容时,他们往往也会忘记其他所有内容。他们会变得困惑,原本美丽的画作开始变得模糊或怪异。这被称为“灾难性遗忘”。

2. 新解决方案:“在线教练”

SafeDiffusion-R1 不使用静态教科书,而是像一位实时教练一样,站在艺术家身旁,在他们绘画时进行指导。

  • 在线学习:艺术家根据提示(即使是具有风险的提示)尝试绘画。教练立即查看结果并给予反馈。
  • “群体”技巧:教练不只是说“好”或“坏”。相反,他们要求艺术家针对同一个提示绘制四个不同的版本。然后,教练进行比较:“A 版本还可以,但 B 版本很糟糕。”这有助于艺术家学习相对差异,而不会因极端的奖励而困惑。这被称为群体相对策略优化(GRPO)

3. 秘密武器:“指南针”(引导奖励)

这是本文最大的创新。通常,要告诉艺术家“不要绘制裸露内容”,你需要一位特殊的专家(奖励模型)来查看画作并说“不行”。训练这位专家非常困难。

SafeDiffusion-R1 使用了一个魔法指南针

  • 工作原理:想象艺术家的头脑是一张巨大的思想地图。在这张地图上,“安全”的思想位于北方,“不安全”的思想位于南方。
  • 技巧:系统不需要人类检查每一幅画。它只需获取用户输入的文字(提示),并在艺术家开始绘画之前,利用数学方法将文字温和地推向北方(安全区域)
  • 结果:如果有人要求绘制一张有风险的图片,系统会在绘画开始之前,微妙地将艺术家心中的指令修改为安全版本。艺术家随后绘制出安全的图片,是因为他们收到了“安全”的指令,而不是因为因“不良”指令而受到惩罚。

4. 结果:安全、智能且清晰

本文测试了这种方法,发现了三大优势:

  • 安全性:它大幅减少了不适当图片的数量。如果旧艺术家在测试集中生成了 646 张不适当图片,而新方法仅生成了 15 张。
  • 泛化能力:尽管他们主要在“裸露”提示上训练艺术家,但艺术家也学会了避免其他不良内容(如暴力或仇恨言论),即使他们在训练过程中从未见过这些具体示例。这就像教某人不要吃毒苹果,结果他们突然也开始拒绝吃毒浆果了。
  • 质量:与旧方法导致艺术家画作模糊或破碎不同,这种方法实际上提升了艺术家遵循复杂指令的能力(例如数清物体或将它们放置在特定位置)。

总结

SafeDiffusion-R1 是一种新的训练技术,它教导 AI 图像生成器变得安全,而无需庞大的“好与坏”示例库。它利用一位在线教练来比较多次尝试,并使用数学指南针在 AI 开始创作之前,将其思想温和地引导向安全方向。其结果是,AI 变得更安全、更智能,且在此过程中不会丧失其艺术才华。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →