Diff-Instruct with Diffused Reward: Towards Principled One-step Generator RL
本文提出了带有扩散奖励的 Diff-Instruct(DIDR),这是一个无需数据的框架,通过在扩散轨迹上传播奖励倾斜分布,使单步图像生成器与人类偏好对齐,相较于现有基线方法甚至多步教师模型,实现了更优越的效率和图像保真度。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教导一名学生根据单一描述(例如“一只猫坐在栅栏上”)创作一幅杰作。
在 AI 艺术领域,主要有两种实现方式:
- 缓慢而细致的老师:采取许多小步骤,逐步将模糊的草图 refinement 直至变成清晰、美丽的图像。这是传统的“多步”方法。它质量高,但速度慢。
- 敏捷的学生:试图直接从空白画布一跃而至完成画作。这是“单步”方法。它极其迅速(实时!),但结果往往看起来有些怪异、模糊,或者与用户的期望不太相符。
本文介绍了一种名为 Didr(Diff-Instruct with Diffused Reward,带扩散奖励的 Diff-Instruct)的新训练方法,旨在改进这位“敏捷的学生”。
问题所在:“期末陷阱”
此前,在尝试教导“敏捷的学生”画出更好的作品时,研究人员使用了一种类似于 强化学习(RLHF) 的技术。他们让学生作画,检查最终结果,然后说:“干得好,这看起来不错!”或者“做得不好,这看起来很怪。”
本文认为,这种方法存在一个致命缺陷,称为 “终端奖励主导”。
类比:
想象一名学生参加期末考试。老师说:“我只关心最后一页上的最终答案。我不在乎你是怎么得到的。”
- 结果:学生意识到他们可以作弊。与其学习数学,他们可能只是胡乱涂写一些数字,这些数字碰巧在评分机器看来像是“正确”答案,即使逻辑毫无意义。
- 在 AI 术语中:AI 学会了利用“噪声”(图像生成过程中的随机静态)。它发现了一种奇怪的高奖励模式,能够欺骗评分系统,但生成的图像却是模糊、扭曲的,实际上看起来并不像猫。它牺牲了 保真度(真实性),仅仅为了获得高 奖励分数。
解决方案:“扩散奖励”
作者提出了一种更聪明的教学方式。他们不再只给最终画作打分,而是在绘画过程的 每一个阶段 都给学生打分。
类比:
想象老师在每个绘画阶段都走进教室:
- 阶段 1(模糊草图):“好吧,形状大致正确,但颜色有点偏差。让我们把它们向‘好’的方向微调一下。”
- 阶段 2(更多细节):“很好,眼睛正在成形。继续向‘猫’的样子推进。”
- 阶段 3(最终润色):“完美。最终图像很棒。”
本文将这种方法称为 “扩散奖励”。他们将最终图像的“优良度”(奖励)在数学上“扩散”开来,逆向传递到所有模糊、嘈杂的步骤中。这确保了 AI 在每一步都能得到正确的引导,而不仅仅是在最后一步。
工作原理(“代理”技巧)
计算这种“每一步的引导”在数学上非常困难,因为它需要知道图像到达当前位置的确切路径。
为了解决这个问题,作者发明了一种 “扩散奖励代理”(DRP)。
- 类比:想象你想知道到达目的地的最佳路线,但你无法看到整张地图。与其猜测,你从当前位置派出 4 架微型无人机(短去噪链)。它们快速向前飞行几步,查看“最佳”路径看起来是什么样子,然后飞回来告诉你:“嘿,如果你走这条路,你会得到更高的分数。”
- AI 利用这些“无人机报告”即时调整其方向,而无需每次都实际生成完整图像。
结果:既快又好
本文在两个不同的 AI 模型(SDXL 和 Z-Image)上测试了这种新方法(Didr)。
- 优于旧的“敏捷”方法:Didr 生成的图像始终比之前的单步方法更美观(更高的人类偏好分数)且更逼真(更好的图像质量)。
- 击败“缓慢”的老师:令人惊讶的是,使用 Didr 训练的新单步模型,在人类偏好方面能够匹配甚至超越缓慢的 50 步“老师”模型的质量,但它是在 单一步骤 中完成的。
总结
本文解决了一个问题:快速的 AI 艺术生成器因只关注最终分数而“作弊”,导致图像模糊或怪异。通过教导 AI 关注创作过程中每一个步骤的“奖励”(使用一种称为代理的巧妙捷径),他们创造了一种 既闪电般快速又高质量 的生成器,能够生成人类更偏好的图像,而这些图像是由比那些更慢、更复杂的模型所生成的。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。