Explicit Critic Guidance for Aligning Diffusion Models
本文提出了一种状态对齐的潜在演员 - 评论家框架,使扩散模型能够作为其自身时间步条件价值函数,从而促进稳定的轨迹级 PPO 训练、多奖励优化以及有效的推理时引导,以超越现有的对齐方法。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教导一位才华横溢的艺术家(即扩散模型)根据特定描述(例如“一顶戴着帽子的猫在火星上”)绘制一幅画。
这位艺术家并非一次性完成整幅画作。相反,他们从一块布满静态噪声的画布开始,逐步、缓慢地 refinement,直到猫的形象显现。这就是“去噪轨迹”。
本文要解决的问题是:如何教导这位艺术家更好地完成这一过程?
通常,你只会查看最终画作来判断其好坏。如果猫看起来不对,你会告诉艺术家:“做得不好。”但艺术家并不知道哪一步出了问题。是第 10 步?第 30 步?是帽子画错了,还是背景出了问题?这被称为信用分配问题。
以下是作者的新方法——状态对齐潜在演员 - 评论家(State-Aligned Latent Actor-Critic)——如何利用简单类比来解决这一问题:
1. “内部教练”(潜在评论家)
在旧方法中,“教练”(评论家)会等到艺术家完成画作后,才查看最终图像,然后试图猜测之前哪里出了问题。这就像一位教练只在终场哨响后才观看足球比赛,然后试图告诉球员上半场该如何不同地行动。这种做法既不准确又缓慢。
本文的解决方案:
他们将艺术家转变为自己的教练。他们赋予艺术家一双特殊的“内部之眼”,使其能够在画作仍在创作过程中(即仍处于噪声和模糊状态时)进行观察。
- 神奇之处: 无需等待最终图像,这位内部教练会在每一步查看混乱、充满噪声的画布,并说:“如果你继续这样走下去,你会获得高分”,或者“停下,那条路会导致糟糕的结果。”
- 为何更优: 因为教练观察的是艺术家实际采取的真实混乱步骤(而非经过清理的版本),所以建议要准确得多。这就像拥有一个每秒根据你的当前位置更新路线的 GPS,而不是基于昨天的地图猜测你的位置。
2. “排练”(价值预训练)
教导一位新教练提供建议是困难的。如果你从零开始同时训练教练和艺术家,他们可能会感到困惑并互相争执,导致训练不稳定。
本文的解决方案:
他们先让教练进行短暂的“排练”。在正式训练开始之前,他们让教练练习仅观察艺术家并猜测最终得分,而暂时不改变艺术家的行为。
- 结果: 到正式训练开始时,教练已经相当擅长预测结果。这使得整个学习过程更加顺畅和快速,避免了艺术家与教练之间的“争执”。
3. “多任务”挑战(多奖励优化)
有时,你希望画作在多个方面同时表现出色:它需要符合提示词、对人类而言美观,并且拥有正确数量的物体。
- 问题: 如果你只关注一件事(例如“确保恰好有 4 把椅子”),艺术家可能会偷懒,画出 4 把椅子,但让背景看起来很糟糕或颜色怪异。这被称为“奖励黑客”——找到捷径赢得游戏,而非真正表现出色。
- 本文的解决方案: 他们为艺术家配备了一支教练团队,每位教练专精于不同技能(一位负责美观,一位负责物体数量,一位负责文本)。这些教练共享同一个“大脑”(底层模型),但拥有各自独立的记分牌。
- 结果: 艺术家学会了平衡一切。他们无法仅仅通过“黑客”椅子数量奖励来获利,因为“美观”教练会因其绘制出丑陋画面而予以惩罚。这迫使模型表现出更全面的能力。
4. “方向盘”(推理时引导)
一旦艺术家训练完成,你不必被动接受他们绘制的任何内容。你可以利用教练的“内部之眼”在画作创作过程中对其进行引导,即使在训练结束后也是如此。
- 工作原理: 想象艺术家正在绘制一条路径。教练可以轻轻地将画笔推向看起来有希望的区域。
- 优势: 这使得你无需重新训练整个模型即可获得更好的结果。这就像拥有一个在你驾驶时建议更佳路线的 GPS,无需学习新地图即可改善旅程。
结果总结
作者在两种不同类型的“艺术家”上测试了该方法(一种基于较旧的技术 UNet,另一种基于较新的技术 DiT)。
- 更高的分数: 他们的方法始终比先前的方法生成更好的图像,尤其是在计数物体或读取图像中文本等棘手任务上。
- 更稳定: 训练不像其他方法那样容易崩溃或陷入困惑。
- 高效: 训练速度更快,所需计算资源更少,因为教练无需等待最终图像即可提供建议。
简而言之,这篇论文教导 AI 艺术家成为自己最好的批评者,在创作过程中提供即时反馈,在重大比赛前进行排练,并利用一支教练团队确保他们不走捷径。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。