Towards General Preference Alignment: Diffusion Models at Nash Equilibrium
本文介绍了扩散纳什偏好优化(Diff.-NPO),这是一种博弈论框架,通过鼓励扩散模型进行自我对弈,从而实现更优的文本到图像对齐,进而克服了传统基于布拉德利 - 特里模型的偏好方法的局限性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你有一位极具天赋的艺术家(即扩散模型),他能根据你的描述作画。然而,这位艺术家是在整个互联网上训练的,因此尽管他技艺精湛,其风格未必总能契合你个人的喜好。有时他画出的猫看起来有点像狗,或者画出的日落看起来更像一碗汤。
为了解决这个问题,我们通常会通过向艺术家展示成对的图片来教导他:“我更喜欢这一张,而不是那一张。”这被称为偏好对齐。
旧方法:“记分员”问题
大多数现有方法(如DPO)试图通过假装存在一位隐藏的“记分员”(即奖励模型)来教导艺术家。他们假设:如果图片 A 优于图片 B,且图片 B 优于图片 C,那么图片 A 必然优于图片 C。
论文指出,这是一个有缺陷的假设。人类的品味是混乱的,有时甚至是循环的,就像**“石头剪刀布”**游戏一样:
- 你可能觉得石头胜过剪刀。
- 你可能觉得剪刀胜过布。
- 但你同时也可能觉得布胜过石头。
旧方法试图将这些选择强行纳入一条直线(A > B > C),这无法捕捉真实人类品味的复杂性。此外,它们还依赖于计算机必须猜测的“记分员”,这可能导致不准确。
新方法:“陪练对手”游戏(Diff.-NPO)
作者提出了一种名为Diff.-NPO(扩散纳什偏好优化)的新方法。他们不再猜测分数,而是将训练过程转化为两位艺术家版本之间的博弈:
- 当前艺术家:我们试图改进的模型版本。
- 上一位艺术家:上一训练步骤的模型版本(充当对手)。
游戏如何进行:
想象当前艺术家和上一位艺术家身处拳击场。他们收到相同的提示(例如“画一只猫”)。
- 他们各自画一幅画。
- 一位裁判(偏好检查器)观察两幅画并决定哪一幅更好。
- 当前艺术家试图通过创作一幅比上一位艺术家的作品更受裁判青睐的画作来赢得这一轮。
- 关键在于,当前艺术家还必须记住不要遗忘如何画好画(即保持与原始训练的一致性),否则他们可能会为了赢得比赛而开始绘制怪异、毫无意义的东西。
这被称为纳什均衡。目标是达到这样一个点:当前艺术家变得如此出色,以至于没有任何其他策略能持续击败它。这是一个“自我博弈”循环,模型通过与自己对抗来提升,而不仅仅是试图满足一个静态的分数。
“甜蜜点”平衡
论文引入了一种特殊的“旋钮”(一个称为 的数学比率),用于控制游戏的进行方式:
- 将旋钮向一个方向转动:艺术家只试图击败“上一位艺术家”。这类似于纯粹的自我博弈。它具有侵略性且学习速度快,但艺术家可能会脱轨,忘记如何绘制正常的事物。
- 将旋钮向另一个方向转动:艺术家只试图击败“参考艺术家”(一个固定的原始版本)。这很安全且稳定,但艺术家可能会停滞不前,无法取得太大进步,因为目标过于简单或过于僵化。
- 甜蜜点:Diff.-NPO 找到了完美的中间地带。它利用上一位艺术家来推动进步(在线学习),同时利用参考艺术家来保持模型的稳定性(稳定性)。
实际效果如何?
研究人员在流行的图像生成器(Stable Diffusion 1.5 和 SDXL)上测试了该方法,使用了名为Pick-a-Pic的大规模人类偏好数据集。
- 结果:Diff.-NPO 始终胜过旧方法。
- 证据:当他们将新模型与旧模型进行“正面交锋”时,Diff.-NPO 模型获胜的频率更高。它生成的图片更受人类(以及自动化评判者)的喜爱。
- 视觉质量:在并排对比中,Diff.-NPO 生成的图片更加逼真,更好地遵循了提示,且比旧方法生成的图片看起来更连贯。
总结
简而言之,论文指出:“别再试图计算人类喜欢什么的完美分数了,因为人类的品味太过复杂,无法用这种方式衡量。相反,让 AI 与其过去的自我进行博弈,并设置安全网以防止其失控。这种‘陪练’方法能创造出更优秀、更对齐的艺术家。”
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。