← 最新论文
🤖 machine learning

Linear-DPO: Linear Direct Preference Optimization for Diffusion and Flow-Matching Generative Models

本文提出了线性 DPO,这是一个统一的偏好优化框架,通过用线性效用和指数移动平均更新的参考模型替代标准的基于 Sigmoid 的效用函数,为扩散模型和流匹配模型推导出一个通用目标,以克服目标不匹配问题并提升文本到图像生成的对齐效果。

原作者: Kesong Li, Yixuan Xu, Kuo-kun Tseng, Weiyi Lu, Kan Liu, Tao Lan

发布于 2026-05-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Kesong Li, Yixuan Xu, Kuo-kun Tseng, Weiyi Lu, Kan Liu, Tao Lan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你有一位极具天赋的艺术家,能够根据你的描述作画。这位艺术家通过浏览互联网上数十亿张图像及其文字说明而学会了绘画。他们擅长让作品看起来逼真,但并不总是了解人类真正喜欢什么。有时,他们画出的图片在技术上正确,却略显怪异、丑陋,或完全不符合你的要求。

为了解决这个问题,我们需要教导这位艺术家倾听人类的反馈。本文介绍了一种更聪明的教学方法,称为Linear-DPO

以下是其工作原理的简明解析,辅以一些日常类比:

1. 问题:“一刀切”的教师

此前,研究人员尝试使用一种称为DPO(直接偏好优化)的方法来教导这些 AI 艺术家。可以将 DPO 想象成一位严厉的教师,他说:“如果你答对了,很好;如果你答错了,立刻停止尝试。”

  • 问题所在:这种“立即停止”的规则在语言模型(如聊天机器人)中行之有效,因为你只需要选出正确的词语。但在图像生成中,这就像试图通过只凿掉大块石头来雕刻一座雕像,一旦形状看起来还行就立刻放弃。你永远无法获得精细的细节,因为教师过早地停止了反馈。
  • 差距:此外,旧方法仅适用于一种特定类型的 AI 艺术家(称为“扩散”模型)。而更新、更快的艺术家(称为“流匹配”模型)则完全被排除在课堂之外。

2. 解决方案:统一的课堂

本文作者意识到,旧的“扩散”艺术家和新的“流匹配”艺术家实际上在做相同的事情,只是方式略有不同。他们构建了一个统一框架

  • 类比:想象旧方法是一位只与穿蓝色衬衫的学生交谈的教师。而新方法则是一位使用通用语言的教师,无论是“蓝衬衫”学生还是“红衬衫”学生都能完全理解。这使得他们能够首次利用偏好学习来训练最新、最强大的 AI 艺术家(如 SD3)。

3. 秘密武器:“线性”效用

最大的创新在于改变了教师如何给予反馈。

  • 旧方式(Sigmoid):旧方法使用"Sigmoid"函数。想象一个电灯开关。它要么处于关闭状态(0),要么处于开启状态(1)。一旦学生答得“足够好”,开关就会翻转至开启,教师便停止纠正。这导致学生停留在“足够好”的水平,无法进一步改进。
  • 新方式(Linear-DPO):作者用电灯开关替换为调光开关(线性函数)。
    • 工作原理:即使学生表现良好,教师仍会持续给予微小、温和的推动。这就像一位教练,在画作完成后仍会说:“做得好,但让我们把颜色再调亮一点点。”
    • 结果:这使得学习过程平滑且连续。艺术家不会因为达到“好”的分数就停止进步;他们会不断打磨细节,直到画面真正美丽动人。

4. “移动目标”参考

在训练过程中,你通常会将学生的作品与一个“参考”(基线模型)进行比较,以确保他们不会偏离正轨。

  • 旧方式:参考是一个冻结的、静态的雕像。一旦学生超越了这座雕像,比较就失去了意义。
  • 新方式:作者使用**EMA(指数移动平均)*参考。想象参考是一个缓慢跟随学生的影子。随着学生变得更好,影子也随之移动。这确保学生始终被挑战去比当前的自己*做得稍好一些,防止他们变得懒惰或停滞不前。

5. 结果

本文在几位著名的 AI 艺术家(SD1.5、SDXL 以及较新的 SD3)上测试了这一新方法。

  • 结果:经过 Linear-DPO 训练的艺术家生成的图像,在人类评估中得分显著更高。它们看起来更逼真,更严格地遵循了指令,并拥有更丰富的细节。
  • 证明:在直接对比测试中,新方法几乎每次都击败了旧方法(如标准 DPO 或简单的微调),尤其是在最新、最强大的模型上。

总结

可以将Linear-DPO视为从使用电灯开关(开/关,停止过早)的教师升级为使用调光开关(平滑、连续反馈)的教师。他们还确保这位教师能够教导所有类型的 AI 艺术家,而不仅仅是旧有的那些。其结果是,AI 生成的艺术更加符合人类真正想看到的样子。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →