← 最新论文
🤖 machine learning

Beyond Pairwise Preferences: Listwise Reward-Aware Alignment for Diffusion Models

本文介绍了 Diffusion LAIR,这是一种新颖的列表式偏好优化方法,它利用连续奖励分数和优势加权回归,比传统的成对方法更有效地对齐文本到图像扩散模型,并在多种生成和编辑基准测试中展现出卓越性能。

原作者: Austin Wang, Jiaqi Han, Stefano Ermon, Yisong Yue

发布于 2026-05-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Austin Wang, Jiaqi Han, Stefano Ermon, Yisong Yue

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教导一位才华横溢但略显固执的艺术家(即扩散模型),使其能够根据你的描述绘制图画。你希望这位艺术家创作出人类认为既美观又准确的图像。

旧方法:“二选一”游戏

长期以来,教导这位艺术家的标准方式是通过一场“二选一”的游戏。

  • 你向艺术家展示两张关于“日落”的图片。
  • 你说:“我更喜欢图片 A,而不是图片 B。”
  • 艺术家学到:“好的,我必须让图片 A 的风格更常见,让图片 B 的风格更少见。”

问题所在: 这种方法有点浪费。如果你向艺术家展示了五张日落图片呢?

  • 图片 A 令人惊叹。
  • 图片 B 尚可。
  • 图片 C 糟糕透顶。
  • 图片 D 比 B 稍好一些。
  • 图片 E 是最差的。

旧的“二选一”方法迫使你只挑选两张(比如 A 和 E),而忽略其他图片。它丢弃了宝贵的信息:图片 D 其实相当不错,或者图片 C 是一场灾难。它也忽略了 A 比 B 好多少。是稍微好一点点,还是 A 是杰作而 B 是一团糟?旧方法将所有“胜利”等同视之。

新方法:Diffusion LAIR(“小组记分卡”)

本文的作者提出了一种名为Diffusion LAIR的新方法。他们不再玩“二选一”的游戏,而是玩“小组记分卡”。

以下是其工作原理,使用一个简单的类比:

1. 记分卡(奖励分数)
系统不再仅仅挑选一个胜者和一个败者,而是使用一个“裁判”(奖励模型)为组内的每一张图片打分。

  • 图片 A:95/100
  • 图片 B:60/100
  • 图片 C:10/100
  • 图片 D:70/100
  • 图片 E:5/100

2. “中心化”优势(谁高于或低于平均水平?)
系统不仅仅查看原始分数。它会计算每张图片相对于小组平均分是更好还是更差,以及程度如何。

  • 如果平均分数是 48,图片 A(95)将获得巨大的正向提升
  • 图片 C(10)将获得负向惩罚
  • 这为每张图片创造了一个“权重”:“你高于平均水平,所以我们希望更多像你这样的!”或者“你低于平均水平,所以我们希望减少这类!”

3. 温和的推动(保守更新)
这是巧妙之处。旧方法往往试图强迫艺术家发生过于剧烈的变化,这可能导致艺术家忘记如何绘画(即所谓的“分布偏移”问题)。
Diffusion LAIR 添加了一个安全刹车。它说:“好的,我们希望你改进好的图片并减少坏的图片,但不要过于剧烈地改变你的风格。”它在数学上限制了变化的幅度,确保艺术家在保持根基的同时仍能学习。

为何重要(结果)

作者在两位著名的“艺术家”(Stable Diffusion 1.5 和 SDXL)身上测试了这种新方法。他们发现:

  • 更好的学习: 通过使用组内的所有图片而不仅仅是两张,艺术家学得更快、更好。
  • 更多细微差别: 艺术家学会了区分“相当不错”和“令人惊叹”,而不仅仅是“好”与“坏”。
  • 多功能性: 该方法在生成新图像、组合不同物体(例如“戴着帽子的猫”)以及根据指令编辑现有照片方面表现良好。

简而言之

将旧方法想象成一位只说“你比你的朋友做得好”而忽略班上其他同学的老师。
Diffusion LAIR 则像一位给全班打分、清楚看到谁表现优异、谁正在挣扎,并给整个小组提供量身定制的温和推动以共同进步的老师的老师,同时不让任何人感到过于困惑或不知所措。

该论文声称,这种方法无需昂贵、复杂的训练课程,仅通过更聪明地利用已有数据,就能生成人类更偏好的图像。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →