← 最新论文
💻 computer science

Arena as Offline Reward: Efficient Fine-Grained Preference Optimization for Diffusion Models

本文提出了一种名为 ArenaPO 的无需奖励模型的微调方法,该方法利用基于能力分布的潜在变量推断所得的离线竞技场分数来提供细粒度的偏好反馈,从而比传统的二元 DPO 方法更有效地实现扩散模型的更优对齐。

原作者: Zhikai Li, Yue Zhao, Edward Zhongwei Zhang, Xuewen Liu, Jing Zhang, Qingyi Gu, Zhen Dong

发布于 2026-05-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhikai Li, Yue Zhao, Edward Zhongwei Zhang, Xuewen Liu, Jing Zhang, Qingyi Gu, Zhen Dong

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教导一位艺术家(一个名为“扩散模型”的计算机程序)如何绘制人类真正喜欢的画作。你向这位艺术家展示两幅画,并问道:“哪一幅更好?”

旧方法:“是/否”裁判与“雇佣评论家”

长期以来,教导这位艺术家主要有两种方法:

  1. “雇佣评论家”(RLHF):你聘请一位专业艺术评论家(即“奖励模型”)来审视画作并给出详细评分,例如"10 分制中的 8.5 分”。这非常准确,但聘请和培训一位评论家既昂贵又缓慢,且需要大量资源。这就像背着沉重的背包跑马拉松。
  2. “是/否”裁判(DPO):为了节省时间,研究人员转向了一种更简单的方法。他们只问:“图片 A 是否比图片 B 好?”计算机仅学习简单的“是”或“否”。这既快速又高效,但就像试图仅用“是”和“否”来学习一门复杂的语言。你无法得知一幅画究竟比另一幅好多少。如果图片 A 是杰作,而图片 B 是一团乱涂,计算机学到的东西与图片 A 仅比图片 B“稍好一点点”时完全相同。

新想法:“竞技场”记分卡

本文的作者 ArenaPO 想出了一个巧妙的折中方案。他们既想要“是/否”裁判的速度,又想要“雇佣评论家”的丰富细节,却无需真正聘请评论家。

以下是他们如何利用锦标赛类比来实现这一点的:

步骤 1:构建“模型竞技场”

想象一个巨大的锦标赛,每个 AI 艺术生成器都是一名斗士。研究人员不再仅仅说“斗士 A 击败了斗士 B",而是将每个 AI 的技能水平视为一个不确定性云团(高斯分布)。

  • 这就像天气预报。预报不再说“气温将是 70 华氏度”,而是说“气温可能在 68 华氏度到 72 华氏度之间”。
  • 通过观察成千上万场过去的战斗(数据集中谁击败了谁),系统会更新每个 AI 的这些“技能云团”。它不仅学会了谁更优秀,还学会了对此技能有多大的把握

步骤 2:“魔法计算器”(潜变量推断)

现在,当系统看到特定的一对图像(一张来自 AI A,一张来自 AI B),并得知人类投票选择了 AI A 时,它不仅仅会说"A 赢了”。

它使用一种特殊的数学技巧(基于所谓的“截断正态分布”)来提问:“鉴于 AI A 通常只比 AI B 稍好一些,但今天 AI A 赢了,那么这张特定的画究竟好多少?”

  • 类比:想象两名跑步者。跑步者 A 通常以 1 秒的优势击败跑步者 B。今天,跑步者 A 赢了。系统会计算:“这是一场势均力敌的比赛(1 秒)还是一场一边倒的惨败(10 秒)?”
  • 它利用“技能云团”以及获胜发生这一事实,估算出一个精确的**“质量差距”**数值。这个数值告诉艺术家获胜的图像究竟好多少。

步骤 3:用新分数进行教学

最后,系统利用这个精确的“质量差距”数值来训练艺术家。

  • 它不再仅仅说“多画得像获胜者”,而是说“多画得像获胜者,并且记住获胜者这次领先了 4.8 分"。
  • 这为艺术家提供了比简单“是/否”投票丰富得多的详细指导,但整个过程完全在离线状态下进行(使用已存在的数据),无需在实时运行中依赖缓慢且昂贵的评论家。

结果

研究人员在两个大型人类偏好数据集(Pick-a-Pic v2 和 HPD v3)上测试了这种新方法。

  • 结果:他们的方法(ArenaPO)始终比旧的“是/否”方法生成了更好的图像。
  • 证明:当他们让新 AI 与原始未训练的 AI 对决时,他们的版本赢得了 79% 的比赛。在各种质量检查中,它也击败了 Diffusion-DPO 和 SDPO 等其他顶级方法。

一句话总结

本文提出了 ArenaPO,一种让 AI 艺术生成器学得更快、更好的方法。与其仅仅询问“哪个更好?”(这太简单),或者聘请缓慢的评论家(这太昂贵),他们建立了一个虚拟锦标赛,以精确计算一幅图像究竟比另一幅好多少。他们利用这种精确的“获胜幅度”来教导 AI,从而以更少的计算力生成更高质量的图像。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →