✨ 要点🔬 技术摘要
想象一下,你正在教导一位艺术家(一个名为“扩散模型”的计算机程序)如何绘制人类真正喜欢的画作。你向这位艺术家展示两幅画,并问道:“哪一幅更好?”
旧方法:“是/否”裁判与“雇佣评论家”
长期以来,教导这位艺术家主要有两种方法:
“雇佣评论家”(RLHF) :你聘请一位专业艺术评论家(即“奖励模型”)来审视画作并给出详细评分,例如"10 分制中的 8.5 分”。这非常准确,但聘请和培训一位评论家既昂贵又缓慢,且需要大量资源。这就像背着沉重的背包跑马拉松。
“是/否”裁判(DPO) :为了节省时间,研究人员转向了一种更简单的方法。他们只问:“图片 A 是否比图片 B 好?”计算机仅学习简单的“是”或“否”。这既快速又高效,但就像试图仅用“是”和“否”来学习一门复杂的语言。你无法得知一幅画究竟比另一幅好多少。如果图片 A 是杰作,而图片 B 是一团乱涂,计算机学到的东西与图片 A 仅比图片 B“稍好一点点”时完全相同。
新想法:“竞技场”记分卡
本文的作者 ArenaPO 想出了一个巧妙的折中方案。他们既想要“是/否”裁判的速度,又想要“雇佣评论家”的丰富细节,却无需真正聘请评论家。
以下是他们如何利用锦标赛类比 来实现这一点的:
步骤 1:构建“模型竞技场”
想象一个巨大的锦标赛,每个 AI 艺术生成器都是一名斗士。研究人员不再仅仅说“斗士 A 击败了斗士 B",而是将每个 AI 的技能水平视为一个不确定性云团 (高斯分布)。
这就像天气预报。预报不再说“气温将是 70 华氏度”,而是说“气温可能在 68 华氏度到 72 华氏度之间”。
通过观察成千上万场过去的战斗(数据集中谁击败了谁),系统会更新每个 AI 的这些“技能云团”。它不仅学会了谁更优秀,还学会了对此技能有多大的把握 。
步骤 2:“魔法计算器”(潜变量推断)
现在,当系统看到特定的一对图像(一张来自 AI A,一张来自 AI B),并得知人类投票选择了 AI A 时,它不仅仅会说"A 赢了”。
它使用一种特殊的数学技巧(基于所谓的“截断正态分布”)来提问:“鉴于 AI A 通常只比 AI B 稍好一些,但今天 AI A 赢了,那么这张特定的画究竟好多少?”
类比 :想象两名跑步者。跑步者 A 通常以 1 秒的优势击败跑步者 B。今天,跑步者 A 赢了。系统会计算:“这是一场势均力敌的比赛(1 秒)还是一场一边倒的惨败(10 秒)?”
它利用“技能云团”以及获胜发生这一事实,估算出一个精确的**“质量差距”**数值。这个数值告诉艺术家获胜的图像究竟好多少。
步骤 3:用新分数进行教学
最后,系统利用这个精确的“质量差距”数值来训练艺术家。
它不再仅仅说“多画得像获胜者”,而是说“多画得像获胜者,并且记住获胜者这次领先了 4.8 分 "。
这为艺术家提供了比简单“是/否”投票丰富得多的详细指导,但整个过程完全在离线 状态下进行(使用已存在的数据),无需在实时运行中依赖缓慢且昂贵的评论家。
结果
研究人员在两个大型人类偏好数据集(Pick-a-Pic v2 和 HPD v3)上测试了这种新方法。
结果 :他们的方法(ArenaPO)始终比旧的“是/否”方法生成了更好的图像。
证明 :当他们让新 AI 与原始未训练的 AI 对决时,他们的版本赢得了 79% 的比赛。在各种质量检查中,它也击败了 Diffusion-DPO 和 SDPO 等其他顶级方法。
一句话总结
本文提出了 ArenaPO ,一种让 AI 艺术生成器学得更快、更好的方法。与其仅仅询问“哪个更好?”(这太简单),或者聘请缓慢的评论家(这太昂贵),他们建立了一个虚拟锦标赛 ,以精确计算一幅图像究竟比另一幅好多少。他们利用这种精确的“获胜幅度”来教导 AI,从而以更少的计算力生成更高质量的图像。
技术摘要:竞技场作为离线奖励(ArenaPO)
问题陈述
虽然基于人类反馈的强化学习(RLHF)已有效地将文本到图像(T2I)扩散模型与人类偏好对齐,但由于需要训练和部署带有在线推理的显式奖励模型,其存在计算效率低下的问题。直接偏好优化(DPO)通过利用静态离线数据集而无需显式奖励建模,已成为一种更高效的替代方案。然而,标准 DPO 仅限于二元反馈 (被选对与拒绝对),导致优化粒度粗糙。在实践中,图像对之间的质量差异显著;将所有“被选”图像视为同等优于“被拒”图像,忽略了偏好的幅度,可能导致次优对齐。核心挑战在于如何在无需依赖显式且计算昂贵的奖励模型的情况下,将细粒度偏好信号 融入高效的 DPO 框架中。
方法论:ArenaPO
作者提出了ArenaPO ,这是一个从“模型竞技场”中提取细粒度离线奖励以增强 DPO 训练的框架。该方法分为三个 distinct 阶段:
1. 模型竞技场构建
作者没有孤立地处理图像,而是构建了一个“模型竞技场”,其中每个图像的源模型都是一个竞争者。
概率建模 :遵循 Thurstone 第五类理论,每个模型的能力不被建模为固定点,而是建模为高斯分布 θ ∼ N ( μ , σ 2 ) \theta \sim \mathcal{N}(\mu, \sigma^2) θ ∼ N ( μ , σ 2 ) ,其中 μ \mu μ 代表平均能力,σ \sigma σ 代表不确定性。
贝叶斯更新 :数据集被视为一系列成对比较。通过遍历标注的成对偏好,利用贝叶斯推断迭代更新每个模型的能力分布。二元标签(胜/负)作为似然函数来更新先验分布,收敛至表征模型真实能力的后验分布。
2. 用于质量差距估计的潜变量推断
对于数据集中的任意给定图像对 ( y w , y l ) (y_w, y_l) ( y w , y l ) ,该方法在无需奖励模型的情况下估计绝对质量差距。
公式化 :图像的质量被视为从其源模型能力分布中抽取的单个样本。问题被表述为:在给定观测事件 Q w > Q l Q_w > Q_l Q w > Q l 的情况下,估计质量差异 Q D = Q w − Q l Q_D = Q_w - Q_l Q D = Q w − Q l 的后验期望。
截断正态分布 :由于两个独立高斯变量之差仍为高斯分布,且观测施加了单侧约束(Q D > 0 Q_D > 0 Q D > 0 ),作者利用了截断正态分布 的性质。
闭式解 :估计的质量差距 Q D ∗ Q_D^* Q D ∗ 计算为条件期望 E [ Q D ∣ Q D > 0 ] E[Q_D | Q_D > 0] E [ Q D ∣ Q D > 0 ] 。该值结合了先验均值差(μ w − μ l \mu_w - \mu_l μ w − μ l )以及源自不确定性(σ w , σ l \sigma_w, \sigma_l σ w , σ l )和观测到的二元偏好的修正项。此 Q D ∗ Q_D^* Q D ∗ 充当细粒度的、特定实例的奖励信号 。
3. 细粒度 DPO 训练
估计的质量差距被整合到 Diffusion-DPO 目标函数中。
基于边际的 Bradley-Terry 模型 :不再强制简单的二元排序,偏好概率通过边际进行建模:p ( y w ≻ y l ) = σ ( r ( y w ) − r ( y l ) − Q D ∗ ) p(y_w \succ y_l) = \sigma(r(y_w) - r(y_l) - Q_D^*) p ( y w ≻ y l ) = σ ( r ( y w ) − r ( y l ) − Q D ∗ ) 。
损失函数 :标准 DPO 损失被修改为包含 Q D ∗ Q_D^* Q D ∗ 作为缩放因子(由系数 γ \gamma γ 加权)。这鼓励策略不仅学习哪个 图像更好,还学习好多少 ,以匹配偏好差距的幅度。
效率 :整个流程是离线 的。竞技场构建和质量差距估计在训练前计算完成,无需额外的在线推理或奖励模型训练,从而保持了 DPO 的计算效率。
主要贡献
ArenaPO 框架 :提出了一种利用竞技场分数作为离线奖励以提供细化反馈给 DPO 的方法,在不使用显式奖励模型的情况下,同时实现了 RLHF 的丰富奖励信号和 DPO 的效率。
潜变量推断 :引入了一种基于截断正态分布的新颖推断方法,仅利用模型能力分布和二元偏好来估计图像对之间的绝对质量差距。
实证优越性 :在 Pick-a-Pic v2 和 HPD v3 数据集上的广泛实验表明,ArenaPO 在多个评估指标(PickScore、HPS、Aesthetic、CLIP、ImageReward)上始终优于现有基线(包括 Diffusion-DPO、MaPO、DSPO 和 SDPO)。
实验结果
作者在 Stable Diffusion 1.5 和 Stable Diffusion XL 上,使用 Pick-a-Pic v2 和 HPD v3 数据集评估了 ArenaPO。
性能提升 :ArenaPO 在所有测试基准中取得了最先进的结果。例如,在 Stable Diffusion 1.5 配合 Pick-a-Pic v2 数据集上,ArenaPO 将 PickScore 从 0.2143(SDPO)提升至 0.2151,将 ImageReward 从 0.5546 提升至 0.6063。
胜率 :在与原始 Stable Diffusion 1.5 的正面比较中,ArenaPO 的胜率达到 79.0% ,显著优于其他 DPO 变体。
消融研究 :
细粒度与统一边际 :用固定的统一边际替换自适应的 Q D ∗ Q_D^* Q D ∗ 导致性能显著下降,验证了细粒度、自适应奖励的必要性。
可扩展性 :将 ArenaPO 与其他先进方法(如 DSPO)结合产生了进一步的性能提升,表明该方法具有解耦性,可与其他优化策略兼容。
超参数敏感性 :缩放系数 γ \gamma γ 被发现相对不敏感,最佳性能出现在 1 × 10 − 3 1 \times 10^{-3} 1 × 1 0 − 3 时。
意义与主张
该论文声称,ArenaPO 有效地弥合了 DPO 的效率与 RLHF 的丰富性之间的差距。通过将模型能力建模为分布并利用潜变量推断,该方法从现有的二元数据集中提取细粒度偏好信息 ,而无需训练奖励模型的开销。作者断言,这种方法能实现更有效的对齐,使模型不仅能学习偏好的方向,还能学习该偏好的强度 。该方法被提出作为一种实用且可扩展的解决方案,用于在在线奖励建模计算资源受限的现实世界应用中改进 T2I 扩散模型。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。