技术摘要:直接扩散分数偏好优化 (DDSPO)
问题陈述
扩散模型在生成任务(尤其是文本生成图像)中取得了显著成功。然而,它们经常难以与细微的用户意图保持一致,也难以持续维持高水平的美学质量。现有的基于偏好的训练方法,如扩散直接偏好优化 (Diffusion DPO),试图通过从最终样本的成对偏好中学习来解决这些问题。
当前方法(如 Diffusion DPO)的一个关键局限性在于,它们依赖于使用源自终端样本 (x0) 的前向过程 q(xt−1∣xt,x0) 来近似反向去噪转换。这种近似并不能反映模型在推理阶段实际的反向去噪过程。因此,提供的监督信号与模型的真实去噪轨迹不一致,无法提供有效的逐步监督。
方法论
作者提出了直接扩散分数偏好优化 (DDSPO),该框架将偏好监督直接构建在每个扩散时间步的分数空间中,而非最终样本空间中。
核心概念:逐步对比策略对监督
与以往定义最终输出 (x0w,x0l) 偏好的方法不同,DDSPO 通过在每个时间步比较对比策略对的去噪分数,引入了逐步监督。偏好标签被扩展为去噪转换的元组 ((xtw,xt−1w),(xtl,xt−1l)),这些元组源自偏好和非偏好的去噪策略。
目标函数通过优化模型的去噪预测,使其趋向于每个步骤的靶向 ϵ⋆w 和 ϵ⋆l,这两个靶向分别对应偏好和非偏好的行为。损失函数定义为:
LDDSPO(θ)=−E[logσ(−β⋅[∥ϵ⋆w−ϵθ(xtw,t,c)∥22−∥ϵ⋆w−ϵref(xtw,t,c)∥22−(∥ϵ⋆l−ϵθ(xtl,t,c)∥22−∥ϵ⋆l−ϵref(xtl,t,c)∥22)))]
这里,ϵ⋆w 和 ϵ⋆l 是从对比策略对中获得的去噪分数目标,它们保留了实际的反向去噪转换,而非前向过程的近似。
对比策略对的实例化
论文提出了两种实现对比策略对的实际方法:
数据驱动对比策略对 (DD-CPP):
- 需要一个包含图像对 (x0w,x0l,c) 的偏好标注数据集。
- 从预训练初始化出发,微调两个独立的模型:一个是在偏好样本上训练的“胜出”模型 ϕw,另一个是在非偏好样本上训练的“落败”模型 ϕl。
- 监督目标是这些专门化模型预测的去噪分数:ϵ⋆w←ϵϕw(xt,t,c) 以及 ϵ⋆l←ϵϕl(xt,t,c)。
无需训练的对比策略对 (TF-CPP):
- 不需要额外的训练或偏好标注数据。
- 利用单个预训练的参考模型。
- 通过使用原始提示词 c(偏好)和语义降级的变体 c−(非偏好)来构建对比对。
- 偏好目标为 ϵref(xt,t,c),非偏好目标为 ϵref(xt,t,c−)。
- 该方法利用了这样一个观察结果:在较大的时间步长下,反向更新主要由条件信号驱动,这使得即使没有生成特定的非偏好图像 x0l,也能使 c− 提供有意义的负向分数目标。
主要贡献
- DDSPO 框架: 一个通过对比策略对在分数空间中实现直接逐步监督的偏好优化框架,避免了对前向过程近似的依赖。
- 实用的实例化方案: 引入了 DD-CPP(从标注数据中学习策略)和 TF-CPP(利用提示词降级从参考模型构建对比方向),后者既不需要奖励模型,也不需要人工标注。
- 实验验证: 大量实验证明,源自对比策略对的逐步监督在文本-图像对齐和美学质量任务方面,比基于前向过程的监督更为有效。
实验结果
作者在 Stable Diffusion 变体(SD-1.4, SD-1.5, SDXL)和基于 DiT 的模型(SANA, SD3-M)上,针对文本-图像对齐和美学质量提升任务评估了 DDSPO。
文本-图像对齐:
- 使用 TF-CPP(无需人工标注数据),DDSPO 在 GenEval 和 T2I-CompBench 基准测试中相比 Diffusion DPO、DSPO 及其他基线模型达到了最先进水平(SOTA)。
- DDSPO 在无需人类标注的偏好数据或奖励模型的情况下,在 CompBench 上超越了 Itercomp 和 CaPO 等 SOTA 方法。
- 定性结果显示,与 Diffusion DPO 和 DSPO 相比,其条件分布的分离更清晰,对复杂提示词的遵循度更高。
美学质量:
- 在 Pick-a-Pic 数据集上使用 DD-CPP,DDSPO 提升了 SD-1.5 和 SDXL 的 HPSv2 和 PickScore 指标,优于 Diffusion DPO 和 Diffusion KTO。
- TF-CPP 变体(无需人类数据)在竞争中依然表现出色。
消融研究:
- 测试了不同的提示词降级策略(例如,随机删除 Token 与基于 LLM 的重写)。随机删除在对齐任务中表现最好,而针对美学定制的 LLM 降级在美学质量任务中表现最好。
- 一种通过复用偏好图像作为负向目标(避免显式生成非偏好图像)的高效 TF-CPP 变体,其性能与完整设置相当,凸显了该框架的灵活性。
重要性与主张
论文声称,DDSPO 的主要意义在于其能够提供与模型实际反向去噪过程相一致的逐步监督。通过直接在局部反向转换(xt→xt−1)上定义偏好,而非依赖前向过程的替代物,DDSPO 提供了更丰富的转换级监督。
作者断言,这种方法能产生跨越整个去噪轨迹的更稳健的学习信号,从而在语义对齐和美学质量方面实现一致的提升。此外,无需训练的对比策略对 (TF-CPP) 表明,无需收集人类偏好标注或训练奖励模型的成本,即可实现高质量的偏好优化,这使得该方法具有高度的可扩展性和数据效率。这项工作将 DDSPO 定位为一个可广泛应用于扩散模型和基于流(flow-based)生成模型的通用框架。