想象一下,你正在教导一位才华横溢的艺术家(一个扩散模型)如何创作出人类真正喜爱的画作。这位艺术家已经非常擅长从零开始创作图像,但他们并不总是能确切知道你想要什么。你想要给予反馈:“我更喜欢这张图,而不是那张。”
本文介绍了一种名为SIPO(稳定化与改进的偏好优化)的新教学方法。它解决了人们此前尝试用旧方法教导这些艺术家时出现的两个主要问题。
以下是使用简单类比进行的分解说明:
问题:嘈杂的“课堂”
作者发现,之前的方法(如Diffusion-DPO)就像一个混乱的课堂,老师随机时间大声喊出指令,让学生感到困惑。
“时机不当”问题:
- 类比: 想象艺术家正在作画。他们从一块空白画布(充满噪声)开始,慢慢添加细节,直到画面清晰。
- 问题: 旧方法试图在绘画过程的每一秒都给予反馈。但在最初阶段(“早期时间步”),画布只是一团模糊的噪声。在此时给予反馈,就像在画布只是一团灰色污渍时大喊“画个鼻子!”一样。这令人困惑,并导致艺术家感到沮丧(训练不稳定)。
- 解决方案: SIPO 像一位聪明的老师,会说:“让我们忽略画布只是一团模糊的前 60 秒。让我们只在形状开始显现时才给予反馈。”这防止了艺术家因噪声而困惑。
“错误学生”问题:
- 类比: 想象你正在使用一本由另一位学生编写的教科书来训练一名学生。这本教科书有正确答案,但其风格与你学生的思维方式略有不同。
- 问题: 旧方法使用了“离线”数据(预先制作的示例),这些数据与当前艺术家实际能做到的并不完全匹配。这在艺术家所学内容与实际操作之间造成了差距,导致他们后来失去信心或犯下奇怪的错误(策略外偏差)。
- 解决方案: SIPO 使用了一个“翻译器”(称为重要性重加权)。它审视每一个示例并说:“这个示例与我们艺术家能做的非常相似,所以我们要仔细聆听。那个其他示例非常不同,所以我们要调低它的音量。”这确保艺术家从最相关的示例中学习,而不会被不匹配的示例所淹没。
解决方案:SIPO
本文提出了SIPO作为两步改进方案:
- DPO-C&M(截断与掩码): 这是“聪明的老师”。它掩码(忽略)了绘画过程中早期、充满噪声且反馈无用的部分。它同时也截断(限制)了反馈,使其不会变得过于极端而吓到艺术家。
- 时间步感知重加权: 这是“翻译器”。它根据示例与艺术家当前技能水平的匹配程度来调整反馈的音量。如果示例完美匹配,它就大声说话;如果它是奇怪的异常值,它就低声细语。
结果:更平稳、更优秀的艺术家
作者在图像生成器(如 Stable Diffusion)和视频生成器(如 CogVideoX)上测试了该方法。
- 稳定性: 之前的方法就像过山车;艺术家的表现会剧烈上下波动,有时在训练几天后完全崩溃。SIPO 则像一部平稳的电梯;艺术家稳步提升,不会崩溃。
- 敏感性: 旧方法对“温度”设置(一个名为 β 的旋钮)非常敏感。如果你稍微调错这个旋钮,艺术家就会失败。SIPO 具有鲁棒性;即使你没有完美地调节旋钮,它也能很好地工作。
- 质量: 在直接对比测试中,SIPO 生成的图像和视频更常获得人类的偏好,胜过旧方法。它不仅仅制作了“还可以”的图片;它制作了更一致、色彩更丰富且更符合人类品味的图片。
总结
简而言之,SIPO是一种更智能的 AI 艺术家训练方法。它不再在艺术家仍被噪声困惑时向他们大喊指令,而是等待合适的时机发言,并根据艺术家当前的水平调整其语调。其结果是,训练过程更不容易崩溃,并能产生更好、更类人的艺术作品。
技术摘要:SIPO(稳定与改进的偏好优化)
1. 问题陈述
尽管扩散模型彻底改变了图像和视频生成领域,但使其与人类偏好保持一致仍然充满挑战。现有的对齐技术,特别是 Diffusion-DPO(直接偏好优化),存在两个阻碍稳定且有效训练的根本性问题:
- 训练不稳定性:扩散模型的去噪过程涉及具有不同时间步的长程轨迹。该论文指出,训练不稳定性主要源于早期时间步,这些时间步具有较低的重要性权重和较高的梯度方差。这导致了非单调的损失动态、参数敏感性(特别是对温度超参数 β 的敏感性),以及潜在的训练崩溃,即性能随时间推移而下降。
- 离线策略偏差:偏好优化数据通常基于固定的参考模型或分布外(out-of-distribution)源构建,而非当前的策略模型。这造成了分布差距,即训练数据仅捕捉了状态 - 动作空间的一个狭窄子集,而模型必须在此更广阔的空间中进行泛化。这种不匹配导致不准确的离线策略评分估计、奖励黑客攻击(reward hacking)以及泛化能力下降,在时间连贯性至关重要的视频生成中尤为明显。
2. 方法论:SIPO 框架
作者提出了SIPO(稳定与改进的偏好优化),这是一个旨在通过对扩散轨迹的系统性分析并引入重要性采样机制,来解决上述不稳定性和偏差的框架。
2.1. 扩散轨迹分析
通过对 Stable Diffusion 1.5 的系统性分析,作者观察到:
- 早期时间步(具体为 t∈[0,63])对应较低的重要性权重,并引入噪声梯度,从而破坏训练的稳定性。
- 中后期时间步为偏好对齐提供了最具信息量的信号。
- 均匀时间步采样的表现不如专注于中间步骤。
2.2. DPO-C&M(截断与掩码)
为解决不稳定性,作者引入了DPO-C&M,该方法修改了标准的 Diffusion-DPO 目标函数:
- 重要性加权:通过比较学习到的反向转移 pθ(xt−1∣xt) 与正向后验 q(xt−1∣xt,x0) 来计算重要性权重 w(t)。
- 截断与掩码:对重要性权重较低的时间步(表明存在不可靠或噪声梯度)进行掩码或截断。具体而言,权重被截断至 [1−ϵ,1+ϵ] 范围内,以防止高方差。这充当了一个软掩码,抑制正向和反向路径显著发散区域的梯度。
2.3. 时间步感知的重要性重加权
为减轻离线策略偏差,SIPO 采用了一种时间步感知的截断重要性重加权方案:
- 离线策略校正:该框架利用重要性采样重新诠释了偏好优化目标。它根据当前策略 pθ 与离线策略采样分布 q 之间的似然比来重新加权更新。
- KL 正则化目标:该方法将优化表述为最小化当前模型与“塑形”目标分布 p∗ 之间的 KL 散度,该目标分布平衡了奖励反馈与先验偏好。
- 自适应步长:重加权的对数比率项自适应地缩放更新。它强化了被低估的优选样本,并降低过度自信样本的权重。这在参考分布周围引入了一个软上界,防止奖励黑客攻击并降低对 β 超参数的敏感性。
最终的 SIPO 损失函数将这些截断的重要性权重整合到每个去噪步骤的成对偏好信号中,确保即使在固定的离线策略数据集上训练,更新也能保持稳定。
3. 主要贡献
该论文概述了三项主要贡献:
- 系统性分析:对基于扩散的偏好优化动态进行了详细调查,揭示了早期时间步会破坏 DPO 训练的稳定性,而中后期时间步则推动性能提升。
- SIPO 框架:提出了一种基于原则的重要性加权优化框架,通过根据样本似然和时间步质量对梯度进行重加权,从而稳定训练并减轻离线策略不匹配。
- 实证验证:广泛的实验表明,SIPO 在图像和视频生成任务中均能一致地稳定偏好优化过程,并优于现有的替代方案(如 Diffusion-DPO、DPO-C&M)。
4. 实验结果
作者在多种基线模型上评估了 SIPO,包括 Stable Diffusion 1.5、SDXL、CogVideoX-2B/5B 和 Wan2.1-1.3B。
- 文生视频:在 CogVideoX-2B 上,Diffusion-DPO 在 1000 步后出现严重退化(总 VBench 分数从 80.91 降至 67.28),而 SIPO 保持稳定并有所提升(81.68)。在所有测试的视频模型上,SIPO 在总分、质量和语义分数方面始终优于 Diffusion-DPO 和 DPO-C&M。
- 文生图:在 Pick-a-Pic 数据集上使用 SD1.5 和 SDXL 时,与 Diffusion-DPO 及其他基线(如 Diffusion-KTO 和 SPO)相比,SIPO 在 PickScore、HPSv2 和美学(Aesthetics)这四个指标中的三项上取得了最高分数。
- 参数敏感性:SIPO 对温度参数 β 表现出显著更高的鲁棒性。虽然 Diffusion-DPO 的性能随不同 β 值剧烈波动,但 SIPO 在广泛范围内保持了稳定的性能。
- 人工评估:在涉及 200 个提示和 12 名标注员的研究中,SIPO 达到了 67% 的胜率(排名第一),显著优于 Diffusion-DPO 和基础模型。
- 在线/迭代学习:在迭代训练场景中,SIPO 保持了稳定的性能,而 Diffusion-DPO 则因奖励黑客攻击和分布漂移而表现出性能退化。
5. 意义与主张
该论文声称,SIPO 通过强调时间步感知对齐的重要性,为改进偏好优化提供了有价值的指导。作者断言,他们的方法:
- 稳定训练:通过识别并掩码无信息的早期时间步,SIPO 防止了 Diffusion-DPO 中常见的训练崩溃。
- 减轻离线策略偏差:重要性重加权方案允许在固定的离线数据集上进行有效训练,而无需复杂的在线策略探索。
- 泛化能力强:该方法在不同模型架构(包括基于流的模型如 WanX)和模态(图像和视频)上均有效。
作者总结道,SIPO 提供了一种可扩展且基于原则的方法,用于将基于扩散的生成与人类偏好对齐,使输出更加一致和可控,而无需超越底层模型之外的新生成能力。他们建议将此优化与仔细的数据集策划和安全过滤相结合。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。