← 最新论文
🤖 machine learning

Drifting Preference Optimization for One-Step Generative Models

该论文提出了漂移偏好优化(Drifting Preference Optimization, DrPO),这是一种在线微调方法,它通过在无需奖励模型反向传播的情况下,利用排序样本合成特征空间更新方向,实现了对确定性文本生成图像模型的高效单步对齐。

原作者: Zhou Jiang, Yandong Wen, Zhen Liu

发布于 2026-06-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhou Jiang, Yandong Wen, Zhen Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你有一位超级快速的艺术家,他能在眨眼之间根据一句话画出一幅画。这就是“单步”(one-step)图像生成器所做的事情。它们速度极快,但往往难以精准地画出人类想要看到的画面。通常,教这些艺术家进步需要一个缓慢且复杂的过程:向他们展示成千上万个示例,计算微小的数学误差,并一点一点地调整他们的“大脑”。

这篇论文介绍了一种名为 DrPO(漂移偏好优化,Drifting Preference Optimization) 的新方法。你可以把它理解为一种更聪明、更快速的方法,可以在不需要进行那些会拖慢速度的繁重数学计算的情况下,教导这位超级快速的艺术家。

以下是 DrPO 的工作原理,使用简单的类比:

1. 问题所在:“黑盒”老师

通常,要教导一个 AI,你需要一位老师,他能观察一幅画,计算出它究竟为什么错了,并向艺术家发送一个数学信号来纠正错误。

  • 问题: 有时老师是一个“黑盒”(我们不知道他们是如何思考的),或者老师过于庞大复杂,无法发送信号回来。或者,老师只能给出一个简单的“做得好”或“做得不好”的分数,而不是一份详细的教学计划。
  • 旧方法: 试图强迫艺术家从这些老师那里学习,通常需要放慢艺术家的速度,或者进行昂贵的计算机计算,这会破坏“单步”生成的速度优势。

2. 解决方案:“漂移场”

DrPO 改变了游戏规则。它不再要求老师发送详细的数学信号,而是使用了一个磁场类比。

  • 设置: 你要求艺术家根据同一个提示词(例如“沙发上的猫”)画出 24 幅画。
  • 排序: 你将这 24 幅画展示给你的老师(奖励模型)。老师不需要解释为什么这些画好或坏;他们只需要进行排序。“这一张最好,”以及“这一张最差。”
  • 制造磁铁:
    • 最好的图片就像磁铁一样,将艺术家未来的绘画向它们拉近。
    • 最差的图片则像排斥器一样,将艺术家未来的绘画推开。
  • 漂移: 艺术家不需要知道排序背后的数学逻辑。他们只需要感受到在特征空间(一个描述图像特征的隐藏地图)中一股轻微的“漂移”或“风”,将他们推向好的磁铁,并远离坏的磁铁。

3. 安全网:“冻结的参考系”

如果你只是让艺术家向磁铁漂移,他们可能会迷失方向,或者开始画出奇怪、扭曲的图像。

  • 解决方案: DrPO 保留了一个原始艺术家(基础模型)的“冻结”副本。
  • 类比: 想象艺术家正在走钢丝。“磁铁”将他们拉向目标,但“冻结的参考系”就像一根安全绳,如果他们开始偏离太远,就会轻轻地将他们拉回。这使得图像看起来自然且稳定。

4. 为什么它意义重大

  • 速度: 因为 DrPO 只需要老师对图片进行排序(而不是对它们进行复杂的数学运算),所以它可以兼容任何类型的老师,即使是那些巨大、神秘或只能给出简单分数的老师。
  • 效率: 论文声称,在使用复杂老师(如 HPSv3)时,由于跳过了沉重的“反向传播”(发送数学信号)步骤,这种方法使训练速度提高了 3.5 倍
  • 单步推理: 最棒的部分在于?艺术家仍然可以单步完成绘画。训练变得更聪明了,但实际的绘画过程依然保持着闪电般的速度。

总结

把 DrPO 想象成通过向一位速写画家展示“名人堂”(最好的图像)和“耻辱柱”(最差的图像)来教导他们。画家学会了向名人堂移动,并远离耻辱柱,同时受到一条安全绳的引导,防止他们脱轨。即使评分的裁判是一个巨大的、复杂的计算机,且无法与之直接对话,这种方法依然有效。

核心观点: 作者表明,这种方法有助于这些快速图像生成器产生更符合人类偏好的图像,而不会减慢生成过程,也不需要奖励系统提供复杂的数学反馈。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →