← 最新论文
💻 computer science

Direct Diffusion Score Preference Optimization via Stepwise Contrastive Policy-Pair Supervision

本文介绍了直接扩散分数偏好优化(Direct Diffusion Score Preference Optimization, DDSPO),这是一种通过在对比策略对之上,直接在反向去噪转换过程中定义逐步偏好监督,从而改进扩散模型对齐与美学质量的新型训练方法,进而克服了现有方法依赖于基于终端样本的前向过程近似的局限性。

原作者: Dohyun Kim, Seungwoo Lyu, Seung Wook Kim, Paul Hongsuck Seo

发布于 2026-07-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Dohyun Kim, Seungwoo Lyu, Seung Wook Kim, Paul Hongsuck Seo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人艺术家如何绘画。你希望这个机器人能创作出完美符合你描述的美丽画作,比如“一只戴着帽子的猫在阳光明媚的海滩上”。

问题所在:旧的教学方式
目前,最优秀的机器人艺术家使用一种叫做“扩散模型”(Diffusion Models)的技术。它们从一张充满杂乱静态噪声的画布开始,通过一步步逐渐清理,直到出现一幅清晰的图像。

为了让这些机器人变得更好,研究人员通常会展示给它们两幅完成的画作:一幅是你喜欢的(“胜者”),另一幅是你讨厌的(“败者”)。然后,机器人尝试学习如何将杂乱的画布转化为“胜者”而不是“败者”。

这篇论文指出,旧的方法存在一个缺陷。这就像是通过只看终点和起点来教一个人如何开车,却从未观察过中间的转弯、停车或方向盘的移动。旧的方法根据最终的图片来猜测机器人在每一步应该做什么,但这种猜测往往是错误的,因为它并不符合机器人实际的逐步清理过程。这会导致机器人感到困惑,或者产生模糊、不一致的结果。

解决方案:DDSPO(直接扩散得分偏好优化)
作者提出了一个新方法——DDSPO。DDSPO 不仅仅是观察最终的“胜者”和“败者”画作,而是通过观察机器人清理过程中的每一个步骤来教导它。

以下是他们如何利用两个聪明的技巧(他们称之为“对比策略对”)来实现这一点的:

  1. “孪生机器人”法(数据驱动):
    想象你有两个完全相同的机器人艺术家。你训练其中一个专门用来绘制“胜者”风格,训练另一个专门用来绘制“败者”风格。现在,在绘画过程的每一个步骤中,你都会询问:“机器人是在向‘胜者’风格靠近,还是在向‘败者’风格靠近?”如果它正向败者靠近,你就轻轻地将其引导回胜者方向。这给了机器人持续的、步进式的反馈。

  2. “错误提示词”法(无需训练):
    这个方法更聪明,因为它不需要训练新的机器人。你拿一个标准的机器人,给它你的原始描述(例如,“海滩上的猫”)。然后,你给同一个机器人一个稍微损坏或混乱的版本(例如,“一只猫……海滩……[乱码]”)。

    • 机器人对好提示词的反应被视为“胜者”方向。
    • 机器人对坏提示词的反应被视为“败者”方向。
    • 系统随后教导主机器人遵循“好”路径,并避开“坏”路径,贯穿于绘画过程的每一步。

为什么这更好
论文声称,通过关注旅程(逐步清理的过程)而非仅仅是目的地(最终图像),机器人学习得更快、更准确。

  • 更好的对齐性: 机器人能更紧密地遵循你的指令。如果你要求画“一辆红色的车”,它不太可能画出一辆蓝色的车。
  • 更好的质量: 画作看起来更具艺术感且更一致。
  • 没有额外成本: “坏提示词”法意味着你不需要雇佣人类来评价成千上万张图片,也不需要为了教主机器人而训练新的机器人。你可以直接利用现有的工具完成。

结果
作者在各种任务上测试了该方法,例如制作符合文本描述的图像以及让图像看起来更美观。他们发现,这种关注每一步骤的教学方法(DDSPO)始终比那些只看最终图片的旧方法产生更好的结果。它在不同的机器人艺术家上都表现良好,证明了教导“步骤”比猜测“最终结果”更有效。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →