← 最新论文
💻 computer science

On-Policy Self-Distillation in Diffusion Models

本文介绍了 DiffusionOPSD,这是一个在策略(on-policy)自蒸馏框架,它将图像级奖励转化为扩散模型的显式中间监督目标,与现有方法相比,实现了卓越的对齐性能和显著的训练效率提升。

原作者: Wei Zhou, Xiongwei Zhu, Lingdong Kong, Bo Chen, Lei Zhang, Yongyuan Liang, Xiaoxia Hou, Ye Tian, Xian Sun, Yingshuo Wang, Linfeng Li, Shengqiong Wu, Leigang Qu, Feng Li, Wei Liu, Julian McAuley, Tat-S
发布于 2026-08-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Wei Zhou, Xiongwei Zhu, Lingdong Kong, Bo Chen, Lei Zhang, Yongyuan Liang, Xiaoxia Hou, Ye Tian, Xian Sun, Yingshuo Wang, Linfeng Li, Shengqiong Wu, Leigang Qu, Feng Li, Wei Liu, Julian McAuley, Tat-Seng Chua

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在人工智能领域,出现了一类能够凭空绘图的新型系统,它们能将像“戴着帽子的猫”这样简单的句子转化为生动的图像。这些被称为扩散模型(diffusion models)的系统,其工作原理是从一团混乱的静态噪声开始,逐步进行清理,一步步地直到一张清晰的图像显现出来。多年来,研究人员一直致力于让这些图像看起来更锐利或更逼真。最近,目标转向了让图像更符合人类的偏好,确保人工智能不仅理解物体看起来是什么样子,还理解人类认为什么是美或是有用的。为了教导模型这些偏好,科学家们经常使用一种称为强化学习(reinforcement learning)的方法。在这种设定下,人工智能生成一张图像,一个计算机程序根据其与预期结果的匹配程度对其进行评分,然后人工智能根据该评分尝试改进下一次尝试。然而,这个过程中存在一个根本性的问题:评分仅在最后阶段给出,即在图像完成之后。人工智能只能通过猜测来调整其中间步骤——即创作过程中那些混乱、模糊的阶段——以达到那个最终的高分。这就像是试图通过仅仅在比赛结束时被告知输或赢来学习一项复杂的技能,而没有在比赛过程中获得任何关于具体动作的反馈。

一个研究小组引入了一种名为 DiffusionOPSD 的新方法来解决这个特定问题。他们不再等待图像完成后才提供反馈,而是将生成过程分解为易于处理的时刻。他们将人工智能的生成过程视为一系列快照。在创建图像的一个特定的早期阶段,他们暂停并询问计算机程序,评估如果图像就在此处停止会是什么样子。利用这种评估,他们计算出一个精确的改进方向,为人工智能创造一个明确的目标。这个目标不仅仅是一个模糊的建议;它是一个具体的、有界的指令,告诉人工智能如何调整其当前的预测,以使最终结果变得更好。研究人员随后训练人工智能向这个目标移动。至关重要的是,他们以循环的方式进行:人工智能做出一次移动,系统根据人工智能自身当前的行为计算出一个新目标,然后人工智能在系统为下一轮更新理解之前,从该特定指令中学习。这个循环使得人工智能能够从即时的、可操作的反馈中学习,而不是从遥远的、最终的结果中学习。

研究人员在两个不同的强大图像生成系统上测试了这种方法。在他们尝试过的几乎所有场景中(涉及十种不同的图像质量评判方式),他们的新方法都比现有的最强技术产生了更好的结果。在二十次对比中的十九次里,使用这种新方法训练的人工智能所生成的图像,在自动化评分系统和人类评估者的评价中都获得了更高的分数。这种提升是显著的;在某些情况下,图像质量与之前的最佳方法相比增加了近百分之四十四。除了制作出更好的图片外,这种新方法也更加高效。在其中一个系统上,它减少了百分之四十的计算时间,在另一个系统上则减少了百分之六十三的计算时间,从而实现了这些结果。这种效率非常重要,因为训练这些模型通常需要大量的能源和昂贵的硬件。通过缩短所需的时间,该方法使得针对特定任务来完善这些工具变得更加可行,而不会产生过高的成本。

这项工作的一个关键发现是,仅仅拥有一个更好的改进想法并不保证人工智能会立即变得更好。研究人员发现他们可以测量两件不同的事情:给予人工智能的指令质量,以及人工智能在单个训练步骤中实际遵循该指令的程度。有时,一个非常强力的指令仅导致了微小的改进,而一个较弱的指令反而带来了更大的改进。这种分离使他们能够看到,他们方法的成功既来自于创造清晰的指令,也来自于确保人工智能能够有效地从指令中学习。他们还测试了人工智能是否需要看到它之前生成的完全相同的模糊图像,或者它是否可以从该图像的一个略微不同的版本中学习。他们发现图像的来源影响很小;真正驱动改进的是反馈本身的方向。这表明该方法是稳健的,它依赖于指导的质量,而非所分析图像的具体细节。

当研究人员观察实际生成的图像时,差异是显而易见的。使用这种新方法训练的人工智能更擅长遵循复杂的指令,例如包含特定的文本、保持物体的身份,或捕捉运动和光影效果。在面对面比较中,人类评委在大多数情况下更倾向于该新方法生成的图像,而非之前的最佳技术。这些图像与提示词的一致性更高,保留了其他方法经常丢失或扭曲的细节。研究人员还展示了该方法可以同时处理多个目标。他们训练单个人工智能同时满足三个不同的标准,并且成功地在不牺牲任何一项性能的前提下提升了这三项指标。这表明该方法具有足够的灵活性,可以处理现实世界中复杂的、需要图像在多个维度同时达标的要求。

这项工作代表了我们教导这些强大系统的方式的一种转变。通过将最终得分转化为清晰的中间指令,研究人员提供了一种引导人工智能思考过程的方法。这种方法避免了传统方法的猜测,并为获得更好的结果提供了一条更直接、更高效的路径。研究结果表明,训练这些模型的未来可能在于将复杂的目标分解为人工智能可以立即理解并执行的小型、明确的步骤。该方法并不依赖于魔法或复杂的技巧;它依赖于一个清晰、可重复的过程:设定目标、测量距离并采取行动。其结果是一个学习更快、消耗能量更少,且生成的图像更符合人类意图的系统。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →