← 最新论文
💻 computer science

Scaling Reinforcement Learning for Diffusion Models via Velocity Matching

本文介绍了基于奖励的速度匹配(Reward-based Velocity Matching, RVM),这是一种简单且计算高效的无需轨迹框架,它通过直接优化扩散模型的速度场来进行基于奖励的微调,在性能上优于现有的基于似然的策略梯度方法,同时为近期方法提供了一个统一的视角,并能够提升视频生成的动态奖励。

原作者: Jaemoo Choi, Wei Guo, Yuchen Zhu, Arash Vahdat, Molei Tao, Julius Berner, Yongxin Chen

发布于 2026-08-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Jaemoo Choi, Wei Guo, Yuchen Zhu, Arash Vahdat, Molei Tao, Julius Berner, Yongxin Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在快速发展的人工智能领域,出现了一类特殊的计算机程序,它们能够根据简单的文本描述创建出令人惊叹的图像和逼真的视频。这些被称为扩散模型(diffusion models)的系统,通过学习如何逆转一个逐渐破坏的过程来工作。想象一下,将一张清晰的照片慢慢加入静态噪声,直到它变得无法辨认;这些模型学习的是如何走回这条数学路径,从纯粹的噪声开始,通过逐步仔细地去除噪声,从而揭示出一幅连贯的图像。虽然这些工具已经变得极其强大,但教导它们遵循人类的偏好——例如让视频运动得更自然,或让图片看起来更美观——已被证明是困难的。传统上,研究人员试图借鉴用于语言模型的方法,这些方法依赖于计算序列中每一个可能出现的下一步的概率。然而,由于图像和视频生成涉及数百万个像素同时发生变化,计算这些概率在计算上非常昂它,且往往无法做到完美的准确。

来自佐治亚理工学院和英伟达(NVIDIA)的研究团队发现了一种更简单、更直接的方法,来教导这些模型什么是人类所偏好的。他们不再试图为生成过程中的每一个微小步骤计算复杂的概率,而是提出了一种直接关注图像形成过程中“速度”(velocity)的方法。用这些模型的语言来说,系统会预测图像在从一时刻到下一时刻时应该如何变化,以达到最终结果。研究人员发现,他们只需利用奖励信号作为引导,将这种预测向着能产生高质量结果的方向进行“推挤”,并远离导致低质量结果的方向。这种被称为“基于奖励的速度匹配”(reward-based velocity matching)的方法,绕过了以往尝试中那些减缓进度的复杂概率计算。

研究人员在大型视频生成模型上测试了这一想法,这类模型由于生成单个视频需要巨大的计算能力,因此训练成本极高。他们将这种新方法与现有的、依赖于追踪整个视频创建路径的技术进行了对比。结果令人震惊:他们这种更简单的方法生成的视频不仅质量更好,而且所需的计算时间仅为前者的极小部分。在一次使用名为 Wan2.1 模型的特定测试中,他们的方法在仅使用之前最佳方法约十二分之一训练时间的情况下,实现了最高的整体质量得分。这表明,旧方法的复杂性是不必要的;改进的关键不在于精炼概率的数学机制,而在于如何设计和应用奖励信号。

他们发现的一个关键部分在于理解模型究竟在优化什么。研究人员发现,标准的奖励(通常侧重于视觉清晰度或视频与文本描述的匹配程度)可能会在无意中鼓励模型生成静态、不动的图像,这些图像看起来很干净,但却很枯燥。为了解决这个问题,他们引入了一种专门追踪运动的新型奖励,确保视频包含有意义的运动。当他们将这种专注于运动的奖励加入系统时,视频变得更加动态,且没有损失其视觉质量。这一发现强调了,对于这些强大的模型而言,最重要的因素不是训练算法的复杂程度,而是为机器设定的目标是否清晰且具体。

研究还表明,用于更新模型的特定数学公式比之前认为的要重要程度较低。研究人员展示了他们的新方法在数学上等同于其他几种近期的研究方法,这意味着这些方法之间的性能差异很可能是由于如何设置奖励,而非核心算法本身。通过剥离掉概率估计中不必要的层级,他们证明了直接的、基于速度的更新足以引导模型走向更好的结果。这种简化为更高效的训练打开了大门,使研究人员能够更快地迭代,并有可能在不受到计算成本瓶颈限制的情况下,将这些技术扩展到更复杂的任务中。

最终,这项工作表明我们对训练生成式人工智能的思考方式正在发生转变。与其将问题视为一个复杂的概率估计谜题,研究人员展示了将其视为直接将模型的内部方向与人类偏好进行对齐会更为有效。他们的方法取得了优异的结果,并大幅减少了资源消耗,这表明高效 AI 训练的未来可能在于更简单、更直接的反馈循环。随着这些模型在规模和能力上的不断增长,快速且有效地对其进行微调将变得至关重要,而这种新方法为使人工智能更贴合人类需求提供了一条清晰且实用的路径。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →