← 最新论文
💻 computer science

DOLLAR: Few-Step Video Generation via Distillation and Latent Reward Optimization

DOLLAR 框架引入了一种新颖的少步视频生成方法,该方法将变分与一致性蒸馏同一种内存高效的潜在奖励优化方法相结合,在 10 秒视频生成中实现了最先进的质量与多样性,同时将采样速度提升了高达 278.6 倍。

原作者: Zihan Ding, Chi Jin, Difan Liu, Haitian Zheng, Krishna Kumar Singh, Qiang Zhang, Yan Kang, Zhe Lin, Yuchen Liu

发布于 2026-05-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Zihan Ding, Chi Jin, Difan Liu, Haitian Zheng, Krishna Kumar Singh, Qiang Zhang, Yan Kang, Zhe Lin, Yuchen Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一位主厨(教师模型),能烹制出一道完美且复杂的 10 秒视频菜肴。问题在于,这位主厨极其缓慢。为了把菜做好,他们要品尝、调整、再品尝、再调整,反复 50 次才端上桌。如果你希望每天都能得到一道菜,这个过程将耗时无穷,并耗尽你厨房的所有电力(计算能力)。

本文介绍了DOLLAR,一种训练学生主厨的新方法,使其能在仅4 步(甚至 1 步)内烹制出完全相同的美味菜肴,且不损失任何风味或质量。

以下是他们通过三个简单技巧实现这一目标的方法:

1. “试味”与“一致性”训练

通常,当你试图教导学生快速烹饪时,会遇到两个问题:

  • 问题 A(“乏味”的学生): 如果你只是让学生模仿主厨的最终菜肴,他们可能能掌握味道,但每次都会做出完全相同的菜肴(缺乏多样性)。
  • 问题 B(“混乱”的学生): 如果你让他们发挥创意并加快速度,菜肴可能看起来不错,但味道糟糕或不一致。

作者通过结合两种训练方法解决了这个问题:

  • 变分分数蒸馏(VSD): 这就像学生品尝主厨的菜肴,并尝试完美匹配其风味特征。它确保视频具有高质量。
  • 一致性蒸馏(CD): 这就像一种训练,让学生练习直线烹饪。它确保无论他们如何开始烹饪,最终都能得到一致的结果。这保持了视频的多样性,防止它们变成“乏味”的复制品。

通过混合这两种方法,学生学会了既高质量多样化,但速度快得多。

2. “秘制酱汁”(潜在奖励优化)

即使有了快速的学生,有时视频也不完全符合你的要求。也许你希望它看起来更“电影化”或拥有更好的光线。通常,要解决这个问题,你必须将视频发送给一位巨大而缓慢的“美食评论家”(奖励模型),由他检查每一个像素。这很慢,并且需要巨大的厨房(计算机内存)。

作者发明了一种潜在奖励模型(LRM)

  • 类比: 他们不是将成品(且沉重)的视频送给评论家,而是训练一个微小的、口袋大小的“迷你评论家”,在视频完全烹制之前就对其食材(潜在空间)进行评判。
  • 优势: 这个迷你评论家微小、快速,且无需看到整个视频即可提供反馈。它会告诉学生主厨:“你的光线有点偏差”,学生随即立即调整。这使得学生能够超越主厨原有的技能,特别是在美学或文本对齐等方面,而无需超级计算机。

3. 结果:超快厨房

论文声称,使用这种方法:

  • 速度: 他们可以在4 步内生成 10 秒视频,而不是 50 步。这比原始方法快高达278 倍。这几乎就像实时生成一样。
  • 质量: 学生视频在标准测试(称为VBench)中的得分高于原始主厨,以及其他顶级竞争对手如 Gen-3 和 Kling。
  • 效率: 由于他们使用“迷你评论家”(潜在奖励模型)而不是巨大的那个,他们节省了海量的计算机内存。你不需要超级计算机来运行它;它可以在标准的高端 GPU 上运行。

总结

DOLLAR视为一个训练项目,它将一个缓慢、追求完美的视频生成器转变为一位闪电般的艺术家。它通过以下方式实现:

  1. 教导艺术家同时做到准确富有创意
  2. 为他们配备一个微小、智能的助手,提供即时质量反馈,因此他们无需等待缓慢的巨型计算机来检查他们的工作。

其结果是一个系统,能在几秒钟内而非几分钟内创建高质量、多样化的视频,使“实时”视频生成成为现实。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →