← 最新论文
💻 computer science

A Systematic Post-Train Framework for Video Generation

本文提出了一种面向视频扩散模型的系统化后训练框架,该框架融合了监督微调、基于新颖组相对策略优化的强化学习人类反馈阶段、提示词增强以及推理优化,旨在通过显著提升指令遵循能力、时间连贯性和视觉质量并降低推理成本,从而弥合预训练性能与实际部署之间的差距。

原作者: Zeyue Xue, Siming Fu, Jie Huang, Shuai Lu, Haoran Li, Yijun Liu, Yuming Li, Xiaoxuan He, Mengzhao Chen, Haoyang Huang, Nan Duan, Ping Luo

发布于 2026-04-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Zeyue Xue, Siming Fu, Jie Huang, Shuai Lu, Haoran Li, Yijun Liu, Yuming Li, Xiaoxuan He, Mengzhao Chen, Haoyang Huang, Nan Duan, Ping Luo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一位才华横溢、世界级的厨师,他花费数年时间,研习了现存的所有食谱。这位厨师(即预训练模型)能够制作出令人惊叹的复杂菜肴。然而,如果你让他“做一份加额外芝士的辣味意大利面”,他可能会感到困惑,把厨房烧掉,或者端上一份外观精美但吃起来完全不像意大利面的菜肴。他们才华横溢,却难以预测,且运行成本高昂。

本文提出了一种四阶段训练营,旨在将这位才华横溢却反复无常的厨师,转变为一位可靠、高效且服从指令的专业人士,使其能够在繁忙的餐厅中工作。

以下是这四个阶段的运作方式,采用简单的类比进行说明:

第一阶段:“基础服从”新兵训练营(监督微调)

问题: 厨师懂得如何烹饪,但倾听能力不佳。他们可能会无视你的点单,或者自行制定规则。
解决方案: 在教授高级技巧之前,我们让他们接受严格的训练营。我们向他们展示成千上万个示例,明确告知在接到特定指令时该如何行动。
结果: 厨师不再自行制定规则。他们学会了说“是,主厨”,并可靠地遵循指令。这建立了一个稳定的基础,确保我们在后续加大训练强度时,他们不会失控。

第二阶段:“口味测试”竞赛(强化学习)

问题: 厨师现在能服从指令,但食物看起来可能仍有些怪异,酱汁可能结块,或者菜肴在几分钟后就会散架。
解决方案: 我们不再仅仅告诉厨师该做什么,而是让他们尝试同一道菜肴的不同版本,并相互评判。

  • 类比: 想象厨师制作了 8 个版本的意大利面。一个评委小组(即奖励模型)会品尝这些版本,并根据以下四点选出优胜者:
    1. 外观是否美观?(视觉美学)
    2. 酱汁是否顺滑?(运动质量)
    3. 味道是否符合点单要求?(文本对齐)
    4. 摆盘是否漂亮?(图像美学)
  • 魔法所在: 厨师不再靠猜测,而是通过比较自己的尝试来学习。如果版本 A 比版本 B 看起来更好,厨师就会学习多做版本 A 所做的事情。这被称为GRPO(组相对策略优化)。这就像一支运动队通过内部对抗练习来提速,而不是等待教练的斥责。

第三阶段:“翻译器”升级(提示词增强)

问题: 有时厨师很棒,但(作为顾客)不擅长描述你想要的东西。你说“做一个很酷的视频”,厨师却做出了无聊的东西,因为“酷”这个词太模糊。
解决方案: 我们聘请一位聪明的翻译(即语言模型)坐在你和厨师之间。

  • 类比: 你告诉翻译:“我想要一个很酷的视频。”翻译将其改写为:“日落时分,带有霓虹灯和飞行汽车的未来城市电影镜头。”
  • 训练: 这位翻译也使用同样的“口味测试”竞赛进行训练。如果翻译改写后的提示词能带来更好的菜肴,翻译就会获得高分。现在,即使你给出模糊的指令,翻译也能将其转化为厨师的完美食谱。

第四阶段:“速通”训练(自回归蒸馏)

问题: 厨师现在非常棒,但速度很慢。他们做一道菜需要数小时,因为他们要把每一种食材与厨房里的其他每一种食材进行核对。
解决方案: 我们教给厨师一种新的、更快的烹饪方法,无需一次性核对所有事物。

  • 类比: 厨师不再为了决定下一步做什么而审视整个厨房,而是学会逐帧(或逐步)烹饪,仅利用刚刚完成的内容来决定下一步。
  • 结果: 厨师现在可以更快地上菜(高效推理),而不会损失在前几个阶段学到的质量。这就像从缓慢、谨慎的手动挡切换到高速自动挡。

最终成果

通过这四阶段流程,视频生成模型将具备以下特性:

  1. 服从性: 它确实会听从你的指令。
  2. 美观性: 视频看起来流畅、逼真且高质量。
  3. 鲁棒性: 当你给出复杂提示时,它不会崩溃。
  4. 快速性: 它能以足够快的速度生成视频,从而在现实世界中具有实用价值。

该论文在其内部视频模型上进行了测试,发现仅“口味测试”阶段就使视频在人类评估中提升了31%,而加入“翻译器”后,又进一步提升了20%。其结果是一个准备好投入实际应用的系统,而不仅仅是一个实验室里的酷炫实验。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →