← 最新论文
💻 computer science

Pusa V1.0: Unlocking Temporal Control in Pretrained Video Diffusion Models via Vectorized Timestep Adaptation

Pusa V1.0 引入了一种无损的向量化时间步自适应(VTA)方法,该方法能够在完全保留基础模型原有生成能力的同时,使预训练视频扩散模型实现细粒度的零样本时间控制——包括图像转视频、首尾帧条件控制以及视频扩展。

原作者: Yaofang Liu, Yumeng Ren, Aitor Artola, Yuxuan Hu, Xiaodong Cun, Xiaotong Zhao, Alan Zhao, Raymond H. Chan, Suiyun Zhang, Rui Liu, Dandan Tu, Jean-Michel Morel

发布于 2026-05-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Yaofang Liu, Yumeng Ren, Aitor Artola, Yuxuan Hu, Xiaodong Cun, Xiaotong Zhao, Alan Zhao, Raymond H. Chan, Suiyun Zhang, Rui Liu, Dandan Tu, Jean-Michel Morel

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你有一位精通从零开始制作特定类型菜肴的大厨:文本转视频。你给他一份食谱(文本提示),他就能变出一道美味的视频。这位大厨就是“基础模型”(具体来说,是一个名为 Wan-T2V 的模型)。

然而,这里有个问题。如果你想给大厨一个特定的起始食材(比如一张猫的照片),并说:“用这只猫作为开头制作视频”,大厨就会感到困惑。在旧的方法中,大厨必须从头学习一种全新的烹饪方式,而在这个过程中,他往往会忘记如何完美地制作原本的菜肴。这就像强迫大厨忘掉他所有的烹饪训练,只为学会一个新把戏。

于是,Pusa V1.0 登场了。

问题所在:“僵化的时钟”

当前的视频 AI 模型运作起来就像一座僵化且同步的时钟。想象视频是一排正在倒下的多米诺骨牌。在这些旧模型中,每一块多米诺骨牌(帧)都必须在完全相同的速度和时间下倒下。

  • 如果你希望第一块多米诺骨牌保持直立(你的起始图像),而让其余的倒下,时钟就会失灵。
  • 为了解决这个问题,其他模型试图“重新训练”大厨,但这既昂贵又缓慢,而且往往会破坏他们制作原本菜肴的能力。

解决方案:“独立的遥控器”

Pusa 引入了一个名为**向量化时间步适应(VTA)**的概念。

Pusa 不再为整个视频使用一个主时钟,而是给每一帧都配备了一个独立的遥控器

  • 第 1 帧(你的起始图像)的遥控器设置为“暂停”。
  • 第 2 帧的遥控器设置为“缓慢移动”。
  • 第 3 帧的遥控器设置为“快速移动”。

这使得 AI 能够独立地演化每一帧。第一帧会严格保持在你放置的位置,而视频的其余部分则会自然地围绕它流动。

魔法戏法:“非破坏性”手术

Pusa 最令人惊叹之处在于它是如何学习这一点的。

  • 旧方法:为了学会“以图像为起点”这个把戏,旧模型(如 Wan-I2V)不得不经历一次巨大且破坏性的 overhaul。它们必须在数百万个示例上进行重新训练,这相当于重建大厨的大脑。这不仅耗费了巨额的计算资源,而且往往导致它们忘记了原本执行文本转视频任务的能力。
  • Pusa 的方法:Pusa 进行的是“手术式”的调整。它不重建大厨的大脑,只是给现有的大脑添加一个微小的专用工具(向量化时间步)。
    • 类比:想象大厨已经精通烹饪。你不需要解雇他并雇佣一位新的大厨,只需递给他一个特定的计时器,告诉他何时停止搅拌第一锅。大厨的核心技能保持 100% 完好无损。

成果:廉价、快速且多功能

由于 Pusa 无需从头重新学习一切,其成果令人震惊:

  1. 超高效:其他模型需要数百万个示例和庞大的计算预算(计算成本超过 10 万美元),而 Pusa 仅用4,000 个示例和极小部分的成本(约500 美元)就达到了顶级效果。
  2. 零样本超能力:由于大厨的大脑没有被覆盖,Pusa 不仅学会了以图像为起点,还瞬间获得了执行其他复杂技巧的能力,无需任何额外训练,例如:
    • 起止帧:给 AI 提供开头和结尾的图片,让它填充中间部分。
    • 视频扩展:将短视频无缝地延长。
    • 文本转视频:它完美地保留了原本根据文本提示制作视频的能力。

总结

Pusa V1.0 就像在不拆解汽车的情况下升级引擎。通过给每一帧提供自己的“时间拨盘”,而不是强迫它们步调一致地行进,该模型能够以极高的效率处理复杂的视频任务(如从特定图像开始)。它在保留原始模型智能的同时,解锁了新的、灵活的能力,使高质量的视频生成变得更加廉价和易于获取。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →