← 最新论文
💻 computer science

Flex-Forcing: Towards a Unified Autoregressive and Bidirectional Video Diffusion Model

Flex-Forcing 是一个统一的视频扩散框架,它通过采用灵活的分块机制,将用于全局连贯性的双向推理与用于提升效率的自回归生成相结合,从而实现比僵化的基准方法更优越的视频质量、长视频稳定性以及更快的推理速度。

原作者: Xinyin Ma, Julius Berner, Chao Liu, Arash Vahdat, Weili Nie, Xinchao Wang

发布于 2026-07-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Xinyin Ma, Julius Berner, Chao Liu, Arash Vahdat, Weili Nie, Xinchao Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在尝试绘制一段 30 秒的电影场景。你有两种主要的绘画方式,且两者都各有利弊:

  1. “由后向前”的画家(双向式/Bidirectional): 这位艺术家同时观察整块画布。他们能同时看到开头、中间和结尾。这确保了故事逻辑通顺、光影一致,且角色不会突然换衣服。然而,这种方式极其缓慢。每当他们增加一笔时,都必须重新评估整幅画作。
  2. “一笔一划”的画家(自回归式/Autoregressive): 这位艺术家逐帧绘画,从左向右进行。他们只关注已经画好的部分。这非常快,非常适合流媒体播放,但因为他们看不见未来,可能会出现这样的情况:在第一帧里角色正向左走,结果到最后一帧时却不小心变成了向右走。这会导致故事变得“漂移”且前后不一致。

Flex-Forcing 是一种全新的“超级画家”,它结合了两者的优点。它并不强迫你在速度与质量之间做出选择,而是给了你一把智能且灵活的尺子,让你可以在这两种风格之间随时切换。

以下是它的工作原理,通过简单的类比来解释:

1. 灵活的尺子(灵活分块/Flexible Chunking)

想象你正在读一本长篇小说。

  • 旧的方法: 你要么一次读完整本书(慢,但你能掌握完整剧情),要么一次只读一个词(快,但你可能会忘记剧情)。
  • Flex-Forcing 的方法: 你使用一把尺子将书分成若干个“块(chunks)”。
    • 在过程早期(高噪声阶段): 当视频还只是一个模糊的想法堆砌时,Flex-Forcing 使用大块。它会一次观察视频的大部分区域,以规划宏观蓝图(比如摄像机运动或主要场景)。这确保了故事拥有稳固的结构。
    • 在过程后期(低噪声阶段): 当视频变得清晰且细节丰富时,它会切换到小块。它会逐一专注于微小的细节(比如闪烁的烛火或特定的面部表情)。这既快速又高效。

这意味着模型可以变得很“聪明”,根据当前需要的细节程度,决定何时该“向前看”,何时只需“向前推进”。

2. 噪声转换器(K-投影/K-Projection)

这里有一个棘手的问题:当模型观察“过去”(即已经画好的部分)时,那部分是非常清晰、干净的。但当它观察“未来”(即尚未绘画的部分)时,那部分仍然是一个模糊、充满噪声的猜测。

如果你试图将一张清晰的照片与一张模糊的草图进行对比,它们是匹配不上的,这会让艺术家感到困惑。

  • 解决方案: Flex-Forcing 使用了一个特殊的“转换器”(称为 K-Projection)。在模型对比过去与未来之前,它会特意为清晰的“过去”部分添加一点“模糊”,使其噪声水平与“未来”的部分相匹配。
  • 结果: 模型现在可以将过去和未来并排观察而不会产生混乱,从而在保持快速生成的同时,实现流畅的整体视频规划。

3. “随处编辑”的超能力

由于该模型即使在逐帧生成时也能理解整个视频的结构,因此它可以做到普通快速画家无法做到的事情:修改中间部分而不破坏结尾。

  • 普通的快速画家: 如果你要求他们在电影中间修改一个角色的衬衫,他们可能会在不知不觉中把最后一帧里角色的脸也给改了,因为他们丢失了最初的计划。
  • Flex-Forcing: 你可以说:“把中间的衬衫改一下”,它就能做到。因为它在脑海中保留了“宏观蓝图”,所以电影的结尾与开头依然完美契合。它可以像重新排列书中的章节而不必重写全书一样,对视频的任何部分进行任何顺序的编辑。

为什么这很重要(根据论文所述)

论文声称,Flex-Forcing 在两个关键方面超越了当前最优秀的方法(如“Self-Forcing”):

  1. 更好的质量: 视频更加连贯。角色不会发生奇怪的变形,动作也更加平滑。
  2. 更好的速度: 它能比那些缓慢的“观察一切”的模型更快地生成视频,同时仍保持高质量。

简而言之,Flex-Forcing 就像是一个拥有 GPS(规划路线)和 跑车(快速行驶)的视频生成器。它不必在“了解目的地”和“快速驾驶”之间做选择;它能同时做到这两点。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →