想象一下你正在尝试绘制一段 30 秒的电影场景。你有两种主要的绘画方式,且两者都各有利弊:
- “由后向前”的画家(双向式/Bidirectional): 这位艺术家同时观察整块画布。他们能同时看到开头、中间和结尾。这确保了故事逻辑通顺、光影一致,且角色不会突然换衣服。然而,这种方式极其缓慢。每当他们增加一笔时,都必须重新评估整幅画作。
- “一笔一划”的画家(自回归式/Autoregressive): 这位艺术家逐帧绘画,从左向右进行。他们只关注已经画好的部分。这非常快,非常适合流媒体播放,但因为他们看不见未来,可能会出现这样的情况:在第一帧里角色正向左走,结果到最后一帧时却不小心变成了向右走。这会导致故事变得“漂移”且前后不一致。
Flex-Forcing 是一种全新的“超级画家”,它结合了两者的优点。它并不强迫你在速度与质量之间做出选择,而是给了你一把智能且灵活的尺子,让你可以在这两种风格之间随时切换。
以下是它的工作原理,通过简单的类比来解释:
1. 灵活的尺子(灵活分块/Flexible Chunking)
想象你正在读一本长篇小说。
- 旧的方法: 你要么一次读完整本书(慢,但你能掌握完整剧情),要么一次只读一个词(快,但你可能会忘记剧情)。
- Flex-Forcing 的方法: 你使用一把尺子将书分成若干个“块(chunks)”。
- 在过程早期(高噪声阶段): 当视频还只是一个模糊的想法堆砌时,Flex-Forcing 使用大块。它会一次观察视频的大部分区域,以规划宏观蓝图(比如摄像机运动或主要场景)。这确保了故事拥有稳固的结构。
- 在过程后期(低噪声阶段): 当视频变得清晰且细节丰富时,它会切换到小块。它会逐一专注于微小的细节(比如闪烁的烛火或特定的面部表情)。这既快速又高效。
这意味着模型可以变得很“聪明”,根据当前需要的细节程度,决定何时该“向前看”,何时只需“向前推进”。
2. 噪声转换器(K-投影/K-Projection)
这里有一个棘手的问题:当模型观察“过去”(即已经画好的部分)时,那部分是非常清晰、干净的。但当它观察“未来”(即尚未绘画的部分)时,那部分仍然是一个模糊、充满噪声的猜测。
如果你试图将一张清晰的照片与一张模糊的草图进行对比,它们是匹配不上的,这会让艺术家感到困惑。
- 解决方案: Flex-Forcing 使用了一个特殊的“转换器”(称为 K-Projection)。在模型对比过去与未来之前,它会特意为清晰的“过去”部分添加一点“模糊”,使其噪声水平与“未来”的部分相匹配。
- 结果: 模型现在可以将过去和未来并排观察而不会产生混乱,从而在保持快速生成的同时,实现流畅的整体视频规划。
3. “随处编辑”的超能力
由于该模型即使在逐帧生成时也能理解整个视频的结构,因此它可以做到普通快速画家无法做到的事情:修改中间部分而不破坏结尾。
- 普通的快速画家: 如果你要求他们在电影中间修改一个角色的衬衫,他们可能会在不知不觉中把最后一帧里角色的脸也给改了,因为他们丢失了最初的计划。
- Flex-Forcing: 你可以说:“把中间的衬衫改一下”,它就能做到。因为它在脑海中保留了“宏观蓝图”,所以电影的结尾与开头依然完美契合。它可以像重新排列书中的章节而不必重写全书一样,对视频的任何部分进行任何顺序的编辑。
为什么这很重要(根据论文所述)
论文声称,Flex-Forcing 在两个关键方面超越了当前最优秀的方法(如“Self-Forcing”):
- 更好的质量: 视频更加连贯。角色不会发生奇怪的变形,动作也更加平滑。
- 更好的速度: 它能比那些缓慢的“观察一切”的模型更快地生成视频,同时仍保持高质量。
简而言之,Flex-Forcing 就像是一个拥有 GPS(规划路线)和 跑车(快速行驶)的视频生成器。它不必在“了解目的地”和“快速驾驶”之间做选择;它能同时做到这两点。
技术摘要:Flex-Forcing
问题陈述
目前的视频生成方法受限于僵化的推理范式,被迫在两种主流方法之间进行权衡:
- 双向扩散模型(Bidirectional Diffusion Models): 这些模型利用全上下文注意力来对所有帧进行联合建模,从而实现高视觉保真度和强大的长程时间连贯性(例如相机运动、场景转换)。然而,它们面临着高昂的计算开销和缓慢的推理速度,限制了其在实时或长视频生成中的可扩展性。
- 自回归模型(Autoregressive Models): 这些模型通过因果调节(Causal Conditioning)和 KV 缓存进行顺序帧生成,从而实现高效、流式且实时的推理。然而,由于在生成过程中缺乏全局上下文,会导致误差累积,引起物体外观和运动的漂移,并导致全局时间一致性较弱。
现有工作通常针对其中一种范式进行优化,却牺牲了另一种,缺乏一种统一的机制来在单一框架内同时实现两者的优势。
方法论:Flex-Forcing
作者提出了 Flex-Forcing,这是一个统一的训练与推理框架,使单个视频扩散模型能够在双向、自回归或混合模式下无缝运行。其核心创新在于一个定义在两个正交轴上的**灵活分块(Flexible Chunking)**机制:
1. 灵活分块策略
- 时间轴(帧分块): 视频被划分为大小不等的连续块。在块内,帧进行双向建模(全注意力)。在块之间,生成保持自回归状态(受前序块调节)。这使得模型能够根据不同的设备预算和视频长度来调整分块粒度。
- 去噪时间步轴(Denoising Timestep Axis): 分块策略在去噪轨迹中是动态变化的。在早期步骤(高噪声阶段),利用较大的块来捕捉全局结构;而在后期精细化步骤(低噪声阶段),则利用较小的块来专注于局部细节。这创建了一个层级化的、金字塔式的结构,即随着噪声水平的降低,块的大小也随之减小。
2. 训练目标
该框架通过以下方式训练单个模型以处理混合的因果与非因果上下文:
- 随机分块(Stochastic Chunking): 在训练期间,模型会接触到从严格因果(逐帧)到完全双向的随机分块划分。这是通过一个非对称蒸馏流水线实现的(受 CausVid 和 Self-Forcing 启发),该流水线在保留非因果注意力能力的同时注入了因果性。
- 噪声水平对齐(K-Projection): 一个关键挑战在于,相同的查询 Token(Query Token)可能会关注来自不同噪声水平的键值状态(干净的过去 Token 与嘈杂的未来 Token)。标准的自注意力将这些视为同等对待,从而导致性能下降。作者引入了 K-Projection,这是一种轻量级的、与时间步相关的线性投影,它将来自过去帧的干净键状态映射到当前时间步的“嘈杂”潜空间中。这确保了所有被关注的键都处于一致的噪声表示空间内,从而稳定了灵活推理。
3. 推理灵活性
在测试时,配置好的模型可以:
- 以 双向模式(Bidirectional Mode) 运行,以获得最大的全局一致性。
- 以 自回归模式(Autoregressive Mode) 运行,以获得最大的效率和流式传输。
- 以 混合模式(Hybrid Mode) 运行,通过调整块大小和噪声水平依赖关系,在质量与速度之间找到最优的帕累托前沿(Pareto Frontier)。
核心贡献
- 统一框架: 第一个证明了双向和自回归范式可以在同一个训练好的模型中并存的方法,允许在测试时控制推理机制。
- 灵活分块与对齐: 引入了基于时间帧和去噪步骤的双重灵活分块,并结合了训练-测试一致的目标函数以及用于弥合不同因果上下文的 K-Projection 机制。
- 任意顺序、任意时间步编辑: 利用该统一框架,作者实现了新的编辑能力:
- 任意时间步编辑(Any-Timestep Editing): 将编辑限制在低层精细化时间步,同时保留高层规划,实现了全局结构与局部细节的解耦。
- 任意顺序编辑(Any-Order Editing): 通过对过去和未来的干净 Token 进行调节,允许在生成完整视频后,对任意时间段进行重新编辑,而无需重新生成整个序列。
实验结果
在 5 秒和 30 秒视频基准测试上进行了广泛实验(使用 Wan2.1 作为基础模型)。
- 性能-效率权衡: 与 Self-Forcing 等基线相比,Flex-Forcing 实现了显著改善的帕累托前沿。它在质量上持续优于因果模型,同时比僵化的双向模型提供更快的推理速度。
- 5 秒视频: 在与基线配置匹配的情况下(1.3B 参数),Flex-Forcing 获得了更高的 VBench 分数(例如,85.07 对比 Self-Forcing 的 84.31)和更高的 FPS(25.8 对比 24.9)。它还优于少步数蒸馏扩散模型。
- 30 秒视频: 在长视频基准测试中,Flex-Forcing 在大多数指标上均优于 Infinity-RoPE 和 Self-Forcing,特别是在 动态程度(Dynamic Degree) 和 运动平滑度(Motion Smoothness) 方面,展示了卓越的长程规划能力并减少了误差累积。
- 用户偏好: 用户研究表明,在 5 秒和 30 秒视频的视觉质量和提示词对齐方面,用户对 Flex-Forcing 的偏好高于 Self-Forcing。
- 消融实验: K-Projection 被证明是至关重要的;如果没有它,随着块大小的增加,性能会显著下降;而有了它,性能保持稳定并有所提升。
意义与主张
论文声称,Flex-Forcing 不再将双向和自回归生成视为相互竞争的范式,而是将其视为可以根据需求进行平滑调节的可控推理维度。通过统一这些方法,该方法:
- 降低了维护独立专门架构的计算成本和环境足迹。
- 通过允许运行时动态调整速度-质量权衡,使高保真、长篇视频生成在资源受限的环境中得以普及。
- 为创意和工业应用提供了精确的局部化编辑工具(任意顺序、任意时间步),促进了自适应生成系统的发展。
作者也承认了局限性,指出虽然放宽了严格的从左到右约束,但在极长视频中仍可能出现训练-推理不匹配导致的误差累积,且该方法的有效性高度依赖于预训练先验(特别是双向编码)。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。