想象一下,你试图绘制一幅长达 40 分钟的宏大故事壁画,但每次只能使用一块仅能容纳 10 秒画面的小画布。
旧方法(自回归生成):“多米诺效应”
目前,大多数 AI 视频生成器的工作原理就像一排多米诺骨牌。要制作长视频,AI 先绘制前 10 秒的画面,然后利用这幅画来推测接下来 10 秒的样子,再基于那幅推测再下一段,如此循环往复。
论文将这种现象称为“漂移”。就像“传话游戏”一样,每个 10 秒片段中都会出现微小的错误。等到 AI 生成到第 30 分钟时,角色的脸可能已变形为怪物,背景可能改变了颜色,或者故事可能已偏离了原本的情节。此外,AI 必须等待前一个片段完成后才能开始下一个,这使得整个过程非常缓慢。
新方法(锚定树采样):“施工脚手架”
来自 Descript, Inc. 的作者们提出了一种更聪明的方法,称为锚定树采样(Anchored Tree Sampling, ATS)。他们不再像以前那样一次只绘制一小条壁画,而是搭建一个脚手架。
以下是其工作原理,借用建筑类比来说明:
- 根调用(设立支柱): 首先,AI 一次性审视整个 40 分钟的故事。它并不试图绘制每一帧,而是在关键时刻放置几个“锚点支柱”(稀疏帧):开头、结尾以及中间的几个位置。你可以将这些视为主干,如同支撑桥梁的主要桥墩。
- 细化(填补空隙): 接下来,AI 查看第一根支柱和第二根支柱之间的空隙。它知道起点和终点的确切样貌,因此可以绘制它们之间的空间。它对第二根和第三根支柱之间的空隙也进行同样的操作。
- 叶节点(最终细节): 最后,它填充那些新绘制部分之间的微小空隙,直到整个视频完成。
为何这是游戏规则的改变者
- 不再漂移: 由于视频的每个部分都由已知的起点和终点“锚定”,AI 不会偏离轨道。如果你要求它在开头画一辆红色的车,在结尾也画一辆红色的车,它就会在中间保持车辆为红色。它无需基于模糊且充满错误的上一帧进行猜测。
- 超快速度: 旧方法就像一个人从左到右粉刷墙壁。新方法则像一支粉刷团队。一旦“支柱”设定好,不同的团队就可以同时粉刷墙壁的不同部分。这使得生成长视频的速度大大提升。
- 一致性: 视频从头到尾都能忠实于原始指令(如特定的姿势或边缘绘制),角色不会突然换衣服,背景也不会发生偏移。
其最佳适用场景(及局限性)
论文表明,该方法在静态摄像机视频中表现极佳(即摄像机不会剧烈移动,例如人物对着镜头说话,或固定拍摄某个场景)。在这些情况下,AI 可以轻易预测“锚点支柱”,因为背景变化不大。
然而,作者承认目前它仍存在局限:
- 动态摄像机: 如果摄像机在城市中穿梭或旋转,AI 有时难以正确猜测“锚点支柱”,因为视角变化过大。
- 新角色: 如果视频中间出现了开头或结尾“锚点”中未包含的新物体或人物,AI 绘制的样子可能与它若较早出现时略有不同。
- 文生视频: 目前,该方法在提供视频供 AI 修改(视频转视频)时效果最好。如果仅输入文本提示,使用难度较大,因为 AI 需要那些“锚点支柱”作为起点。
核心结论
该论文引入了一种“树”状结构,将长视频分解为可管理且相互连接的片段。通过在特定点锚定视频并并行填充空白,他们解决了视频随时间推移变得“潦草”的问题,并显著加快了生成过程。他们成功生成了长达 40 分钟且保持一致性和高质量的视频,而以往的方法在没有错误的情况下很难做到这一点。
技术摘要:用于长时程视频到视频生成的锚定树采样
1. 问题陈述
长时程视频生成,特别是在视频到视频(V2V)范式下,面临两个主要且相互交织的挑战:漂移和连续性问题。
- 漂移:随着生成随时间推移,误差会累积,导致视频质量下降(例如颜色、纹理和对比度的偏移)。
- 连续性问题:表现为缺乏物体持久性,或瞬态内容渲染不一致(例如物体以不同的风格或颜色重新出现)。
当前的解决方案主要依赖自回归(AR)蒸馏,即将双向模型转换为因果生成器。虽然这些方法试图稳定序列展开,但它们存在固有的局限性:
- 时程扩展依赖性:一个分块中的误差会条件化下一个分块,导致漂移随时间线性累积。
- 序列展开:生成必须逐步进行,导致无论可用硬件如何,挂钟时间都呈线性增长。
- 重置伪影:为了管理内存,AR 系统通常执行 KV 缓存重置。这些重置会丢弃累积的状态,导致物体身份和场景状态出现“跳跃式”不连续。
此外,现有的长视频工作主要集中在文本到视频(T2V)上。长时程 V2V(其中密集的逐帧条件信号,如姿态、深度、边缘,是预先已知的)仍未得到充分探索。作者认为,如果已知完整的条件 c1:T,坚持因果(从左到右)展开是不必要的。
2. 方法论:锚定树采样(ATS)
本文提出了锚定树采样(ATS),这是一种无需训练的推理时调度器,它用组织为树的从稀疏到密集、锚定边界的补全策略,取代了序列 AR 展开。
核心机制
ATS 利用一种“双向”原语(公式 2),其中模型基于起始锚点 Aa 和结束锚点 Ab 以及中间条件 ca:b 生成跨度 xa:b。这使得模型能够双向填充内容,而非因果式填充。
生成过程按层次组织:
- 根调用(稀疏锚点):单次调用生成跨越整个时程 T 的稀疏“锚点”(关键帧或短片)。在静态相机范式下,这些锚点直接源自密集条件信号,无需重新训练。
- 递归细化(中间锚点):通过在现有锚点之间生成新锚点来细化树。如果某个区间过大,超出了模型的上下文窗口,则插入中间锚点。
- 叶节点生成(密集帧):最后一步在相邻锚点之间合成密集帧。这些“叶”跨度在两侧均由锚点界定。
关键特性
- 自上而下的分解:依赖图是自上而下(根 → 细化 → 叶)的,而非从左到右。
- 并行性:给定父锚点,同一树层级上的兄弟节点是条件独立的。这允许在多个 GPU 上并行执行。
- 无需训练:ATS 不修改基础模型权重。它将预训练的双向生成器视为黑盒原语。
- 静态相机假设:当前实现假设相机是静态的,其中稀疏和密集条件看起来几乎相同,允许基础模型“开箱即用”地生成干净的稀疏锚点。
复杂度和延迟
- 自回归(AR):延迟与分块数量 K 呈线性关系(TAR≈K⋅τcall)。
- ATS:延迟与时程深度 L 呈对数关系(Ttree≈(L+1)⋅τcall)。
- 漂移缓解:通过将每个生成步骤限制在两个锚点之间,漂移被控制在锚点对的跨度内,而不是在整个视频上累积。
3. 实验结果
作者在 Wan 2.1 + VACE(一个双向 V2V 骨干网络)上评估了 ATS,并与两个当代自回归基线 LongLive 和 Reward Forcing 进行了对比。
设置
- 任务:在五种条件模态下进行 30 分钟 V2V 生成:修复、外绘、边缘、姿态和深度。
- 指标:来自 VBench-1.0 的美学质量(AQ)和成像质量(IQ),全局测量,以及作为“分块漂移”(缓存内退化)和“重置跳跃”(缓存重置处的不连续性)进行测量。
主要发现
- 质量提升:ATS 在整体质量上优于两种 AR 基线。
- 对比 LongLive:+4.0 AQ / +6.6 IQ。
- 对比 Reward Forcing:+5.7 AQ / +6.2 IQ。
- 漂移消除:
- 分块漂移:AR 方法在缓存窗口内显示出显著的质量下降。ATS 使这一现象扁平化,保持了跨分块的一致质量。
- 重置跳跃:AR 方法在缓存重置处表现出巨大的不连续性。ATS 完全消除了这些跳跃。
- 速度:由于并行化,ATS 在 2000 秒视频的生成速度上比最佳 AR 基线快 5.3 倍。仅需 8 块 GPU 即可实现快于实时的性能(3.3 倍)。
- 长时程稳定性:作者在 LTX-2.3 上展示了在所有五种模态下稳定生成 ≥40 分钟 视频的能力,且未观察到可感知的时程扩展内容漂移。
4. 局限性与未来方向
本文明确承认了当前静态相机实现的局限性:
- 锚点污染:单个劣质锚点(例如在根节点处)会污染其整个子树。这对静态相机来说不太关键,但对于稀疏生成更困难的动态相机来说是个问题。
- 弱运动引导:对于弱运动信号(例如深度图),单帧关键帧是不够的;需要多帧视频锚点。
- 一致性差距:ATS 保证在有限跨度内的时间相干性,但除非显式跟踪,否则并不固有地强制出现在锚点之间(相机外)的物体身份的一致性。
- 非 V2V 泛化:当前方法依赖密集源信号来生成稀疏锚点。它尚未泛化到纯文本到视频(T2V)或动态相机范式,在这些范式中,模型必须在没有密集引导的情况下幻觉出稀疏内容。
拟议的后续路径
作者提出了三个结构扩展以泛化 ATS:
- 稀疏生成专家:引入专用模型(类似于 DCARL 的关键帧生成器)来为 T2V 和动态相机生成稀疏锚点,取代根调用对密集条件的依赖。
- 语义 DAG:用**有向无环图(DAG)**替换严格的时间树,该图按语义约束(例如角色身份、场景变化)而非仅仅是时间进行索引,允许非相邻叶节点共享约束。
- 基于参考的条件:利用显式参考输入(图像/片段)来强制整个持续时间的连续性,从而绕过基于后缀内存固有的漂移。
5. 意义
本文声称,ATS 代表了长时程生成策略的重大转变。通过将调度问题与建模问题解耦,ATS 实现了:
- 漂移预防:将时程累积漂移转换为锚定边界漂移。
- 连续性:消除了由 AR 缓存重置引起的“跳跃式”伪影。
- 效率:将关键路径从线性减少为对数,通过并行化实现巨大的加速。
- 可扩展性:展示了首个非虚拟人框架,能够在不重新训练基础模型的情况下,实现接近小时级(40 分钟以上)的连贯、无漂移生成。
该工作得出结论,尽管目前针对静态相机 V2V 进行了优化,但这种基于树的双向范式为将长视频生成扩展到动态和文本驱动范式提供了坚实的基础。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。