技术摘要:自梯度强制 (Self Gradient Forcing, SGF)
1. 问题陈述:历史上下文-梯度间隙 (Historical Context-Gradient Gap)
最近自回归视频扩散技术的进展转向了自强制 (Self Forcing),这是一种模型在由其自身自回归展开生成的历史记录而非真实视频上下文中进行训练的范式。这种方法通过将训练分布与推理条件对齐,减轻了曝光偏差。然而,作者指出当前自强制实现中的一个关键局限性:历史上下文-梯度间隙。
在标准的自强制中,虽然模型学习如何读取自生成的历史(通过 Key-Value 缓存)来预测未来帧,但将该历史写入缓存的过程仍然是无监督的。具体而言:
- 冻结的 KV 缓存: 在自回归展开过程中,先前生成的潜变量(latents)在干净的上下文时间步(tctx=0)被处理以生成 Key-Value 条目。这些条目作为“冻结”状态存储在缓存中,供后续块使用。
- 缺失监督: 未来的损失(例如在噪声时间步下的分布匹配蒸馏损失)可以回传通过对缓存的读取(即未来 token 如何关注历史),但无法回传通过对缓存的写入(即早期潜变量如何编码为 KV 表示)。
- 后果: 随着展开过程的延伸,负责将干净时间步 KV 条目写入内存的参数会发生漂移,因为这些参数是由噪声时间步的损失更新的,而缺乏关于生成的内存表示是否对长程生成有用的直接反馈。这导致了长视频生成中的身份漂移、布局不一致和场景断裂。
一个直接的解决方案——保持整个串行展开图的可微性,从而允许未来的损失回传至整个历史——由于计算图随展开长度增长而导致的内存爆炸,在计算上是不可行的。
2. 方法论:自梯度强制 (SGF)
作者提出了自梯度强制 (SGF),这是一种两阶段训练策略,它在不需要完整的串行展开反向传播的情况下,恢复了缺失的内存写入监督信号。SGF 与现有的强制改进方案是正交的,可以叠加应用。
两阶段策略
SGF 将训练步骤分解为两个截然不同的阶段:
第一阶段:无梯度自回归展开 (No-Gradient Autoregressive Rollout)
- 模型执行与推理完全相同的标准串行自回归展开,但禁用梯度。
- 对于每个块 i,模型利用当前的实时历史 KV 缓存对潜变量 zi 进行去噪。
- 在选定的“退出步” s(一个特定的去噪时间步),模型记录:
- 噪声输入潜变量 (Z∗)。
- 在退出步生成的预测干净潜变量 (X~ctx)。
- 干净的潜变量在 tctx=0 时被处理以更新下一个块的串行 KV 缓存,但此更新与计算图脱离(detached)。
第二阶段:并行上下文-梯度重构 (Parallel Context-Gradient Reconstruction)
- 模型丢弃串行缓存,并并行地重构选定退出步的计算过程。
- 将第一阶段记录的干净潜变量 (X~ctx) 作为停止梯度 (stop-gradient) 输入重新喂入模型。
- 模型重新计算干净上下文的隐藏状态、KV 表示以及未来到上下文的因果注意力。
- 至关重要的是,在此阶段生成的 KV 表示是可微的。
- 随后,模型处理记录的噪声潜变量 (Z∗) 以生成预测,产生的损失(例如 DMD 损失)将被回传。
- 结果: 梯度从未来的损失出发,经过目标侧去噪,经过注意力机制,最后回传到 KV 写入计算(即干净上下文的前向传播)。这使得未来的损失能够监督自生成的历史如何被编码进内存。
技术实现细节
- 梯度边界: 该方法避免了完整的展开反向传播 (BPTT)。梯度仅通过受限的第二阶段重构进行流动。重构的输入(记录的潜变量)保持停止梯度状态,确保优化聚焦于写入机制而非展开轨迹本身。
- 效率: 通过使用带有静态因果掩码(例如通过 FlexAttention)的并行重构,SGF 避免了与完全可微串行缓存相关的内存膨胀。
- 流式策略: 对于逐帧生成,SGF 使用 Sink-plus-FIFO 上下文策略,维持一个固定的 Sink 前缀和一个最近潜变量的窗口,以隔离梯度强制的影响。
3. 核心贡献
- 识别间隙: 本文正式识别了冻结缓存自强制中的“历史上下文-梯度间隙”,即未来的损失仅能监督缓存的读取,而无法监督干净上下文的写入计算,从而导致长程生成的漂移。
- SGF 算法: 引入了一种两阶段训练策略,通过并行上下文-梯度重构恢复内存写入监督,使模型能够学习将上下文编码为更有效的因果记忆。
- 实验验证: 大量实验证明,SGF 在 60s 和 240s 维度上显著提升了原生长视频外推能力,同时保持了与自强制相当的短程(5s)生成质量。
4. 实验结果
作者在各种初始化方式(Causal ODE, Causal CD, Teacher Forcing)和不同时长(5s, 60s, 240s)下,针对逐帧和分块生成,将 SGF 与匹配的自强制基线进行了评估。
- 定量指标:
- 在 60s 和 240s 维度下,SGF 在主体一致性 (subject consistency)、背景/布局一致性 (background/layout consistency)、时间稳定性 (temporal stability/flickering) 以及美学质量 (aesthetic quality) 方面持续优于自强制。
- 虽然自强制在“动态程度 (dynamic degree)”上得分有时更高,但作者将其归因于不连贯的运动(场景跳变、物体变形)而非质量。SGF 保持了更稳定且合理的相机演变。
- 在 5s 维度下,SPF 的表现与自强制相当,证实了该方法不会降低短期生成质量。
- 定性结果:
- 视觉对比显示,随着外推的进行,自强制模型最终会出现身份漂移、视角跳变和布局崩溃。
- SGF 模型即使在仅使用 5 秒窗口进行训练时,也能在 240 秒内保持主体身份、姿态和场景布局。
- 用户研究: 一项包含超过 1,900 次配对判断的盲测 GSB (Greater-Same-Better) 偏好研究显示,在所有测试设置中,用户一致偏好 SGF 而非自强制,其正向偏好分数范围在 ~29% 到 ~48% 之间。
- 训练可行性: SGF 引入了轻微的开销。峰值内存略有增加(从 ~79GB 增至 ~87GB),但由于消除了循环图,稳定内存有所下降(从 ~79GB 降至 ~63GB)。运行时间每 5 个训练步增加约 1.3 秒。
5. 重要性与主张
本文声称 SGF 解决了当前自回归视频扩散训练中的一个根本性限制:即无法通过损失函数来监督自生成历史向内存的编码过程。
- 原生外推: SGF 使模型能够在短窗口(如 5 秒)训练的基础上,实现分钟级视频(60s, 240s)的高质量、高连贯性外推。
- 正交性: 该方法被呈现为一种可掉落式的改进,可以与其他的强制技术(如 Causal Forcing, Rolling Forcing)及初始化策略结合使用,且不会产生冲突。
- 内存写入监督: 其核心意义在于将训练目标转向确保模型不仅学会如何读取其历史,还学会如何以一种对未来生成步骤依然有效的方式来写入历史。
作者总结道,通过弥合历史上下文-梯度间隙,SGF 提供了一条通往高质量、原生长视频生成的规模化路径,而无需承担全可微展开所带来的高昂内存成本。