技术摘要:CachedSearch —— 用于视频扩散模型测试时搜索的无训练缓存探索
1. 问题陈述
视频扩散模型是计算成本最高的生成式工作负载之一。测试时搜索策略(例如 Best-of-N)通过采样多个候选对象并利用验证器选择得分最高的输出,使这一成本增加了 2 到 10 倍。在标准的 Best-of-N 中,每个候选对象都以全额计算成本进行生成,尽管其中大多数最终会被舍弃。
虽然存在通过跨去噪步骤重用特征来加速单个 Rollout 的无训练缓存技术(可实现 2–3 倍的加速),但其在测试时搜索中的应用尚未被探索。核心障碍在于一个微妙的问题:缓存是有损的。虽然它在种子匹配的比较中可能保持像素级保真度,但不清楚它是否能保持验证器下的候选对象相对排序。如果缓存改变了排名,搜索过程可能会选择错误的候选对象,从而抵消效率增益。本文研究了缓存是否会破坏视频测试时搜索中的候选对象排名,并提出了一种安全利用缓存的方法。
2. 方法论:CachedSearch
作者提出了 CachedSearch,一种将探索与交付解耦的、无训练且与验证器无关的协议。该方法基于以下原则:虽然在缓存下像素保真度可能会略有下降,但候选对象的相对排名通常保持不变。
核心工作流
- 探索(廉价): 使用激进的缓存生成 N 个候选对象。一个包装器拦截 Transformer 调用,并在累积输入漂移低于阈值 τ 时跳过计算。
- 评分: 使用验证器(如 ImageReward)对所有 N 个缓存的候选对象进行评分。
- 选择: 识别出得分最高的缓存候选对象所对应的种子(Seed)。
- 提交(全量): 仅针对选中的种子,以全额计算成本重新生成(不使用缓存),以产生最终输出。
技术实现
- 自适应变换向量缓存: 该方法通过 EasyCache 的变体封装扩散 Transformer (DiT)。它不是缓存原始输出,而是缓存变换向量 Δ=vθ(xref)−xref。
- 跳过规则: 一个累积漂移指标 a 追踪潜变量输入的相对变化。如果 a≤τ,则跳过 Transformer 调用,并使用近似值 v^θ(x)=x+Δ。一旦 a>τ,则执行 Transformer 计算并刷新状态。
- 确定性: 该过程对于固定的 (c,s,τ) 是确定性的,确保“提交”阶段能够重现所选种子的精确全量计算样本。
- 成本模型: CachedSearch 的成本为 N⋅Cc+Cf,其中 Cc 是缓存 Rollout 的成本,Cf 是全量成本。当 N>N∗=1/(1−γ)(其中 γ=Cc/Cf)时,这显著低于全量 Best-of-N (N⋅Cf) 的成本。
3. 核心贡献
- 首个排名保持研究: 本文提供了关于缓存是否能在测试时搜索中保持候选对象排名的首次实证研究。它建立了一个在 Gate Grid、VBench 和 VBench-2.0 上进行的种子匹配协议。
- “廉价探索,全量提交”协议: 引入了 CachedSearch,它以仅 63% 的墙钟时间成本,保留了全量 Best-of-8 搜索中 94.7% 的奖励增益。
- 破坏性分析: 证明了排名错误具有“自我限制性”。破坏主要集中在候选对象得分极其接近(得分分布极低)的提示词上。在这些情况下,选择“错误”的候选对象所带来的遗憾(Regret)极小。
- 泛化性: 展示了该方法可跨越六种模型和四种架构家族(Wan, LTX, CogVideoX, Hunyuan)进行迁移,参数规模从 1.3B 到 14B 不等,每种家族仅需重新校准单个参数 (τ)。
- 组合性: 证明了 CachedSearch 可以与候选对象剪枝方法进行乘性叠加,实现了 3.11 倍的探索加速。
4. 实验结果
评估主要在 Wan2.1-T2V-1.3B 上进行,并在更大规模的模型和不同套件上进行了复现。
- 排名保持:
- 在 VBench 套件(946 个提示词)上,缓存得分与全量得分之间的中位数逐提示词 Spearman 秩相关系数 (ρ) 为 0.905。
- Top-1 一致性(选择相同的最佳候选对象)为 72%。
- VBench-2.0(更难的套件)复现了这些结果,ρ=0.881。
- 效率与增益捕获:
- 在 N=8 时,CachedSearch 以 63% 的成本捕获了全量 Best-of-8 收益的 94.7%。
- 在固定预算下,它允许搜索得更宽(例如,8 个候选对象对比 4 个),比全量 Best-of-4 获得 38% 更多的奖励。
- 该方法随宽度扩展:在 N=16 时,它以 57% 的成本捕获了 95.7% 的收益。
- 遗憾分析:
- 平均遗憾较低(VBench 上为 0.056),中位数为 0。
- 72% 的提示词产生的遗憾为零。
- 错误主要发生在得分分布极低的场景中,即正确选择的价值本身就很低。
- 模型通用性:
- 该方法适用于 1.3B–14B 的规模。Wan2.1-14B 达到了与 1.3B 模型相同的中位数 ρ (0.905)。
- 异构模型(如 CogVideoX-5B)需要重新校准 τ(例如从 0.10 调整为 0.05)以保持高捕获率(>85%)。
- 与其他方法的比较:
- 与“步骤截断”(减少去噪步数)相比,缓存保留了显著更多的搜索价值(捕获率为 90.1%,而截断为 72.6%),因为它扰动的是同一条轨迹,而不是采样不同的分布。
- 它与各种缓存引擎(PAB, CFG-Cache, TeaCache)兼容,形成了一个统一的“捕获 vs 加速”前沿。
5. 重要性与主张
本文声称 CachedSearch 是视频扩散模型测试时扩展的“插件式倍增器”。其重要性在于:
- 解耦保真度与排名: 它证明了对于搜索目的而言,候选对象不需要达到像素级的完美;它们只需要对它们的相对顺序保持“诚实”。
- 无需训练即可降低成本: 它在无需微调或修改模型权重的情况下,实现了近乎无损的质量保留和显著的成本降低(结合剪枝可达 3.11 倍)。
- 可扩展性: 该方法与搜索算法和验证器是正交的,因此适用于任何“采样后排序”的循环。
- 实际影响: 它使得较小的模型(如 1.3B)能够在相同的计算预算内通过扩大搜索空间来媲美更大的模型,从而有效地实现了高质量视频生成的民主化。
作者总结道,这一教训不仅限于缓存:任何有损加速器都可以支持探索,只要它通过了“排名与遗憾”审计,这为在生成式 AI 中分配加速器预算提供了一个新的方向。