想象一下,你正试图创作一幅杰作,但你被限制只能画极少数的几笔。如果你试图仅用寥寥数笔就完成整幅画作,你可能会遗漏重要的细节,或者导致色彩看起来不对劲。这就是现代 AI 图像和视频生成器面临的挑战:它们通常需要数百次“笔触”(称为步数/steps)来创造高质量的图像,这既耗时又消耗大量的计算资源。
为了提高速度,研究人员尝试了一种被称为**缓存(caching)**的小技巧。你可以把它想象成一位画家,他不再为每一笔都重新调配颜料,而是重复使用刚才调好的那一桶颜料。如果场景变化不大,重复使用旧颜料就能节省时间。
然而,旧有的决定何时重复使用颜料的方法(即“缓存调度方案”)存在一个重大缺陷。它假设每一次决定重复使用颜料的行为都是相互独立的。这就像是一个 GPS 导航系统,它在计算最短路径时,只是简单地把每一段微小路段的距离相加,却忽略了如果在早期选择了一条捷径,可能会导致后期陷入严重的交通拥堵。在“低步数”模式下(即当你试图追求极致速度时),这种旧方法会失效,导致生成的图像模糊或扭曲。
迎来 OTCache:“智能导航员”
论文作者提出了一种名为 OTCache 的新系统。OTCache 不再将每一个决策视为一个孤立的数学问题,而是将整个绘画过程视为一段平滑、流动的旅程。他们使用了名为**最优传输(Optimal Transport)**的数学概念,你可以把它想象成一种策略的“奶昔搅拌机”。
以下是 OTCache 的运作方式,分为简单的三个步骤:
- 安全地图(参考/Reference): 首先,系统会观察一个拥有充足时间(高步数)的“安全”场景。它使用一种标准且可靠的方法,来确定在这种舒适的环境下进行绘画的最佳方式。这为他们提供了一张高质量的“地图”,展示了绘画过程应当如何演变。
- 极端测试(锚点/Anchor): 接下来,他们观察另一个极端情况:时间几乎完全不够用的场景(极低步数)。在这种冲刺状态下,旧有的“累加距离”方法会失效。因此,OTCache 使用了一种智能且轻量级的搜索工具,来寻找这种紧急情况下的绝对最佳绘画方式,即使这意味着必须打破旧有的规则。这成为了他们针对极端速度设置的“锚点”。
- 平滑融合(插值/Interpolation): 现在,假设你想以介于“安全地图”和“极端测试”之间的速度进行绘画。OTCache 不会靠猜测,而是将“安全地图”与“极端测试”进行平滑融合。它将绘画进度表视为一根灵活的橡皮筋,通过拉伸和扭曲来适应你所需的精确速度。由于“安全地图”与“极端测试”是由一条平滑的数学曲线连接的,因此中间的速度也能完美运行。
实验结果
该论文在三个强大的 AI 模型(FLUX.1、Qwen-Image 和 HunyuanVideo)上进行了测试。结果令人印象深刻:
- 速度: OTCache 使 AI 的速度比以前提升了 3.6 到 4.7 倍。
- 质量: 不同于其他会导致图像看起来怪异或扭曲(例如长着多余腿的羊,或者方向错误的长颈鹿)的快速方法,OTCache 保持了图像的锐利度,并使其高度符合原始描述。
- 可靠性: 它解决了其他方法在被要求提速过快时会彻底失效的问题。
总结
你可以把 OTCache 想象成一位聪明的旅行规划师。旧的规划师会告诉你:“走第一英里时选最快的路,然后走第二英里时也选最快的路”,却没意识到第一条路可能会把你带入死胡同。OTCache 则会观察从起点到终点的整个行程,理解随着速度加快旅程是如何变化的,并创造出一条平滑且优化的路径,让你在快速到达目的地(完美的图像)的同时,不会发生“车祸”。它是一种“无需训练(training-free)”的解决方案,这意味着它不需要重新学习如何绘画,它只是通过更聪明地决定何时重复使用工具,从而学会如何画得更快。
技术摘要:OTCache
问题陈述
扩散模型,特别是基于流匹配(Flow Matching, FM)和整流流(Rectified Flow)的模型,已在图像和视频合成领域取得了最先进的成果。然而,由于迭代去噪过程带来的巨大计算开销和内存占用,其在资源受限或交互式场景中的实际部署受到了阻碍。
虽然无需训练的缓存策略(training-free caching strategies)已经出现,通过复用中间特征来加速推理,但现有的基于图的方法(例如 MeanCache、LeMiCa)在低 NFE(函数求值次数)区间面临显著局限。这些方法通常将缓存调度建模为有向图上的约束最短路径问题,并依赖于加法独立性假设(additive independence assumption)。该假设认为,端到端退化的总和可以通过近似为独立局部边缘误差之和来表示。作者指出,这种替代方案在极端加速(低 N到的 NFE)情况下会失效,因为较大的积分步长会导致早期的缓存决策与后续步骤产生非线性相互作用,从而导致严重的保真度损失,而基于图的优化器无法恢复这些损失。此外,现有方法将每个预算(budget)视为独立处理,忽略了不同推理预算之间最优调度的结构规律性和平滑演化。
方法论:OTCache
为了解决这些局限性,作者提出了 OTCache,这是一个受**最优传输(Optimal Transport, OT)**启发,将缓存调度建模为策略空间中平滑演化的无需训练的框架。该框架分为三个不同的阶段:
第一阶段:参考策略获取(高预算)
在保守的高预算设置下(例如 Bref=20),使用标准的基于图的缓存方法(实例化为 MeanCache)来生成高保真度的参考调度(πref)。在此区间内,加法最短路径替代方案仍然可靠,能够为底层的 ODE 轨迹提供稳健的结构先验。
第二阶段:锚点策略搜索(低预算)
在极低预算区间(例如 Banc=8),即基于图的替代方案失效的场景下,OTCache 进行轻量级的黑盒搜索,以寻找近优的锚点调度(πanc)。
- 目标: 不再是最小化局部边缘误差,而是直接最小化缓存输出与全预算基准真值之间的端到端感知目标(LPIPS)。
- 优化: 搜索利用带有热启动(由 MeanCache 调度初始化)的 Optuna 与 CMA-ES 算法。优化在“间隙”(一阶差分)空间中进行,以保持单调性并改善搜索景观的条件设定。
第三阶段:目标预算路径预测
为了预测任意目标预算(B∈[Banc,Bref])下的调度,OTCache 将锚点策略与参考策略之间的转换建模为概率测度空间中的平滑轨迹。
- 连续表示: 使用分段三次埃尔米特插值多项式(PCH_PICHIP)将离散调度提升为连续的、严格单调的时间扭曲曲线。
- 分位数插值: 目标调度是通过锚点曲线与参考曲线之间的 Wasserstein 测地线插值(分位数函数的线性插值)生成的。
- 加权测地线: 插值权重由两个先验决定:局部性(与目标预算的距离)和置信度(对高预算参考的信任程度)。
- 保守实现: 使用幂律扭曲(ρ≥1.0)将连续测地线重新离散化为调度,使 NFE 密度向反向 ODE 的早期阶段偏移,因为这些阶段的向量场波动性最高。
核心贡献
- 重新思考缓存调度: 作者识别了现有基于图的调度器存在的两个根本缺陷:(i) 在低 NFE 区间,由于非线性误差传播,加法最短路径替代方案与实际情况不匹配;(ii) 未能利用不同预算之间的结构关系。
- 预算条件的调度演化: OTCache 引入了一个三阶段框架,将缓存调度视为概率测度。通过将它们的演化建模为策略空间中的平滑轨迹,该方法利用最优传输几何学在可靠端点之间进行插值,从而避免了独立预算优化的陷阱。
- 无需训练的加速: 该框架不需要对扩散模型进行重新训练,使其能够立即应用于现有架构。
实验结果
作者在三种最先进的生成模型上评估了 OTCache:FLUX.1 [dev]、Qwen-Image 和 HunyuanVideo。
- FLUX.1 [dev]: 在 4.50 倍加速(10 步)下,OTCache 实现了 0.254 的 LPIPS 和 0.996 的 ImageReward。这显著优于 MeanCache(LPIPS 0.272)和其他基准方法,后者在相似速度下会出现内容不一致和物体畸变。
- Qwen-Image: OTCache 在 4.70 倍加速(10 步)下实现了 0.171 的 LPIPS,展示了卓越的结构保真度(SSIM 0.864, PSSR 21.48),而 MeanCache 和 LeMiCa 则表现出明显的内容偏移和物体位移。
- HunyuanVideo: 对于文本生成视频任务,OTCache 在 3.66 倍加速下达到了 80.37% 的 VBench 分数和 0.252 的 LPIPS,优于 MeanCache(3.59 倍)并避免了 DiCache 和 TeaCache 等方法中出现的时序伪影。
消融研究:
- 内容一致性: 在高加速比下,OTCache 仍能保持罕见词语义和结构细节(例如场景中的特定物体),而 MeanCache 则表现出内容漂移。
- 参数 ρ: 研究发现非线性分配 NFE 密度(ρ=1.3)是最优的,平衡了早期阶段的稳定性与后期阶段的精细化。
- 搜索效率: 第二阶段的锚点搜索被证明是非常高效的,找到 Top-1 最优解所需的尝试次数中位数约为 50 次。
重要性与主张
本文声称 OTCache 通过从离散、独立的最短路径优化转向几何感知调度建模,为加速扩散模型提供了新的视角。通过将不同预算下的缓存策略演化解释为策略空间中的平滑轨迹,并利用最优传输进行插值,OTCache 恢复了传统基于图的方法在低 NFE 区间无法解决的保真度损失。该工作证明,在无需重新训练模型的情况下,可以实现显著的加速(高达 4.7 倍),同时保持甚至提高生成保真度。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。