想象一下,你正在尝试绘制一幅复杂的画面,比如一条熙熙攘攘的城市街道,但你必须一笔一画地慢慢完成。为了获得完美的结果,你可能需要走 50 步,在每一笔之后都检查作品并调整颜料。这非常耗时。
现代 AI 图像和视频生成器(称为整流流模型)正是这样工作的。它们是才华横溢的艺术家,但速度很慢,因为它们需要走很多微小的步骤来生成图像。
这篇论文介绍了一种名为**VDE(速度分解与估计)**的新技巧,它能让这些 AI 艺术家在不妨碍画作质量的前提下工作得更快。以下是其工作原理,使用简单的类比来说明:
旧方法:“冻结的蓝图”
以前的方法试图通过缓存(保存)上一步的绘图部分并直接复用来加速。
- 类比:想象你正走在一条小路上。旧方法说:“我只需复制 10 秒前所在位置的地图,并假设路径没有变化。”
- 问题:世界是动态的。如果你转过一个弯,或者景色发生了变化,那张旧地图就错了。AI 试图复用不再适合当前画面的旧特征,导致纹理模糊或出现奇怪的扭曲。这就像试图穿一件昨天还合身的衣服;今天可能就不合身了。
新方法(VDE):“智能导航员”
作者们意识到,与其复制旧地图,AI 实际上可以通过将其运动分解为两个简单的部分来预测下一步的去向。
将 AI 的运动(其“速度”)想象成一辆在公路上行驶的汽车。VDE 将这种运动分解为两个分量:
“向前”的推力(平行分量):这是汽车直线前进的程度。
- 发现:论文发现,这种“向前推力”的变化非常平滑且可预测。就像汽车加速一样;如果你知道过去两秒的速度,就可以用简单的数学(比如画一条直线)轻松猜出下一秒的速度。
- 技巧:VDE 不需要重新计算整个引擎,而是基于最后几步进行快速的数学估算。
“侧向”的漂移(正交分量):这是汽车为了保持在车道内而进行的细微左右调整。
- 发现:论文发现,在短时间段内,这种“侧向漂移”几乎完全不发生变化。就像汽车的方向盘在几秒钟内保持在完全相同的位置一样。
- 技巧:VDE 只需在几步中复用这个“侧向”方向,而无需重新计算。
VDE 在实际中如何运作
VDE 采用了一种“检查与估算”的策略:
- 锚点(检查):每隔几步,AI 进行一次完整、缓慢的计算,以获取完美、真实的数据。这就像司机停下来查看 GPS 并确认前方的道路。
- 估算(捷径):在中间的步骤中,AI 不进行繁重的计算。相反,它利用“向前”的数学估算和“侧向”的复用来即时确定下一步。
- 结果:AI 跳过繁重的工作,速度比之前快 2 到 3 倍。
为什么它更好
该论文在三种不同的 AI 模型(Flux、Qwen-Image 和 Wan2.1)上测试了生成图像和视频的效果。
- 速度:它使 AI 的速度提高了2 到 3 倍。例如,一张原本需要 12 秒生成的图像,现在大约只需 4 秒。
- 质量:因为 VDE 是基于当前输入(汽车此刻实际行驶的道路)而非旧有的静态地图来计算运动的,所以生成的图像看起来与缓慢生成的高质量版本几乎一模一样。
- 对比:其他仅仅“复用”旧部分的方法往往会导致图像模糊或破碎(比如被拉伸的脸部或融化的纹理)。VDE 则能保持细节清晰。
一句话总结
该论文声称,通过将 AI 的运动分解为“可预测的向前部分”和“稳定的侧向部分”,我们可以阻止 AI 进行不必要的繁重计算。AI 不再盲目地复制旧工作,而是利用智能、轻量级的数学来猜测下一步,从而能够在极短的时间内生成高质量的图像和视频。
技术摘要:VDE——基于速度分解与估计的免训练整流流模型加速方法
1. 问题陈述
整流流(Rectified Flow, RF)模型在图像、视频和 3D 生成领域已取得最先进(SOTA)的性能。然而,其实际部署受到高推理延迟的阻碍,因为它们通常需要数十次迭代采样步骤。
现有的免训练加速方法主要依赖于“缓存与复用”(cache-and-reuse)范式。这些方法存储前一步骤的中间特征(例如注意力输出、残差),并复用它们以跳过冗余计算。作者指出了该策略的一个根本缺陷:缓存 - 输入不匹配(cache-input mismatch)。由于缓存的特征是静态的,而模型输入在采样轨迹中动态演变,复用过时的特征会导致输出与输入不匹配。这种不匹配会传播误差,导致视觉保真度下降,例如纹理模糊和结构不一致。
2. 方法论:速度分解与估计(VDE)
本文提出了速度分解与估计(Velocity Decomposition and Estimation, VDE),这是一种免训练方法,将加速范式从“缓存与复用”转变为“分解与估计”(decomposing-and-estimating)。VDE 不再复用静态特征,而是构建一个轻量级估计函数,直接从当前输入预测模型的速度。
核心机制
该方法基于以下观察:当相对于当前潜在输入 xt 进行分解时,模型预测的速度向量 vt 表现出稳健的时间规律性。
速度分解:
速度 vt 被唯一地分解为两个分量:
- 与输入 xt 对齐的平行分量。
- 垂直于 xt 的正交分量。
数学上,这表示为:
vt=αtxt+βt∥xt∥ut
其中:
- αt 和 βt 是标量系数。
- ut 是表示正交方向的单位向量(ut⊥xt)。
时间规律性(实证发现):
通过广泛分析,作者观察到在采样的“稳定阶段”(初始预热之后)存在两种稳定模式:
- 可预测的系数:标量系数 αt 和 βt 随时间平滑演变,在连续步骤之间表现出强烈的局部线性。这使得它们可以通过最近历史值的线性外推进行可靠估计。
- 稳定的正交方向:单位向量 ut 在短时间间隔内保持几乎恒定(余弦相似度 >0.99)。这允许复用最近的正交方向而不会产生显著误差。
VDE 算法:
VDE 以锚定与估计(anchor-and-estimate)模式运行:
- 锚定步骤:在周期性间隔(例如每 n 步),执行一次完整的模型前向传播。对速度进行分解以获得真实值元组 (αt,βt,ut)。
- 估计步骤:在锚定步骤之间的步骤中,无需模型计算即可估计速度:
- 系数(α^t,β^t):基于最近两个锚定步骤的系数,通过线性外推进行估计。
- 方向(u^t):从最近的锚定步骤复用。
- 合成:使用当前输入 xt 和估计的分量,通过解析方式重构估计的速度 v^t:
v^t=α^txt+β^t∥xt∥u^t
这种方法本质上是输入自适应的,因为估计的输出是直接从当前输入 xt 重新构建的,消除了对过时特征的依赖。
3. 主要贡献
- 问题识别:本文确定了“缓存 - 输入不匹配”是现有基于缓存的加速方法中保真度损失的根源,并将免训练加速重新定义为输入 - 输出映射估计问题。
- 新范式:引入了 VDE,用动态分解与估计取代静态特征复用。这从根本上消除了由过时缓存引起的输出 - 输入不匹配。
- 实证发现:作者证明,将速度分解为平行和正交分量揭示了强大的时间规律性(系数的局部线性和方向的稳定性),从而实现了精确且低成本的估计。
- 性能:大量实验表明,VDE 实现了显著的加速(2.04 倍至 3.22 倍),同时视觉质量损失极小,优于 TeaCache 和 EasyCache 等最先进基线。
4. 实验结果
作者在图像生成模型(FLUX.1 [dev]、Qwen-Image)和视频生成模型(Wan2.1)上评估了 VDE。
- 图像生成(FLUX.1):
- VDE-fast 实现了 3.01 倍加速(16 次 NFE),同时将 SSIM 从 EasyCache-fast 的 0.7240 提升至 0.8267,并将 LPIPS 从 0.3197 降低至 0.1997。
- VDE-slow 实现了 2.21 倍加速,其视觉质量与 T=50 基线几乎相同,在 SSIM 和 PSNR 方面分别比最佳基线(EasyCache-slow)高出 19.5% 和 30.3%。
- 图像生成(Qwen-Image):
- VDE-slow 实现了 2.04 倍加速,LPIPS 为 0.069,相比最佳基线误差降低了 52.2%。
- 其 ImageReward 得分与完整的 T=50 基线(1.295)相匹配,表明具有高感知保真度。
- 视频生成(Wan2.1):
- VDE 实现了 2.50 倍加速(40 次 NFE),同时保持 VBench 得分为 80.43,与原始模型(81.30)相当,并优于其他加速方法。
- 定性分析:视觉比较表明,虽然缓存方法经常表现出纹理退化和结构不一致,但 VDE 保留了与 T=50 基线相当的全球构图和精细细节(形状、阴影)。
5. 意义与主张
本文声称,VDE 为加速生成模型提供了新视角。通过从特征复用转向动态估计,它有效缓解了困扰当前免训练方法的缓存 - 输入不匹配问题。
作者强调 VDE 具有以下特点:
- 免训练:不需要额外数据或优化周期。
- 输入自适应:基于当前输入状态构建输出,确保高保真度。
- 可扩展:在不同分辨率、长宽比和模型架构(基于 DiT 的图像和视频模型)上具有良好的泛化能力。
- 高效:分解与估计仅涉及简单的算术运算,与跳过前向传播所节省的计算量相比,其带来的计算开销微乎其微。
该工作得出结论:VDE 提供了更优越的速度 - 保真度权衡,使得高质量的整流流模型能够在实时或计算受限的场景中实际部署。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。