技术摘要:SynBoost:一种用于扩散模型快速采样的协同框架
1. 问题陈述
扩散概率模型(DPMs)在视觉生成任务(图像合成、编辑、视频等)中取得了最先进的结果。然而,由于其迭代采样机制通常需要大量的函数评估次数(NFEs),其实际部署受到推理速度慢的阻碍。
现有的加速策略通常分为两类:
- 基于训练的蒸馏: 这些方法减少了步数,但需要复杂的、针对特定模型的蒸馏过程。
- 无需训练的快速采样器: 这些方法(例如 DDIM、DPM-Solver、UniPC)利用高阶求解器来最小化由于使用大步长近似连续积分而产生的离散化误差(discretization error)。
作者指出当前范式中的一个关键局限性:虽然高阶求解器有效地降低了离散化误差,但它们在很大程度上忽略了由神经网络对真实得分函数(score function)的不精确估计所导致的近似误差(approximation error)。这一疏忽表明,当前的优化可能已经达到了平台期,通过解决被忽视的误差成分,仍有进一步加速的空间。
2. 方法论
A. 误差分解与双重误差解耦
本文的核心理论贡献是对总采样误差进行了重新审视。作者将误差分解为两个截然不同的组成部分:
- 离散化误差 (Edis):源于使用离散步长近似连续指数积分。
- 近似误差 (Eapp):源于神经网络无法完美估计真实的得分函数(向量场)。
为了分析这些成分,作者提出了一个双重误差解耦策略:
- 他们在相同的时段 [ti−1,ti] 内构建了三个转换过程:
- 精确过程(Exact):源自原始数据分布(无误差)。
- 仅近似过程(Approximation-only):使用极细粒度的步长(例如 NFE=1000)生成,以最小化离散化误差,从而隔离出近似误差。
- 总误差(Total Error):使用粗略步长(例如 NFE=10)生成,包含两种误差。
- 通过使用均方误差(MSE)比较这些分布,他们在实验中证明了:
- 近似误差的大小与离散化误差相当,并且在大多数时间步长处往往占据主导地位。
- 核心洞察: 近似误差随着时间步 t 的增加(从噪声向数据移动)呈单调递减。这意味着在较大时间步(更接近初始噪声)进行的预测,在得分函数估计方面比在较小时间步进行的预测更为准确。
B. SynBoost 框架
基于“近似误差随 t 增加而减小”这一洞察,作者提出了 SynBoost,这是一个统一的、无需训练的加速框架。它同时解决两种误差来源:
- 减轻离散化误差:SynBoost 无缝结合了现有的高阶 ODE 求解器技术(例如 DDIM、DPM-Solver、UniPC 中使用的泰勒展开)。
- 减轻近似误差:作者引入了一种混合策略,通过部分替换当前的噪声估计,使用来自前一个较大时间步 τ 的更准确的预测。
修改后的噪声估计 ϵθnew 公式如下:
ϵθnew(xti,ti)=(1+c)ϵθ(xti,ti)−cϵθ(xτ,τ)
其中:
- c 是一个混合系数,随着当前步 ti 的减小而单调增加(反映了在近似误差较高时需要更多修正的需求)。
- τ 是一个较大的时间步(τ>ti)。在实践中,作者通常使用初始噪声 xT(其中 τ=T)作为更准确预测的来源,该预测会被缓存且不会产生额外的 NFE。
该策略旨在实现即插即用,兼容各种求解器(DDIM、DPM-Solver、DPM-Solver++、UniPC)和预测模式(噪声预测和数据预测)。
3. 核心贡献
- 误差解耦:论文识别并从实验上分离了“近似误差”作为一个独立且显著的总体采样误差成分,这在以往仅关注离散化的求解器中被忽视了。
- 单调性发现:作者通过实验确立了近似误差随时间步增加而单调递减的规律,为利用过去的(较大时间步)预测来修正当前估计提供了理论依据。
- SynBoost 框架:这是一个无需训练的统一框架,通过融合当前的估计与更准确的历史预测来减少总采样误差。
- 广泛的兼容性:该方法可以集成到现有的高阶求解器中,无需重新训练模型或在每一步增加额外的函数调用。
4. 实验结果
作者通过在涵盖像素空间(ImageNet、LSUN)和潜空间(Stable Diffusion)模型的无条件和有条件生成任务上的广泛实验,验证了 SynBoost。
- 性能指标:使用 FID(Fréchet Inception Distance)和 HPD v2(人类偏好评分)进行评估。
- 主要发现:
- 少步数区间:当 NFE 极其有限(例如 5–10 步)时,SynBoost 显著优于基准采样器(DDIM、DPM-Solver、DPM-Solver++、UniPC)。
- 质量提升:定性结果显示,与基础求解器相比,其结构细节、色彩对比度和减少伪影方面的表现有所提升。
- 兼容性:该方法提升了不同阶数(1 阶至 3 阶)和预测模式下的性能。例如,将 SynBoost 应用于 1 阶 DDIM 可以获得与 2 阶 DPM-Solver++ 相当的结果。
- 鲁棒性:该框架在较高的分类器引导尺度(在此情况下采样器往往变得不稳定)以及 Transformer 架构(DiT)上依然有效。
- 消融实验:敏感性分析确认,采用线性递减的混合系数 c 策略以及使用初始时间步 τ=T 能获得最优结果。
5. 重要性与声明
论文声称 SynBoost 通过解决“未被充分探索”的近似误差,推进了扩散模型的采样效率。作者将这项工作定位为实现扩散模型实际部署的重要一步,特别是在需要极少采样步数的场景下。
作者对其局限性保持了审慎的态度:
- SynBoost 是一种无需训练的方法,在最终的速度和质量方面目前仍落后于基于训练的一步生成方法(如一致性模型/consistency models)。
- 该策略是基于经验驱动并进行了全面分析,尽管论文指出在混合策略的推导过程中并未追求严格的理论严密性,而是依赖于实验证据和来自精确 DDIM 步骤的数学推导。
- 该工作表明,缩小无需训练方法与基于训练方法之间差距的工作仍需未来的努力。
总之,论文认为,通过识别并修正神经网络估计中固有的近似误差,可以在不重新训练底层模型的情况下,大幅提升扩散模型推理的速度和质量。