想象一下,你正试图教一个机器人去创作杰作或导演电影。在人工智能的世界里,这是通过“扩散”(diffusion)或“流”(flow)模型实现的。可以将这些模型想象成艺术家,他们从一张布满静态噪声的画布开始——就像电视调到没有信号时的雪花点一样——然后通过一步步缓慢地清理,直到出现清晰的图像或视频。问题在于,这个清理过程极其缓慢。为了获得高质量的结果,机器人可能需要进行数百个微小的步骤,并在每一步都检查其工作。这就像试图通过每次只走一毫米来穿过房间;你能到达目的地,但那会耗费太长时间。
为了加速这一过程,科学家们一直试图教会这些机器人采取更大的跨步。一些方法尝试通过一次巨大的跳跃来猜测最终目的地,而另一些方法则尝试学习机器人应该遵循的“路径”,以便它可以跳过那些枯燥的中间部分。然而,目前最先进的视频处理方法非常棘手。它们通常依赖于复杂且不稳定的训练技巧,这可能会让机器人忘记如何移动,导致生成的视频看起来虽然精美,却像是被冻结在了时间里,或者陷入重复、乏味的模式中。大问题在于:我们能否教会这些模型既能快速移动又保持平滑,同时又不丢失其创造力的魔力?
本文介绍了一种名为**并行解码蒸馏(Parallel Decoding Distillation, PDD)**的新技术,它就像是这些 AI 艺术家的超级高效教练。PDD 不再强迫机器人一步一个脚印地走,而是教会它通过一眼就能预测出整个步骤序列。想象一下你在走廊里行走。普通的机器人会在每一扇门前停下,检查门是否开着,然后再走向下一扇门。而 PDD 则会看向整个走廊,预测接下来的十步路脚下的地面感觉会是如何,然后自信地大步向前,一次性跨越整段距离。
作者发现,通过训练模型一次性预测一段时长的“平均速度”(或速度),他们可以让模型仅用 4 到 8 个步骤(称为函数评估次数,或 NFE)就能生成高质量的图像和视频,而通常则需要数百步。这是一个巨大的提速。与以往那些试图强迫机器人遵循固定路径或使用容易破坏模型多样性的复杂数学方法不同,PDD 使用了一种更简单、更直接的方法。它不需要计算复杂的导数或使用对抗博弈(即两个 AI 通过互相竞争来提升自我),而后者已知会导致“模式崩溃(mode collapse)”——这是一个高级说法,意指 AI 会陷入反复制作同样内容的死循环。
研究表明,这种方法在大规模模型上表现得极其出色,包括生成文本到视频和文本到图像内容的模型。例如,在 Wan2.1 视频模型上,PDD 生成的 4 NFE 视频不仅速度更快,而且比其他顶尖方法更具多样性和动态感。在针对 LTX-2.3 模型(该模型可生成带有音频的 10 秒视频)的测试中,PDD 仅用 8 NFE 就达到了一个需要 4 × 30 NFE(总计 120 步)的教师模型的质量水平。结果表明,PDD 是让 AI 生成变得更快且不牺牲视频生命力所需的动态感和多样性的一个稳健方法。这标志着一个重要的进步,证明了你并不需要通过一百万个微小的步骤来获得伟大的结果;有时,你只需要学会如何预见整条路径。
技术摘要:用于快速图像与视频生成的并行解码蒸馏
1. 问题陈述
大规模扩散(Diffusion)和流匹配(Flow Matching)模型已在文本生成图像、文本生成视频以及多模态生成领域取得了最先进(SOTA)的成果。然而,其固有的迭代采样过程需要数百次网络评估(NFE),这造成了显著的计算成本和延迟。这一瓶颈阻碍了实时视频生成、内容编辑和交互式世界建模等应用的发展。
现有的加速方法大致分为两类:
- 基于轨迹的方法(Trajectory-based methods): 这些方法将教师模型的顺序采样过程蒸馏到更少的步数中。虽然对图像生成有效,但在应用于视频模型时,往往会导致视频质量下降,或者需要高昂的训练算法(例如雅可比向量积 JVP 或有限差分法)。
- 基于分布的方法(Distribution-based methods): 这些方法旨在对齐学生模型与教师模型的边缘分布,而非遵循特定的轨迹。虽然在视频蒸馏领域占据主导地位(例如使用变分分数蒸馏 VSD 或对抗损失),但它们面临模式崩溃(Mode Collapse)的问题,导致视频多样性丧失和运动静止。此外,这类方法通常需要交替的训练目标,并且对超参数非常敏感。
本文确定了一种可扩展的、基于轨迹的蒸馏方法的需求,该方法应能避免基于分布方法的优化难题(模式崩溃)以及现有基于轨迹方法的计算开销(JVP、有限差分),特别是在针对高分辨率视频生成时。
2. 方法论:并行解码蒸馏 (PDD)
作者引入了并行解码蒸馏 (Parallel Decoding Distillation, PDD),这是一个旨在加速扩散和流匹配模型推理的轨迹式蒸馏框架。
核心概念
不同于将多个去噪步骤合并为一个大步的传统方法,PDD 学习一个并行解码器,能够在单次网络评估中预测连续多个时间间隔的平均速度。
- 离散化: 将时间域 [0,1] 离散化为 N 个间隔。这些间隔被分组为大小为 L 的块(Blocks)。
- 并行预测: 给定时刻 tn 的状态 Xn,并行解码器 uˉθ 同时预测块 {n,…,n+L−1} 内所有 L 个间隔的平均速度:
uˉθ(n∣Xn)≈uk(Xk),k=n,…,n+L−1
其中 uk 是第 k 个间隔的平均速度。
- 采样: 在推理过程中,模型通过预测的速度一次推进 L 个间隔,从而将总 NFE 减少至 N/L。通过在训练期间改变块大小 L,该模型支持在推理时进行可变的 NFE 采样,而无需额外的时刻条件(Time Conditioning)。
训练目标
PDD 采用了一种简化的、基于回归的训练目标,避免了使用 VSD、对抗损失、JVP 或有限差分。
- 教师近似: 目标平均速度使用应用于预训练教师模型的龙格-库塔(Runge-Kutta)求解器(欧拉或中点法)进行近似。
- 在策略训练(On-Policy Training): 损失函数在学生模型自身的输出上计算(On-policy)。学生模型预测速度,在块内模拟轨迹,然后通过将学生在采样步骤 k 处预测的速度与该状态下教师的近似平均速度进行比较来计算损失。
- 损失函数:
LPD(θ)=E[∥uˉθ(n∣Xn)−uk(sg(Xˉk))∥2]
其中 sg 表示停止梯度算子,Xˉk 是通过遵循学生预测的速度所到达的状态。
架构
- 骨干网络(Backbone): PDD 使用与预训练教师模型完全相同的骨干架构。
- 输出层: 通过重复通道维度 N 次(N 为网格大小)来扩展最终的线性层。这使得模型能够输出对应于每个时间步的 N 个不同的速度预测。
- 层融合(Layer Fusion): 在生成过程中,模型不是应用 L 个独立的线性层,而是将权重融合为一个单一的线性层,以输出该块的加权平均速度。这确保了与教师模型的单步评估相比,不会产生额外的计算成本。
无数据训练(Data-Free Training)
对于无法获取数据的规模化模型,PDD 支持一种无数据训练方案。模型采样初始噪声,并在求解器步骤(使用学生自身的预测推进状态)与训练步骤之间交替进行,从而有效地从其自身生成的轨迹中学习。
3. 主要贡献
- 提出了 PDD 形式化定义: 一种可扩展的、基于轨迹的蒸馏方法,它能在单次评估中预测多个间隔的平均速度,从而实现流匹配和扩散模型的快速推理。
- 简化的训练: 一种单一的基于回归的训练目标,消除了对 JVP、有限差分、多阶段训练、VSD 或 GAN 损失的需求,同时仍能产生高质量且多样化的样本。
- 灵活的架构: 一种与任何预训练模型兼容的设计,支持在推理时进行可变的 NFE 采样,且不需要额外的时刻条件或第二个时间坐标。
- 实验验证: 在 ImageNet-256、Qwen-Image (Text-to-Image)、Wan2.1 (Text-to-Video 1.3B/14B) 和 LTX-2.3 (Text-to-Video/Audio) 上展示了 SOTA 性能,并在生成多样性方面较基于分布的基线方法有显著提升。
4. 实验结果
作者在三项任务中评估了 PDD:
5. 重要性与主张
论文声称 PDD 是首个能够实现高分辨率、少步数视频生成的纯轨迹式蒸馏方法,并提升了多样性。
- 克服模式崩溃: 通过坚持基于轨迹的方法而不依赖于基于分布的损失(VSD/GAN),PDD 避免了当前视频蒸馏方法中常见的模式崩溃和运动缺失问题。
- 计算效率: 该方法消除了对昂贵的 JVP 和有限差分的需求,使其能够扩展到大型模型(高达 22B 参数),并兼容无数据训练。
- 灵活性: 通过选择块大小来实现推理时可变 NFE 的能力,为多样化的应用场景提供了实际优势。
- 运动与多样性: 作者强调,PDD 不仅加速了生成,还保留了教师模型输出的“丰富性”,特别是关于运动动力学和样本多样性,这对于视频生成至关重要。
作者总结道,虽然目前 PDD 仅限于流模型和扩散模型,但并行解码的原理在未来有望推广到离散自回归模型。他们还指出,研究 ImageNet-256 之外的数据依赖型 PDD 仍是一个开放的研究领域。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。