← 最新论文
🤖 machine learning

Parallel Decoding Distillation for Fast Image and Video Generation

本文介绍了并行解码蒸馏(Parallel Decoding Distillation, PDD),这是一种可扩展且简化的基于轨迹的方法,通过在每次网络评估中预测多个去噪步骤来加速图像和视频生成,在仅需 4–8 次函数评估的情况下实现了最先进的性能,并显著提升了视频的多样性,优于现有的蒸馏技术。

原作者: Neta Shaul, Chao Liu, Arash Vahdat, Julius Berner

发布于 2026-07-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Neta Shaul, Chao Liu, Arash Vahdat, Julius Berner

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个机器人去创作杰作或导演电影。在人工智能的世界里,这是通过“扩散”(diffusion)或“流”(flow)模型实现的。可以将这些模型想象成艺术家,他们从一张布满静态噪声的画布开始——就像电视调到没有信号时的雪花点一样——然后通过一步步缓慢地清理,直到出现清晰的图像或视频。问题在于,这个清理过程极其缓慢。为了获得高质量的结果,机器人可能需要进行数百个微小的步骤,并在每一步都检查其工作。这就像试图通过每次只走一毫米来穿过房间;你能到达目的地,但那会耗费太长时间。

为了加速这一过程,科学家们一直试图教会这些机器人采取更大的跨步。一些方法尝试通过一次巨大的跳跃来猜测最终目的地,而另一些方法则尝试学习机器人应该遵循的“路径”,以便它可以跳过那些枯燥的中间部分。然而,目前最先进的视频处理方法非常棘手。它们通常依赖于复杂且不稳定的训练技巧,这可能会让机器人忘记如何移动,导致生成的视频看起来虽然精美,却像是被冻结在了时间里,或者陷入重复、乏味的模式中。大问题在于:我们能否教会这些模型既能快速移动又保持平滑,同时又不丢失其创造力的魔力?

本文介绍了一种名为**并行解码蒸馏(Parallel Decoding Distillation, PDD)**的新技术,它就像是这些 AI 艺术家的超级高效教练。PDD 不再强迫机器人一步一个脚印地走,而是教会它通过一眼就能预测出整个步骤序列。想象一下你在走廊里行走。普通的机器人会在每一扇门前停下,检查门是否开着,然后再走向下一扇门。而 PDD 则会看向整个走廊,预测接下来的十步路脚下的地面感觉会是如何,然后自信地大步向前,一次性跨越整段距离。

作者发现,通过训练模型一次性预测一段时长的“平均速度”(或速度),他们可以让模型仅用 4 到 8 个步骤(称为函数评估次数,或 NFE)就能生成高质量的图像和视频,而通常则需要数百步。这是一个巨大的提速。与以往那些试图强迫机器人遵循固定路径或使用容易破坏模型多样性的复杂数学方法不同,PDD 使用了一种更简单、更直接的方法。它不需要计算复杂的导数或使用对抗博弈(即两个 AI 通过互相竞争来提升自我),而后者已知会导致“模式崩溃(mode collapse)”——这是一个高级说法,意指 AI 会陷入反复制作同样内容的死循环。

研究表明,这种方法在大规模模型上表现得极其出色,包括生成文本到视频和文本到图像内容的模型。例如,在 Wan2.1 视频模型上,PDD 生成的 4 NFE 视频不仅速度更快,而且比其他顶尖方法更具多样性和动态感。在针对 LTX-2.3 模型(该模型可生成带有音频的 10 秒视频)的测试中,PDD 仅用 8 NFE 就达到了一个需要 4 × 30 NFE(总计 120 步)的教师模型的质量水平。结果表明,PDD 是让 AI 生成变得更快且不牺牲视频生命力所需的动态感和多样性的一个稳健方法。这标志着一个重要的进步,证明了你并不需要通过一百万个微小的步骤来获得伟大的结果;有时,你只需要学会如何预见整条路径。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →