← 最新论文
💻 computer science

VDE: Training-Free Accelerating Rectified Flow Model via Velocity Decomposition and Estimation

本文介绍了 VDE,一种无需训练的整流流模型加速方法,它通过分解和估计速度分量而非复用静态缓存特征来提升推理速度,从而在视觉质量损失极小的情况下实现显著加速。

原作者: Junwen Tan, Jinglin Liang, Hongyuan Chen, Shuangping Huang

发布于 2026-05-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Junwen Tan, Jinglin Liang, Hongyuan Chen, Shuangping Huang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试绘制一幅复杂的画面,比如一条熙熙攘攘的城市街道,但你必须一笔一画地慢慢完成。为了获得完美的结果,你可能需要走 50 步,在每一笔之后都检查作品并调整颜料。这非常耗时。

现代 AI 图像和视频生成器(称为整流流模型)正是这样工作的。它们是才华横溢的艺术家,但速度很慢,因为它们需要走很多微小的步骤来生成图像。

这篇论文介绍了一种名为**VDE(速度分解与估计)**的新技巧,它能让这些 AI 艺术家在不妨碍画作质量的前提下工作得更快。以下是其工作原理,使用简单的类比来说明:

旧方法:“冻结的蓝图”

以前的方法试图通过缓存(保存)上一步的绘图部分并直接复用来加速。

  • 类比:想象你正走在一条小路上。旧方法说:“我只需复制 10 秒前所在位置的地图,并假设路径没有变化。”
  • 问题:世界是动态的。如果你转过一个弯,或者景色发生了变化,那张旧地图就错了。AI 试图复用不再适合当前画面的旧特征,导致纹理模糊或出现奇怪的扭曲。这就像试图穿一件昨天还合身的衣服;今天可能就不合身了。

新方法(VDE):“智能导航员”

作者们意识到,与其复制旧地图,AI 实际上可以通过将其运动分解为两个简单的部分来预测下一步的去向。

将 AI 的运动(其“速度”)想象成一辆在公路上行驶的汽车。VDE 将这种运动分解为两个分量:

  1. “向前”的推力(平行分量):这是汽车直线前进的程度。

    • 发现:论文发现,这种“向前推力”的变化非常平滑且可预测。就像汽车加速一样;如果你知道过去两秒的速度,就可以用简单的数学(比如画一条直线)轻松猜出下一秒的速度。
    • 技巧:VDE 不需要重新计算整个引擎,而是基于最后几步进行快速的数学估算。
  2. “侧向”的漂移(正交分量):这是汽车为了保持在车道内而进行的细微左右调整。

    • 发现:论文发现,在短时间段内,这种“侧向漂移”几乎完全不发生变化。就像汽车的方向盘在几秒钟内保持在完全相同的位置一样。
    • 技巧:VDE 只需在几步中复用这个“侧向”方向,而无需重新计算。

VDE 在实际中如何运作

VDE 采用了一种“检查与估算”的策略:

  1. 锚点(检查):每隔几步,AI 进行一次完整、缓慢的计算,以获取完美、真实的数据。这就像司机停下来查看 GPS 并确认前方的道路。
  2. 估算(捷径):在中间的步骤中,AI 不进行繁重的计算。相反,它利用“向前”的数学估算和“侧向”的复用来即时确定下一步。
  3. 结果:AI 跳过繁重的工作,速度比之前快 2 到 3 倍。

为什么它更好

该论文在三种不同的 AI 模型(Flux、Qwen-Image 和 Wan2.1)上测试了生成图像和视频的效果。

  • 速度:它使 AI 的速度提高了2 到 3 倍。例如,一张原本需要 12 秒生成的图像,现在大约只需 4 秒。
  • 质量:因为 VDE 是基于当前输入(汽车此刻实际行驶的道路)而非旧有的静态地图来计算运动的,所以生成的图像看起来与缓慢生成的高质量版本几乎一模一样。
  • 对比:其他仅仅“复用”旧部分的方法往往会导致图像模糊或破碎(比如被拉伸的脸部或融化的纹理)。VDE 则能保持细节清晰。

一句话总结

该论文声称,通过将 AI 的运动分解为“可预测的向前部分”和“稳定的侧向部分”,我们可以阻止 AI 进行不必要的繁重计算。AI 不再盲目地复制旧工作,而是利用智能、轻量级的数学来猜测下一步,从而能够在极短的时间内生成高质量的图像和视频。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →