← 最新论文
💻 computer science

Continuous Speculative Decoding for Autoregressive Image Generation

本文介绍了连续投机解码(CSpD),这是一种针对连续视觉自回归模型的创新加速框架,它通过去噪轨迹对齐和接受-拒绝采样,克服了分布失配和复杂的积分挑战,在保持图像生成质量的同时实现了超过 2 倍的推理加速。

原作者: Zili Wang, Zheng Zhang, Kun Ding, Qi Yang, Fei Li, Shiming Xiang

发布于 2026-07-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Zili Wang, Zheng Zhang, Kun Ding, Qi Yang, Fei Li, Shiming Xiang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图创作一幅杰作,但你必须一次只能画一小笔,每画一笔都要等油漆干透后才能进行下一步。这就是自回归(Autoregressive, AR)图像生成的工作方式。计算机预测图像的一部分,然后利用这个预测来猜测下一部分,以此类推。这种方式生成的图像质量极高,但由于它无法同时进行多项任务,因此速度极其缓慢。

这篇论文的作者希望在不破坏画作质量的前提下提高速度。他们借鉴了文本生成领域的一个技巧——投机采样(Speculative Decoding),但由于图像是“连续的”(具有平滑的颜色梯度),而非“离散的”(像单词或乐高积木那样),他们不得不从头开始重新设计。

以下是他们实现这一目标的原理,通过简单的类比进行解释:

1. 问题所在:“快速学徒” vs. “缓慢大师”

为了提高速度,研究人员引入了一个草稿模型(Draft Model)(一个快速的小型学徒)和一个目标模型(Target Model)(一个缓慢但更强大的大师)。

  • 旧方法(离散型): 在文本生成中,学徒预测接下来的 5 个单词。大师一次性检查它们。如果大师同意,那就太好了!如果不同意,大师会纠正那个单词。
  • 新挑战(连续型): 在图像生成中,“单词”实际上是连续的数值(比如某种特定的蓝色)。要检查学徒的猜测是否正确,其背后的数学计算要困难得多。
    • 问题 A: 学徒和大师认为的“正确”颜色往往处于完全不同的位置。学徒猜了一个蓝色,但在大师看来简直糟糕透顶。这导致了非常低的“接受率”(大师拒绝了几乎所有内容)。
    • 问题 B: 当大师拒绝一个猜测时,他们需要立即生成一个新的正确猜测。在连续数学的世界里,计算这个“新正确猜测”的公式极其复杂,就像是在尝试解一个没有简洁答案的积分方程。你无法直接写出答案,而是必须运行一个庞大的模拟过程才能得出结果,这完全违背了提速的初衷。

2. 解决方案:“连续投机采样”

团队构建了一个新系统来解决这两个问题。

解决问题 A:“走同样的路径”(去噪轨迹对齐)

想象学徒和大师都在尝试从一座雾气缭绕的山顶(噪声)走向一个清晰的山谷(最终图像)。

  • 没有对齐时: 学徒根据自己的地图走,大师根据自己的地图走。他们最终会到达不同的山谷。大师会说:“那不是我的山谷!”然后拒绝这个猜测。
  • 有了对%,对齐后: 研究人员强制要求学徒和大师在下山过程中使用相同的随机步骤(相同的“噪声”)。即使他们的地图略有不同,但通过在同一时间采取完全相同的步伐,他们最终会到达非常接近的位置。
  • 结果: 因为他们在走同样的路径,学徒的猜测与大师的预期非常接近。大师会更频繁地接受这些猜测。

解决问题 B:“魔法过滤器”(接受-拒绝采样)

当大师确实拒绝一个猜测时,他们需要一个备选方案,以便在不运行缓慢复杂计算的情况下生成新的图像部分。

  • 技巧: 他们并没有尝试去解那个不可能的数学方程来寻找“完美的”新猜测,而是使用了一种**拒绝采样(Rejection Sampling)**技术。
  • 类比: 想象大师拥有一个“魔法过滤器”(数学上的上界)。他们生成一个随机候选值。如果候选值能通过过滤器,他们就保留它;如果撞到了过滤器,他们就把它扔掉并重试。
  • 创新点: 通常情况下,这个过滤器的计算非常困难。但因为前面使用了“走同样的路径”这一技巧,他们找到了一种方法,可以通过简单的数学(只需观察路径的起点和终点)来计算这个过滤器,而无需运行沉重的、缓慢的模拟过程。这使他们能够快速生成有效的替换图像部分。

解决起始阶段:“预填画布”

研究人员注意到,在绘画过程的最开始,学徒非常困惑,会做出错误的猜测。

  • 解决方法: 他们让大师先完美地画出最初的几笔微小的笔触(大约占图像的 5%),然后再让学徒接手。这为整个过程奠定了坚实的基础,使学徒不再是在黑暗中盲目猜测,从而稳定了整个过程。

结果:速度与质量兼得

通过结合这些技巧,该系统生成图像的速度可以提高 2 倍以上(取决于具体设置,有时可达 2.7 倍)。

  • 类比: 这就像拥有一个可以提前预判 5 步的快速学徒。因为大师和学徒现在“走着同样的路径”,且大师拥有快速修正错误的方法,所以学徒的草图大部分时间都能被接受。大师只需要偶尔介入,纠正一条线条或画出最初的几笔。
  • 质量: 至关重要的是,该论文声称,最终生成的图像效果与使用缓慢的“仅大师模式”时完全相同。不仅没有质量损失,反而获得了巨大的速度提升。

总结: 该论文通过使用一个快速学徒来预测前方,强制学徒和大师遵循相同的“舞步”以达成共识,并使用一种巧妙的数学技巧在不减速的情况下即时修复错误,从而将一个缓慢的、步进式的图像生成器提速了一倍以上。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →