← 最新论文
💻 computer science

SSD: Spatially Speculative Decoding Accelerates Autoregressive Image Generation

该论文介绍了空间投机解码(Spatially Speculative Decoding, SSD),这是一个利用图像固有的二维空间相关性来同时预测多个标记的框架,从而在保持高保真度的同时,将自回归图像生成速度提升了高达 13.3 倍。

原作者: Shilong Xiang, Zirui Zhang, Lijun Yu, Chengzhi Mao

发布于 2026-06-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Shilong Xiang, Zirui Zhang, Lijun Yu, Chengzhi Mao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图绘制一幅巨大的、高分辨率的壁画,但你被迫遵循一条非常严格且陈旧的规则:你一次只能画一个点,并且必须按照完美的“蛇形”路径移动。 你完成第一行的从左到右,然后跳到第二行的末尾,向左移动,再跳到第三行的末尾,以此类推。

这就是目前的 AI 图像生成器(称为“自回归模型”)的工作方式。它们将图像视为一个长长的、扁平的单词列表。尽管图像本质上是一个二维网格(上下、左右),但它们将其拉平为一维线段。这使得过程极其缓慢,因为 AI 为了决定下一个单点的颜色,就必须加载其整个“大脑”(数十亿个参数)。这就像为了买一个苹果跑去一次超市,然后回家,再为了下一个苹果又跑一次超市一样。

问题:“内存墙” (The Memory Wall)

论文称之为**“内存墙”**。AI 大部分时间都花在将大脑加载到内存中以做出微小的决策上,而不是在进行真正的思考。因为它在生成一张图片时必须重复这个过程数千次,所以生成一张图片需要很长时间。

解决方案:SSD(空间推测解码)

作者引入了一种名为 SSD 的新方法。他们意识到图像实际上并不是一维列表,而是二维网格。如果你知道一个点看起来是什么样的,你通常可以很容易地猜出它正下方的点看起来会是什么样,就像你可以猜出它右边的点一样。

以下是 SSD 如何改变游戏规则的说明,使用了几个类比:

1. “猜谜游戏”类比

  • 旧方式 (1D): AI 猜下一个点,检查是否正确,然后猜下一个。这是一个缓慢、循序渐进的接力赛。
  • SSD 方式 (2D): AI 像是一个猜谜小组。当一个人在猜右侧的下一个点时,另一个人同时在猜正下方的点。他们不会等待第一个猜测完成才开始第二个。他们一次性猜出一整块区域的点。

2. “草拟”类比
把 AI 想象成一个作家。

  • 标准 AI: 写一个词,停下来,查字典,再写下一个词。
  • SSD: 一次性写出一个完整的句子(甚至是一个段落)作为“草稿”。然后,它会快速浏览这个草稿,看是否合理。如果某个词稍微有点偏差,它只修正那个词,而不会重写整个段落。

3. “自动纠错”的转折
论文提到了一个聪明的技巧。通常,如果一个 AI 猜测了一块标记(点)且其中一个错了,它会丢弃整个区块并重新开始。SSD 则更聪明。它将“错误”的猜测视为粗略的草稿。它进行快速检查(验证),并在原地修复特定的错误,而不必丢弃整个区块。这就像一个能即时修复拼写错误,而不是让你重写整页内容的拼写检查器。

结果:加速壁画绘制

论文在三种强大的 AI 模型上测试了该方法。结果非常显著:

  • 速度: 他们使图像生成速度提升了高达 13 倍
    • 例子: 一个原本需要 339 秒(近 6 分钟)才能生成图像的模型,现在仅需 25 秒
  • 质量: 尽管速度如此之快,生成的图像质量与慢速版本一样出色。这些“猜测”足够准确,因此最终的画面没有丢失任何细节。
  • 即插即用: 这种方法不需要重建 AI 的大脑。它就像为现有的汽车引擎添加了一个涡轮增压器。你可以根据需要开启或关闭它,开启后,汽车的运行方式与之前完全一致。

总结

论文认为,通过尊重图像自然的 2D 形状(上下和左右)而不是强行将其变为 1D 线段,我们可以打破“内存墙”。通过一次猜测多个点并在运行中修复小错误,SSD 将一个缓慢的、步进式的过程转变为一个快速的、并行的过程,使高质量的 AI 艺术生成变得近乎即时。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →