✨ 要点🔬 技术摘要
想象一下,你正试图绘制一幅巨大的、高分辨率的壁画,但你被迫遵循一条非常严格且陈旧的规则:你一次只能画一个点,并且必须按照完美的“蛇形”路径移动。 你完成第一行的从左到右,然后跳到第二行的末尾,向左移动,再跳到第三行的末尾,以此类推。
这就是目前的 AI 图像生成器(称为“自回归模型”)的工作方式。它们将图像视为一个长长的、扁平的单词列表。尽管图像本质上是一个二维网格(上下、左右),但它们将其拉平为一维线段。这使得过程极其缓慢,因为 AI 为了决定下一个单点 的颜色,就必须加载其整个“大脑”(数十亿个参数)。这就像为了买一个苹果跑去一次超市,然后回家,再为了下一个苹果又跑一次超市一样。
问题:“内存墙” (The Memory Wall)
论文称之为**“内存墙”**。AI 大部分时间都花在将大脑加载到内存中以做出微小的决策上,而不是在进行真正的思考。因为它在生成一张图片时必须重复这个过程数千次,所以生成一张图片需要很长时间。
解决方案:SSD(空间推测解码)
作者引入了一种名为 SSD 的新方法。他们意识到图像实际上并不是一维列表,而是二维网格。如果你知道一个点看起来是什么样的,你通常可以很容易地猜出它正下方 的点看起来会是什么样,就像你可以猜出它右边的点一样。
以下是 SSD 如何改变游戏规则的说明,使用了几个类比:
1. “猜谜游戏”类比
旧方式 (1D): AI 猜下一个点,检查是否正确,然后猜下一个。这是一个缓慢、循序渐进的接力赛。
SSD 方式 (2D): AI 像是一个猜谜小组。当一个人在猜右侧 的下一个点时,另一个人同时在猜正下方 的点。他们不会等待第一个猜测完成才开始第二个。他们一次性猜出一整块区域的点。
2. “草拟”类比 把 AI 想象成一个作家。
标准 AI: 写一个词,停下来,查字典,再写下一个词。
SSD: 一次性写出一个完整的句子(甚至是一个段落)作为“草稿”。然后,它会快速浏览这个草稿,看是否合理。如果某个词稍微有点偏差,它只修正那个词,而不会重写整个段落。
3. “自动纠错”的转折 论文提到了一个聪明的技巧。通常,如果一个 AI 猜测了一块标记(点)且其中一个错了,它会丢弃整个区块并重新开始。SSD 则更聪明。它将“错误”的猜测视为粗略的草稿。它进行快速检查(验证),并在原地修复特定的错误,而不必丢弃整个区块。这就像一个能即时修复拼写错误,而不是让你重写整页内容的拼写检查器。
结果:加速壁画绘制
论文在三种强大的 AI 模型上测试了该方法。结果非常显著:
速度: 他们使图像生成速度提升了高达 13 倍 。
例子: 一个原本需要 339 秒 (近 6 分钟)才能生成图像的模型,现在仅需 25 秒 。
质量: 尽管速度如此之快,生成的图像质量与慢速版本一样出色。这些“猜测”足够准确,因此最终的画面没有丢失任何细节。
即插即用: 这种方法不需要重建 AI 的大脑。它就像为现有的汽车引擎添加了一个涡轮增压器。你可以根据需要开启或关闭它,开启后,汽车的运行方式与之前完全一致。
总结
论文认为,通过尊重图像自然的 2D 形状 (上下和左右)而不是强行将其变为 1D 线段 ,我们可以打破“内存墙”。通过一次猜测多个点并在运行中修复小错误,SSD 将一个缓慢的、步进式的过程转变为一个快速的、并行的过程,使高质量的 AI 艺术生成变得近乎即时。
技术摘要:空间推测解码 (Spatially Speculative Decoding, SSD)
1. 问题陈述
自回归模型通过将图像视为离散标记(tokens)的 1D 序列,借鉴了语言建模的方式,在视觉生成领域取得了显著成功。然而,这种方法引入了一个几何折衷 :它将图像固有的 2D 空间局部性强行压平为线性的光栅扫描序列。
这种压平过程造成了严重的计算瓶颈 ,通常被称为“内存墙”。生成一张 n × n n \times n n × n 的图像需要 n 2 n^2 n 2 次顺序前向传播。由于每次前向传播都必须重新加载整套 Transformer 参数来预测单个标记,该过程受到内存带宽而非计算能力的严重限制。
现有的加速技术,如标准的推测解码(Speculative Decoding)和基于 Jacobi 迭代的方法,试图将自然语言处理(NLP)的方法引入视觉领域。然而,这些方法仍然受限于 1D 顺序假设 。由于视觉补丁(patches)具有高局部熵且缺乏严格的语法,沿着被压平的 1D 视界预测多个标记会导致较低的草案接受率。因此,这些方法仅能提供有限的加速(1.8 倍至 3.7 倍),或者通过强制执行不自然的独立性假设来降低图像质量。
2. 方法论:空间推测解码 (SSD)
作者提出了空间推测解码 (SSD) 框架,该框架使预测目标与图像自然的 2D 几何结构保持一致。SSD 不仅仅预测 1D 序列中紧接着的下一个标记,而是同时预测相邻的水平标记和正下方的垂直标记。
核心机制
2D 空间预期 (2D Spatial Anticipation):
SSD 将 2D 预期分解为两个正交的 1D 预测流:水平方向(沿光栅扫描)和垂直方向(沿列向下)。
模型使用轻量级头部在水平方向上起草整行,然后并行地在垂直方向上起草后续行。
该方法利用了一个观察结果:尽管在压平的序列中存在巨大的偏移,但一个标记对其正上方标记的依赖程度与其对左侧紧邻标记的依赖程度同样强。
复杂度降低: 通过并行起草整个空间块,SSD 将 n × n n \times n n × n 图像的理论推理复杂度从 O ( n 2 ) O(n^2) O ( n 2 ) 降低到 O ( n ) O(n) O ( n ) 。
连续潜空间预测 (Continuous Latent Space Prediction):
直接预测离散标记 ID 非常困难,因为在大规模码本(codebooks)上的概率分布较为平坦,导致接受率极低(<5%)。
SSD 转而预测最后一个 Transformer 层中的连续潜特征 (具体为最终 RMSNorm 之前的隐藏状态)。
一个轻量级预测器 f ϕ f_\phi f ϕ 接收隐藏状态和标记嵌入作为输入,以预测特定空间偏移处的隐藏状态。
随后通过基础模型的现有输出层对预测的隐藏状态进行解码,从而获得候选标记。
作为自动纠错的验证 (Verification as Auto-Correction):
不同于标准推测解码在遇到第一个不匹配时就拒绝整个块,SSD 将验证视为一种自我纠正机制。
由于草案构成了连贯的空间块,微小的表示差异可以在局部得到解决。
被拒绝的标记不会被丢弃;相反,系统会从残差分布 中采样,以便在同一次前向传播中修复它们。
该过程会重复进行 r r r 轮,其中被拒绝的位置会被更新,且 KV 缓存会回滚以进行重新评估,每块仅需 r + 1 r+1 r + 1 次前向传播而非顺序再生。
模块化 (Modularity):
SSD 是一个即插即用模块 。它不需要对预训练的主干网络进行任何修改。
仅需通过自我蒸馏(self-distillation)训练轻量级的起草头部,从而保持极低的 FLOPs 开销。
3. 主要贡献
几何对齐: 论文证明了尊重底层 2D 几何结构可以释放巨大的计算效率,超越了 1D 顺序解码这一“计算昂贵的人工产物”。
潜空间起草: 引入连续潜特征预测,显著提高了视觉领域相比于离散标记预测的起草准确度。
自动纠错验证: 一种新型验证策略,能够并行修复被拒绝的标记而非直接丢弃,从而保留了空间起草的优势。
即插即用加速: 该框架可以在不重新训练大规模主干模型的情况下加速生成,适用于任何产生离散视觉标记的统一自回归模型。
4. 实验结果
作者在三个最先进的自回归模型上评估了 SSD:Janus-Pro-7B 、Lumina-mGPT-7B 和 Emu3-8B ,并使用了 DPG-Bench 和 GenEval 基准测试。
加速比: 与标准自回归推理相比,SSD 实现了高达 13.3× 的实际运行时间(wall-clock)加速。
Emu3-8B: 339s → \to → 25.5s (13.27× 加速)。
Lumina-mGPT-7B: 91.6s → \to → 7.5s (12.19× 加速)。
Janus-Pro-7B: 7.8s → \to → 1.4s (5.74× 加速)。
质量: 该方法保持了高保真度,其在 DPG-Bench 和 GenEval 上的生成质量指标与基准自回归模型相当,并且显著优于 1D-MTP 基准(后者经历了严重的质量下降)。
对比:
1D-MTP: 实现了约 2.0–2.4× 的加速,但导致了显著的质量下降(例如,Emu3 的整体得分从 78.69 降至 53.11)。
SJD (基于 Jacobi): 保留了质量,但加速效果仅限于 1.5–2.9×。
SSD: 在保持质量的同时实现了最高的加速比。
5. 意义与主张
论文声称,当前自回归视觉生成的低效并非模型本身固有的局限性,而是继承自语言建模的 1D 顺序假设 所致。通过放弃这一假设并使解码过程与图像的内在 2D 几何结构 相匹配,SSD 克服了内存墙。
作者断言,这种几何转向为实时、高分辨率的自回归生成模型 铺平了道路。结果表明,尊重视觉局部性可以在不损害视觉与语言在单一主干网络中统一性的前提下,实现巨大的计算节省。该方法被呈现为一种通用解决方案,可以应用于现有的统一模型,使其在推理速度方面具备竞争力。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。