← 最新论文
💬 NLP

Structuring The Future: Diffusion LLM Speculative Decoding via Calibrated Draft Graphs

本文介绍了 Spiffy,这是一种通过利用经过校准且动态剪枝的有向草图图(directed draft graphs)来加速扩散大语言模型(Diffusion LLM)推理的投机解码算法,旨在显著降低模型推理次数和令牌生成率,同时在理论上证明其能够保持原始输出分布。

原作者: Sudhanshu Agrawal, Risheek Garrepalli, Raghavv Goel, Christopher Lott, Fatih Porikli, Mingu Lee

发布于 2026-06-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Sudhanshu Agrawal, Risheek Garrepalli, Raghavv Goel, Christopher Lott, Fatih Porikli, Mingu Lee

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你正在尝试解决一个巨大且复杂的拼图。

旧方法(自回归模型):
大多数当前的 AI 模型就像一个非常细心、缓慢的拼图解题者。他们放下一块拼图,检查是否契合,然后再放下一块,再次检查,以此类推。他们一次只能处理一块拼图。即使他们非常聪明,也被困在“一次一步”的节奏中,这使得他们很慢。

新方法(扩散模型):
最近,一种被称为“扩散大语言模型(Diffusion LLM)”的新型 AI 出现了。把这种模型想象成一位画家,他可以同时观察整幅画布。与其一笔一笔地画,他能看到整个画面,并且理论上可以同时修复许多部分。这具有极大的速度潜力。

问题所在:
然而在实践中,这些“画家”表现得过于谨慎了。为了确保画面完美无缺,他们目前被限制为一次只能修复一个微小的点。他们拥有画完一整面墙的超能力,却表现得像是在画一个点。这浪费了他们的速度潜力。

解决方案:Spiffy
这篇论文介绍了一种名为 Spiffy(用于提高扩散大语言模型效率的投机采样)的新方法。它是一种帮助这些谨慎的画家在不破坏画面的前提下工作得更快的方法。

以下是 Spiffy 的工作原理,使用了以下类比:

1. “自动驾驶”猜谜游戏

通常,为了提速,你可能会雇佣第二位更小、更快的画家(“草稿模型”)来猜测接下来的几块拼图应该是什么样子。主画家随后会检查这些猜测是否正确。

  • 代价: 雇佣第二位画家需要花费训练成本和时间。
  • Spiffy 的妙招: Spiffy 并不雇佣第二位画家。相反,它要求主画家在工作时猜测自己的未来步骤。这就像画家在工作时停顿片刻并说:“如果我修复了这个点,我打赌我可以立即同时修复旁边的这三个点。”

2. 可能性的“流程图”(草稿图)

在旧有的“一次一个零件”的世界里,猜测通常是呈直线进行的(就像单列纵队的人群)。

  • Spiffy 的创新: 因为扩散模型可以观察全局(双向性),Spiffy 将其猜测组织成一个流程图(称为“有向草稿图”)。
  • 类比: 想象一本“选择你自己的冒险”类书籍。Spiffy 不仅仅是猜测下一句话,它同时规划出几种可能的路径。
    • 路径 A:“猫坐在垫子上。”
    • 路径 B:“猫坐在地毯上。”
    • 路径 C:“狗坐在垫子上。”
      Spiffy 将这些路径设置在特定的结构中,以利用模型能够同时向前和向后观察的能力。

3. “校准”(训练地图)

在画家开始真正的任务之前,Spiffy 会利用一小组示例进行一次快速、一次性的练习运行。

  • 类比: 这就像教练观察球员练习几次,然后画出该球员最可能采取的动作的具体地图。这张地图经过“校准”,是最有效的路线。
  • 结果: 这张地图是离线创建一次的,并用于每一个任务。它不会在实际工作中拖慢速度。

4. “剪枝”(切断死胡同)

有时,流程图可能会变得过于庞大且混乱。

  • 类比: Spiffy 扮演着一名聪明的园丁。当画家工作时,Spiffy 会观察流程图的分支。如果某个分支看起来不太可能是正确的路径,Spiffy 会立即将其切断。这让过程保持快速,并专注于最有希望的猜测。

结果

通过使用这种方法,Spiffy 让扩散模型得以实现“跳跃式”前进。与其用 100 步完成一个句子,它可能只需用 100 步来验证同时进行的 10 步。

论文的研究发现:

  • 速度: 他们在几个开源 AI 模型(如 LLaDA、Dream 和 SDAR)上进行了测试。
  • 效率: 他们减少了模型需要“思考”(执行计算)的次数,最高达 8.6 倍
  • 输出速度: 实际生成单词(token)的速率提高了高达 6.3 倍
  • 准确性: 至关重要的是,尽管速度提升了,但回答的质量保持完全一致。模型并没有因为移动得更快而开始犯错。

总结:
Spiffy 是一个聪明的技巧,它让扩散 AI 模型能够利用其观察全局的天赋。它不再是一步一步地移动,而是利用预先计算好的可能未来步骤的地图来向前跳跃,瞬间验证这些跳跃,从而在不损失任何质量的前提下更快地完成工作。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →