← 最新论文
🤖 machine learning

Set Diffusion: Interpolating Token Orderings Between Autoregression and Diffusion for Fast and Flexible Decoding

本文介绍了 Set Diffusion,这是一种新型语言模型,它将灵活的任意阶(arbitrary-order)标记集生成与 KV 缓存支持相结合,从而实现比现有的自回归和块扩散方法更快的推理速度以及更优越的速度-质量权衡。

原作者: Marianne Arriola, Volodymyr Kuleshov

发布于 2026-07-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Marianne Arriola, Volodymyr Kuleshov

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是使用简单语言和创意类比对《Set Diffusion》论文进行的解释。

大局观:关于“顺序”的问题

想象你正在尝试写一个故事或解决一道数学题。你主要有两种方式可以做到:

  1. 严谨的作家(自回归/Autoregression): 你一次只写一个词,严格地从左到右。在完成开头之前,你无法写出结尾。这种方式质量很高且准确,但速度很慢,因为你无法同时进行多项工作。
  2. 混沌的艺术家(标准扩散/Standard Diffusion): 你从满篇乱码(噪声)开始,并试图一次性修复所有内容。你可以同时预测许多单词,所以速度很快,但很难保持逻辑连贯。此外,你很难轻松地“记住”之前写了什么来辅助接下来的写作,因此每次做出修改时,你都必须重新阅读整页内容。

问题所在: 之前尝试将这两者结合的方法(称为“块扩散/Block Diffusion”)就像是在以僵硬的块状进行写作。你可以一次写一个句子而不是一个词,但你仍然必须在移动到下一块之前完成整个句子。如果你想修改故事中间的一个词,你必须等待整个块完成后才能进行。

解决方案:Set Diffusion

作者引入了 Set Diffusion。不要把它看作是在一条线上写作,而要把它看作是 用灵活的碎片填充拼图。

不再被强迫逐词写作(太慢),也不再是按块写作(太僵硬),Set Diffusion 允许你选择 任何一组单词 作为下一步生成的对象,只要你遵循一套特定的规则。

“滑动窗口”类比

想象你正在绘制一幅长卷壁画。

  • 旧方法(块扩散/Block Diffusion): 你画完 4 英尺的部分,等它完全干透,然后再移动到下一个 4 英尺的部分。在完成整个块之前,你无法再次触碰第一个部分。
  • 新方法(Set Diffusion): 你有一个“滑动窗口”式的油漆刷。你可以画前 4 英尺,但随后你可以将窗口向后滑动,同时绘制第 2、3、4 英尺以及第 5、6、7 英尺的部分。你甚至可以在绘制边缘的同时,跳回中间某个位置进行修补。

核心特性简易说明

1. 灵活的“标记集”(Token Sets,即拼图碎片)
在这个模型中,“标记(token)”就是一个单词或一段代码。

  • 创新点: 模型不仅仅是预测下一个词,它是在预测一个集合(set)
  • 神奇之处: 你可以告诉模型,“预测接下来的 3 个词”,或者“预测位置 5 和位置 10 的词”。它可以处理不同大小和不同顺序的组合。这使得它既快速(同时预测多个内容),又聪明(能够追踪顺序)。

2. “记忆库”(KV 缓存/KV Caching)
在 AI 领域,“KV 缓存”就像是一个便签本,模型将它已经生成的内容记录在上面,这样它就不必每次都重新计算。

  • 旧问题: 在标准扩散模型中,模型每次进行预测时都必须重新阅读整个文本。这就像为了记住主角的名字而不得不把整本书读一遍。
  • 新方案: Set Diffusion 在每一步之后都会更新它的“便签本”。一旦它预测出一组单词,就会立即将它们存入记忆。这使得它极其迅速,既拥有严谨作家的逻辑,又具备混沌艺术家的速度。

3. “滑动窗口”策略
论文引入了一种特定的选择下一个预测词的方法,称为 滑动窗口(Sliding-Window) 方法。

  • 想象一个在舞台上移动的聚光灯。这个聚光灯可以覆盖一个演员,也可以同时覆盖三个演员。
  • 模型利用这个聚光灯来决定:“我现在要生成聚光灯范围内的单词。”
  • 通过调整聚光灯的大小,你可以控制速度(大聚光灯,一次预测多个词)与准确度(小聚光灯,减少预测数量以求更谨慎)之间的平衡。

他们证明了什么?

作者在三个主要任务上测试了这种新方法:

  1. 数学推理: 解决数学应用题(例如 GSM8K 数据集)。
  2. 摘要生成: 将长篇文章浓缩为短摘要。
  3. 填空(Infilling): 填充故事中缺失的部分(类似于“填词游戏/Mad Libs”)。

结果:

  • 速度 vs. 质量: Set Diffusion 找到了以往模型错过的“甜点位(sweet spot)”。它比僵硬的块模型更快,比混沌的扩散模型更准确。
  • 填空任务: 它在填充故事缺失部分方面明显优于之前的“块扩散(Block Diffusion)”方法。
  • 灵活性: 它可以生成任何长度和任何顺序的文本,这对于编辑文档或修改文件中间的代码至关重要。

总结隐喻

如果说 自回归(Autoregression) 是一场 接力赛(一名跑者将接力棒传给下一位,严格遵守顺序),而 标准扩散(Standard Diffusion) 是一场 自由竞争(所有人同时奔跑,但场面混乱),那么 Set Diffusion 就是一支 配合默契的舞团

舞者们(标记/tokens)可以成组(集合)移动。他们可以从左向右移动,也可以跳跃式地填补空白,但由于有了共享记忆(KV 缓存),他们始终清楚谁在身边以及之前的动作是什么。这使得他们能比接力队更快、更灵活地完成复杂的编舞(如数学、故事),同时又不会像自由竞争那样混乱。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →