← 最新论文
💬 NLP

Accelerating Diffusion Large Language Models with SlowFast Sampling: The Three Golden Principles

本文提出了名为"SlowFast 采样”的新型动态采样策略,通过遵循确定性、收敛性和位置性三大黄金原则并集成缓存机制,使基于扩散的大语言模型在保持高生成质量的同时实现了最高达 34.22 倍的推理加速,其吞吐量甚至超越了 LLaMA3 8B 等强自回归基线模型。

原作者: Qingyan Wei, Yaojie Zhang, Zhiyuan Liu, Puyu Zeng, Yuxuan Wang, Biqing Qi, Dongrui Liu, Linfeng Zhang

发布于 2026-04-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Qingyan Wei, Yaojie Zhang, Zhiyuan Liu, Puyu Zeng, Yuxuan Wang, Biqing Qi, Dongrui Liu, Linfeng Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一种名为 "SlowFast Sampling"(慢快采样) 的新方法,旨在让基于“扩散模型”的大语言模型(dLLMs)说话更快、更聪明。

为了让你轻松理解,我们可以把大语言模型生成文字的过程想象成**“在迷雾中拼凑一幅巨大的拼图”**。

1. 背景:为什么现在的模型说话慢?

  • 传统模型(自回归模型,如 LLaMA): 就像**“单线作业”**。它们必须一个字一个字地写,写完“今天”,才能写“天气”,写完“天气”才能写“不错”。这就像一个人走楼梯,必须一步一步踩上去,虽然稳,但很慢。
  • 扩散模型(dLLMs): 就像**“并行作业”。它们一开始把整句话都涂成“迷雾”(全是乱码),然后试图一次性把迷雾擦掉,露出文字。理论上,它们可以像“多人同时擦窗户”**一样,一次擦掉很多字,速度应该飞快。
  • 问题所在: 现有的扩散模型虽然能并行擦窗,但**“擦窗策略”太死板**。它们不管窗户哪里干净、哪里还是脏的,都按固定的节奏去擦。结果就是:有时候擦得太急,把刚擦干净的又弄脏了(需要反复重来);有时候又太保守,明明可以一次擦一大片,却只敢擦一点点。

2. 核心发现:三个“黄金法则”

作者通过观察发现,模型在“擦窗”(生成文字)的过程中,其实有三个很自然的规律,他们称之为**“三个黄金法则”**:

  1. 确定性法则(Certainty Principle):

    • 比喻: 就像你在迷雾中看拼图,有些拼图片(比如“苹果”、“红色”)非常清晰,你一眼就能认出它是什么,而且你非常有把握它不会变。
    • 含义: 模型对某些字的预测信心很高,这些字一旦确定,后面就不太会改了。
  2. 收敛法则(Convergence Principle):

    • 比喻: 就像你刚把拼图的一块放上去时,手可能会抖,位置会微调几次。但过一会儿,这块拼图就**“稳”**了,不再乱动。
    • 含义: 随着生成过程的进行,很多字的预测结果会迅速稳定下来,不再需要反复修改。
  3. 位置法则(Positional Principle):

    • 比喻: 拼图不是随机变清晰的。通常是**“连成一片”**的。比如,一旦你认出了“今天”,紧接着的“天气”、“不错”也会很快变清晰,形成一块清晰的区域。
    • 含义: 清晰的字往往扎堆出现,而不是东一个西一个。

3. 解决方案:SlowFast Sampling(慢快采样)

基于这三个法则,作者设计了一套**“先慢后快、张弛有度”的策略,就像一位经验丰富的“老练的装修工”**:

第一阶段:慢速探索(Slow Phase / 探路)

  • 做什么: 模型先**“小心翼翼”**地走几步。它不急着把整句话都写出来,而是先试探性地擦掉几个最有把握的字(比如主语、动词)。
  • 目的: 就像装修工先拿手电筒照一下,确认哪块区域是安全的、稳定的。它会观察:“哦,原来‘今天’和‘天气’这两个词已经稳了,而且它们连在一起。”
  • 关键点: 只有当模型发现某一片区域的字都**“稳如泰山”**(不再乱跳)时,才进入下一阶段。

第二阶段:快速加速(Fast Phase / 冲刺)

  • 做什么: 一旦确认了那片区域是安全的,模型就**“大干快上”。它利用“位置法则”**,把这一整块清晰区域里的字,一次性全部擦完、全部定下来
  • 目的: 既然这片区域已经稳了,就没必要一个字一个字地磨蹭了,直接批量生成,速度瞬间起飞。
  • 缓存技巧: 对于那些还没看清的远处区域,模型会先“记个笔记”(缓存),等下次再处理,避免重复劳动。

4. 效果如何?(惊人的速度提升)

论文通过大量实验证明,这套方法非常有效:

  • 速度暴涨: 在著名的 GPQA 科学问答测试中,使用这种方法,模型的速度提升了 15.63 倍!如果再加上“缓存”技术,速度甚至能提升 34.22 倍
  • 质量不掉: 虽然速度快了这么多,但回答的准确率几乎没有下降(甚至有时候还更好了)。
  • 吊打传统模型: 最酷的是,优化后的扩散模型(LLaDA),其生成速度(每秒生成的字数)竟然超过了目前最火的传统模型 LLaMA3 8B。这意味着,扩散模型不再是“慢吞吞”的代名词,它真的可以既快又好。

总结

这篇论文的核心思想就是:不要盲目地快,也不要无脑地慢。

以前的扩散模型像是一个**“只会匀速跑步的人”,不管前面是平地还是悬崖,都按一个速度跑。
现在的 SlowFast Sampling 像是一个
“聪明的老司机”**:

  • 在路况不明时(探索期),慢速观察,确认安全。
  • 一旦确认前方是坦途(稳定区),就猛踩油门,全速通过。

这种**“该慢则慢,该快则快”**的动态策略,让 AI 写文章的速度实现了质的飞跃,让未来的 AI 应用变得更加流畅和高效。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →