DFlare: Scaling Up Draft Capacity for Block Diffusion Speculative Decoding
DFlare 通过一种轻量级的逐层融合机制克服了以往块扩散方法的表达能力限制,从而实现更深、更强大的草稿模型,在多种基准测试中实现了显著的加速,进而加速了 LLM 推理。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图写一个长篇故事,但你是一个非常缓慢、追求完美的作家(目标模型)。每当你想要写下一个词时,你都必须进行深入思考,检查语法,并确保它完美契合。这需要耗费大量时间。
为了提高效率,你雇佣了一位快速且充满活力的助手(草稿模型)。这位助手尝试为你预测接下来的几个词。如果助手的猜测是正确的,你就只需说“是的,继续!”然后快速推进。如果助手错了,你就必须停下来,纠正他们,然后重新开始。这被称为投机采样(Speculative Decoding)。
问题:“一刀切”的助手
最近,一种名为 DFlash 的新方法试图让助手变得更强。DFlash 的助手不再是一个词一个词地猜测,而是尝试一次猜测一整块词(比如一次直接猜出下一句话)。
然而,DFlash 有一个重大缺陷。它给助手提供了一个源自主作家大脑的单一、通用的“小抄”。
- 缺陷: 想象一下,助手的思维有 7 层(就像建筑里的 7 层楼)。DFlash 给第 1 层、第 4 层和第 7 层都提供了完全相同的“小抄”。
- 结果: 助手感到困惑了。低层楼需要简单的语法规则,而高层楼则需要复杂的故事情节。因为它们都得到了相同的通用信息,助手的智能无法通过增加楼层来提升。它遇到了一个“天花板”,即增加更多层级也无济于事。
解决方案:DFLARE
该论文的作者创造了 DFLARE。可以将 DFLARE 理解为升级了助手的训练系统,让每一层楼都能获得一份定制化的“小抄”。
以下是 DFLARE 的工作原理,使用简单的类比:
1. 定制化小抄(逐层融合/Layer-wise Fusion)
在 DFLARE 中,系统不再给每一层楼提供相同的通用小抄,而是为每一层创建一个独特的、融合的信息。
- 类比: 想象主作家(目标模型)有一个图书馆。
- DFlash 从图书馆里拿出一页纸,复印了 7 份,然后分发给每一层楼。
- DFLARE 则观察图书馆并说:“第 1 层需要关于语法的页面,第 4 层需要关于情节转折的页面,第 7 层需要关于角色情感的页面。”它混合不同页面的内容,为每个特定的楼层创建一份独特且完美的指南。
- 优势: 因为每一层都有专门的指南,助手可以通过增加楼层变得更加聪明。这个“天花板”被打破了。
2. 分开的笔记本(异构 KV 投影/Heterogeneous KV Projections)
助手需要存储两种类型的笔记:它自己的猜测以及来自主作家的信息。
- 类比: 在旧系统中,助手试图将自己的猜测和主作家的笔记写在同一个笔记本里。墨水混在一起,导致难以阅读。
- DFLARE 的修复方案: 它给了助手两个独立的笔记本。一个是用于记录它自己的疯狂猜测,另一个则严格用于记录主作家的笔记。这保持了信息的清晰和易用。
3. 分阶段学习(渐进式损失/Progressive Loss)
当助手学习时,它不应该试图立即掌握故事中最难的部分。
- 类比: 想象一位老师在给学生评分。
- 旧方法: 老师从第一天起,就对第一个简单的句子和最后一个难的句子给予同样的重视。学生感到压力过大。
- DFLARE 的方法: 老师首先专注于前几个简单的句子以建立信心。随着学生变得更好,老师再慢慢开始对这一块结尾处较难的句子进行评分。这种“热身”方法有助于助手学习得更快、更有效。
结果:有多快?
论文在三个不同的“主作家”(AI 模型)上测试了这个新系统,发现 DFLARE 比之前的最佳方法(DFlash)快得多。
- 在中型作家上 (Qwen3-4B): 它快了 5.52 倍。
- 在大型作家上 (Qwen3-8B): 它快了 5.46 倍。
- 在超大型作家上 (GPT-OSS-20B): 它快了 3.91 倍。
简单来说,如果旧方法写一段话需要 10 秒,DFLARE 大约只需 2 秒就能完成,同时依然能写出同样高质量的故事。
总结
DFLARE 就像是通过为助手的每一个部分提供一份专门定制的指南,而不是通用的指南,从而升级了一个快速的助手。这使得助手可以变得更大、更聪明,从而大幅提升 AI 编写文本、代码或解决数学问题的速度。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。