DBLAST: Dependent Block Drafting for Stochastic Speculative Decoding
本文介绍了 DBLAST,一种具有面向接受目标训练函数的依赖块草拟器,它克服了随机投机采样中独立块采样的局限性,从而显著提高了接受草稿长度,特别是在高熵机制下。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图猜出朋友正在讲述的故事中的下一个词。如果你只是随机猜测,你可能会猜对,但检查每一种可能性会耗费很长时间。现在,想象你有一个超级快、微小的助手,它可以一次性喊出一整句猜测。你的朋友(主脑)然后快速检查这些猜测是否合理。如果合理,你就跳过这一步;如果不合理,你就再试一次。这就是“投机采样”(speculative decoding)的魔力,它是让巨大的 AI 大脑思考得更快的技巧。通常,助手一个接一个地猜测单词,或者假设这些单词彼此并不依赖,从而一次性猜测出一整块单词。但问题在于:当故事变得富有创意、混乱或不可预测时(比如写诗或荒诞冒险),那些“独立”的猜测往往会失效,因为单词之间确实存在相互依赖关系。助手猜出了一个符合开头的词,但随后它猜出的下一个词却与第一个词不匹配,导致整个词块被拒绝。这篇论文深入探讨了为什么会发生这种情况,以及如何修复它,以便让助手能够处理狂野、富有创意的故事而不减速。
这项研究背后的研究人员来自华为,他们注意到目前的 AI 助手工作方式存在一个特定的问题。他们发现,当主 AI 被要求发挥创意——使用“随机采样”(stochastic sampling)来生成多样化的结尾时——旧的猜测词块的方法就会失效。这就像是一群人试图猜测一个秘密代码,而每个人都在独立地喊出一个数字。如果这个代码要求数字遵循特定的模式(比如“全是偶数”),那么独立的猜测几乎总是会失败,因为他们彼此之间没有沟通。论文表明,随着目标 AI 变得更加不可预测(熵值更高),被接受的猜测数量会显著下降,因为那些“独立”的词块起草者无法捕捉到词块之间隐藏的联系。
为了解决这个问题,团队引入了一种名为 DBLast(依赖型块起草,Dependent Block Drafting)的新方法。DBLast 不再像对待无关单词那样去猜测一个词块,而是使用了一个巧妙的“潜在混合”(latent mixture)系统。可以这样理解:在助手开始起草词块之前,它会从一个小菜单中秘密选择一个“主题”或“模式”(比如“悬疑”、“喜剧”或“悲伤”)。一旦选定了这个主题,词块中的所有单词都会为了符合这个特定主题而生成。这在词块内部创造了一个连贯的故事,尽管这些单词仍然是在单次、快速的生成过程中完成的。这就像是一个群体在随机喊出单词,与一群人先达成共情、确定了一个类型,然后一起即兴表演一场戏之间的区别。
论文还改变了助手的训练方式。他们不再仅仅教它如何“正确”(匹配下一个词的概率),而是教它如何被“接受”。他们创建了一个新的训练目标,奖励那些能让主 AI 更有可能保留下来的猜测词块的助手。这就像训练一名篮球运动员,不仅要教他如何投篮,还要教他如何以一种让裁判判定进球有效的方式进行投篮。通过将这种“基于主题”的猜测与“侧重接受度”的训练相结合,新的 DBLast 方法始终优于旧的独立方法。
在实验中,研究人员在 Qwen3-4B 和 Qwen3-8B 模型上进行了测试,涵盖了数学、编程和创意写作等各种任务。他们发现 DBLast 始终能提高被接受的 Token 数量,尤其是在要求 AI 发挥创意的时候。在最不可预测的高熵设置下,新方法使较大模型的平均接受长度提升了 12.1%。论文指出,这种方法是让 AI 在需要进行创意表达时变得更快、更高效的关键缺失环节,证明了让“团队”在说话前先就一个主题达成一致,远比每个人都各喊各的独立想法要好得多。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。