← 最新论文
🤖 machine learning

Trees from Marginals: Autoregressive drafting with factorized priors

本文介绍了 Weaver,一种轻量级自回归适配器,它通过从分解的草稿边际分布中重建条件依赖关系,以实现高效的基于树的投机解码,并通过一种新颖的无回退验证算法和优化的 CUDA 内核,实现了相比标准自回归解码 4.37 倍的加速。

原作者: Yuma Oda, Ryan Mathieu, Roman Knyazhitskiy, Artur Chakhvadze

发布于 2026-07-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Yuma Oda, Ryan Mathieu, Roman Knyazhitskiy, Artur Chakhvadze

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图写一个故事,主角是一位非常聪明但动作缓慢的图书管理员(即 AI 模型)。每当你向他询问故事的下一个词时,图书管理员都必须停下来,苦苦思索,查阅他那庞大的整座图书馆,然后向你低声耳语出下一个词。这就是当前 AI 的工作方式:一次一个词,一步一个词。 它很准确,但很慢。

这篇论文介绍了一种让这位图书管理员变得更快且不失准确性的新方法。他们称之为 “来自边缘分布的树”(或 DFlash-TfM)。以下是其工作原理的拆解,采用了简单的类比。

问题:“猜谜游戏”的限制

为了提高速度,研究人员发明了一个技巧,叫做 投机采样(Speculative Decoding)

  • 旧方法: 一个快速的初级助手(“草拟者”)猜测接下来的几个词。然后,缓慢的图书管理员(“验证者”)检查这些猜测是否正确。如果正确,图书管理员会一次性接受所有猜测。如果不正确,图书管理员会修正错误并重新开始。
  • “因子化”草拟者的缺陷: 一些助手之所以超级快,是因为它们会一次性猜测接下来的所有单词,而忽略了这些词之间的相互联系。这就像一位厨师在还没品尝前一个食材的情况下,就直接猜出了汤里的下三个食材。
    • 代价是: 随着猜测列表变长,厨师的猜测准确度会下降。第一个猜测可能是对的,但第三个通常是错的,因为它没有考虑到前两个词。这限制了每次可以被接受的单词数量。

解决方案:“编织者”助手

作者创造了一个结合了快速厨师的速度与谨慎编辑逻辑的新系统。他们将这个新编辑器称为 Weaver(编织者)

  1. “Top-K”候选名单: 首先,快速助手(DFlash)进行快速、粗略的猜测,并为下一个位置提供一份包含 512 个最可能单词的候选名单。这就像一位厨师说:“我觉得下一个食材很可能就在这 512 种香料之中。”
  2. 编织者的任务: 编织者不再盲目猜测,而是观察这份候选名单。它扮演着一位聪明的编辑角色,会说:“好吧,如果第一个词是‘盐’,那么下一个词几乎肯定是‘胡椒’,而不是‘糖’。”
  3. 构建树结构: 编织者不仅仅是做出一条直线式的猜测。它构建了一棵
    • 想象一棵家谱树。根部是当前的句子。
    • 编织者向外分支,创造出故事的不同可能路径(例如,“猫坐在垫子上” vs “猫坐在地板上”)。
    • 因为编织者规模很小,且仅观察快速助手提供的候选名单,所以它构建这棵可能性之树的速度极快。

验证:检查这棵树

现在,缓慢的图书管理员需要检查这棵猜测树。

  • 旧有的问题: 如果图书管理员使用标准的“循环”记忆系统(例如现代 AI 中的 Gated Delta Net 层),检查一棵树通常是一场噩梦。这就像试图通过逐一走遍树上的每一条分叉来查看哪条路径是真实的。这非常缓慢。
  • 新的窍门: 作者发明了一种特殊的数学捷径(一种“无回溯”算法)。
    • 他们没有逐一走遍每个分支,而是使用了一种 掩码三角求解(masked triangular solve)。你可以把它想象成一张神奇的地图,让你能同时观察整个树状结构,并瞬间知道哪条路径是正确的,而无需为每一个分支都重新计算记忆状态。
    • 这就像拥有一个 GPS,它能瞬间在复杂的地图上标出正确的路线,而不需要你先去开遍每一条死胡同。

结果:速度与效率

通过结合这些想法,该系统实现了两大胜利:

  1. 接受更多的单词: 因为编织者修正了快速助手的逻辑错误,图书管理员接受的单词链变得更长(比之前的最佳方法多出高达 77%)。
  2. 巨大的加速: 整个过程极其高效,AI 生成文本的速度比标准慢速方法快了 4.37 倍。它还比之前的“最快”方法提升了约 25%。

总结类比

  • 标准 AI: 一只正在写故事的蜗牛,一次写一个字母,并对照字典检查每一个字母。
  • 旧的快速方法: 一个速读员试图猜出整个段落,但因为没注意到开头,经常把中间的部分猜错。
  • 这种新方法(Weaver): 一个速读员快速挑选出 500 个可能合适的词,然后由一位微型且超级聪明的编辑(编织者)将这些词瞬间排列成逻辑严密的树状句子。随后,一个特殊的“神奇地图”(新的内核)会瞬间检查整棵树,以确定哪条路径才是真实的。

结果是,这种 AI 既拥有速读员般的写作速度,又具备细心编辑般的准确度,使交互过程感觉更加即时且响应迅速。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →