DARTree: Speculative Diffusion Decoding with Autoregressive Draft Trees
DARTree 是一种无需训练的投机解码方法,它将自回归修正从线性链扩展到固定宽度的候选树,通过将自回归头推理与顺序操作解耦以最大化 Token 接受率,实现了最先进的无损加速。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图为一个非常聪明但极其缓慢的机器人朋友写一个故事。这个机器人对理解世界有着非凡的天赋,也能写出精彩绝伦的句子,但它有一个严格的规则:它一次只能写一个词。在写下一个词之前,它必须停下来,思考目前为止所写的所有内容,然后仔细挑选出那一个最完美的词。这就像一位厨师在决定往汤里加什么之前,必须先品尝每一种食材一样。虽然这确保了汤的味道完美无瑕,但烹饪一顿大餐却需要花费极长的时间。在人工智能的世界里,这种“一次一个词”的过程被称为自回归生成(autoregressive generation),这也是为什么强大的 AI 聊天机器人有时会让人感觉反应迟钝的主要原因。
为了在不破坏质量的前提下提高速度,科学家们发明了一个技巧,叫做投机采样(Speculative Decoding)。把这想象成雇佣了一位充满活力且手脚麻利的实习生,来猜测接下来可能出现的几个词。实习生大声喊出一个完整的句子,然后那个缓慢的机器人快速检查实习生的猜测是否正确。如果实习生猜对了,机器人就会立即接受整个句子并继续下一步;如果实习生犯了错,机器人就只需修正那一个词,然后重新开始。其中的奥妙在于,当实习生足够优秀,能够连续正确地猜中许多词时,慢速机器人就可以跳过那些繁琐的思考过程,直接对一整块文本说:“没错,就是这样!”
最近,研究人员尝试使用一种不同类型的“大脑”——扩散模型(Diffusion Model),让这位实习生变得更快。与其一个词一个词地猜测,不如让实习生一次性构思出整个句子,就像画家用一笔勾勒出整个画布一样。这种方式非常快,但它有一个缺陷:因为实习生是同时猜测整个句子的,所以它并不真正了解第一个词是如何影响第二个词的,或者第二个词又是如何影响第三个词的。这就像是在没看中间剧情的情况下,就试图猜出电影的结局。为了解决这个问题,其他研究人员增加了一个“修正”步骤,但他们的方法仍然既慢又笨拙,迫使机器人必须逐个单词地检查实习生的工作,这反而抵消了追求速度的初衷。
这正是来自 MBZUAI VILA 实验室的一篇新论文所提出的巧妙解决方案——DARTree。研究人员意识到,旧的检查实习生工作的方式就像是在整理图书馆时,捡起一本书,检查它的位置,放回去,再捡起下一本书,如此循环往复。这太费劲了。相反,DARTree 建议采用一种构建“树”的可能性新方法。想象一下,实习生不仅仅是猜测一条词语路径,而是画出一棵由各种故事可能性组成的茂密树丛。然后,慢速机器人会观察整棵树,但带有一个特别的转折:它会以大组(批处理)的形式检查树的“分支”,而不是一个一个地检查。
其核心创新在于将“猜测”与“检查”分离。首先,它一次性构建一棵包含许多可能故事路径的宽阔临时树。然后,它使用一种智能修剪工具切掉那些看起来没前途的分支,只留下最好的那棵树展示给慢速机器人。通过以大批量处理的方式进行繁重的路径检查工作,它们避免了以往那种缓慢的、步进式的行走。论文显示,这种方法取得了巨大的成功。在涉及数学问题、编程任务和聊天对话的各种测试中,DARTree 在每一轮检查中平均能接受多达 12.97 个 token(词或词的一部分)。这是一个巨大的飞跃;它比之前的一个顶尖竞争对手 DFlash 高出了 98.6%,比另一个名为 Domino 的方法高出了 27.9%。
其结果是一个既极其快速又完全准确的系统。研究人员测量出,这种新方法可以让 AI 比标准写法快上 9.73 倍,且不会损失任何质量或编造虚假事实。他们在不同的 AI 模型上进行了测试,发现无论 AI 是表现得非常严谨逻辑(如数学)还是富有创意和随机性(如聊天),该方法都表现出色。论文认为,这种“树状”方法——即在做出最终裁剪之前并行检查许多路径——是加速这些聪明机器人的最佳途径。它证明了你并不需要在速度和智慧之间做选择;有了正确的结构,你可以两者兼得。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。