← 最新论文
💬 NLP

TreeWY: Speculative Verification for Gated DeltaNet Hybrids

TreeWY 引入了一种树状结构的 WY 变换,该变换消除了在 Gated DeltaNet 混合模型的投机解码过程中对每个节点进行循环状态快照的需求,从而显著降低了内存压力并提高了吞吐量,或者在不牺牲接受长度的情况下实现更宽的草图树。

原作者: Sneha Murthy Ghantasala

发布于 2026-08-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Sneha Murthy Ghantasala

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在现代人工智能领域,大型语言模型充当着逐个单词生成文本的强大引擎。为了实现这一点,它们必须记住目前为止写下的所有内容,以确保下一个单词符合语境。多年来,处理这种记忆最常见的方法是保留一个不断增长的列表,记录每一个先前的单词及其相关数据,这种方法效果很好,但随着对话变长,需要消耗大量的计算机内存。最近,新一代模型出现了,它们将这种传统方法与一种更紧凑的不同方法相结合。这些混合模型使用一种特殊的层,将整个历史记录总结为一个单一的、固定大小的快照,而不是一个不断增长的列表。这使得它们在处理标准的阅读和写作任务时极其高效,能够运行在较小的计算机上。然而,这种效率在尝试使用一种称为“投机采样”(speculative decoding)的技术来加速过程时,产生了一个新问题。

投机采样是一种用于提高这些人工智能模型速度的策略。与其逐个单词生成,不如由一个较小、较廉价的“草拟”模型预先猜测后续的几个单词,然后由主模型一次性检查这些猜测是否正确。如果主模型能够验证一段很长的猜测序列,它就可以在单步中输出多个单词,从而显著提高速度。问题在于前面提到的这些混合模型。由于它们的记忆是一个单一的、固定大小的快照,无法轻易地进行切割或粘贴,目前的系统必须为草拟模型猜测的每一个单词都制作一个完整的快照副本。如果草拟模型猜测了一长串单词,系统必须为每一次猜测都存储一个内存副本。这会迅速填满计算机内存,迫使系统停止进行长序列猜测,并限制了速度的提升。这是一个瓶颈,阻碍了这些高效模型达到其理论上的运行速度。

由 Sneha Murthy Ghantasala 领导的汤森路透(Thomson Reuters)研究人员开发了一种名为 TreeWY 的新方法,以解决这个特定的内存瓶颈。他们的工作专注于被称为 Qwen3.5 的混合模型家族,这些模型旨在实现高效,但在面对投机采样的内存需求时却显得力不从心。团队意识到,这些模型更新记忆的方式遵循一种特定的数学模式,这种模式是可以被重新排列的。他们发现,与其为每一次猜测都保存一个完整的内存状态副本,不如通过一种单一的、精简的数学运算来一次性计算出所有猜测的结果。这种运算将猜测序列视为一个结构化的树,而非一系列独立的快照,从而实现信息的共享和高效计算。

他们的核心发现是,他们不再需要为每个草拟标记(token)存储完整的内存状态。在旧方法中,如果模型猜测了十个单词,它必须保存十个完整版本的内存,这消耗了巨大的空间。通过 TreeWY,系统仅保存一份关于猜测阶段所做更改的微小、压缩后的摘要。它执行一次计算即可同时验证所有猜测。如果某个猜测被接受,系统会根据这个微小的摘要重建正确的内存状态。如果某个猜测被拒绝,系统只需丢弃该摘要,而无需存储那个沉重的完整内存状态。这种方法消除了此前让长链条猜测变得不可能实现的巨大内存开销。

研究人员在两种规模的 Qwen3.5 模型(一个 350 亿参数版本和一个规模大得多的 3970 亿参数版本)上进行了测试,并在高端显卡上运行。他们将这种新的 TreeWY 方法与流行 AI 软件中使用的标准方法进行了对比。结果显示,当计算机内存承受巨大压力时,新方法允许系统同时处理更多的请求。在某些情况下,文本生成的速度提高了近百分之五十,且开始生成响应的时间大幅下降。这是因为释放出的内存空间使得系统可以在不崩溃或减速的情况下,同时运行更多的活跃对话。

然而,研究也发现,其收益在很大程度上取决于可用内存的大小。当计算机有充足的剩余内存时,新方法的表现比标准方法略慢,会损失一点点速度。这是因为这种新的计算方式虽然节省了内存,但执行起来比简单的复制数据要多花一点时间。研究人员指出,真正的优势在于系统处于内存受限的情况时,这在大型模型应用中是非常普遍的情况。在这种场景下,能够同时运行更多对话的能力远比那一点点计算成本更重要。

团队还探索了该方法是否能支持更具野心的猜测策略,例如一种“树”结构,即模型可以同时猜测多条不同的路径,而不仅仅是单一的单词行。新方法通过保持内存占用量不随猜测树的宽度增加而变化,使这成为了可能。以前,一个宽阔的猜测树会由于需要过多的内存而无法运行。现在,系统可以负担得起尝试许多不同路径的代价。虽然这并没有立即为测试中的模型带来巨大的速度提升,但它证明了该方法具有足够的灵活性,可以处理以往无法负担的复杂、宽阔的猜测结构。

研究人员强调,他们的解决方案是针对这些混合模型所遵循的数学规则而设计的。它并不依赖于模型设计的具体细节,而是基于内存更新的基本方式。这意味着该方法有可能应用于使用类似内存结构的其它模型。这项工作已在用于运行 AI 模型的广泛使用的软件框架中实现,研究人员证实,新方法产生的结果在数学上与标准方法完全一致,确保了文本质量保持不变。

最终,这项研究表明,通过重新思考在猜测阶段如何处理内存,可以释放高效混合模型的全部速度潜力。研究显示,限制因素不在于模型本身,而在于软件管理其内存的方式。通过从存储完整快照转向计算共享摘要,研究人员将内存瓶颈转化为了通往更高性能的路径。这使得这些高效模型能够运行得更快,并服务更多的用户,特别是在计算机内存最为紧张的情况下。研究结果表明,未来人工智能速度的提升不仅来自于构建更大的模型,更来自于更聪明地管理它们已有的数据。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →