← 最新论文
💬 NLP

WIDE: Boosting Adaptive LLM Inference via Token-level Dynamic Width Pruning

该论文介绍了 WIDE,这是首个端到端可微框架,通过允许对注意力头和 FFN 通道进行细粒度的选择,并结合专门的算子协同设计,实现了大语言模型(LLM)的 Token 级动态宽度剪枝,从而在保持高准确度的同时显著提升了端到端的推理加速。

原作者: Haozhe Hu, Hao Wu, Peiran Yin, Chao Han, Yunpu Ma, Xiaoyu Shen

发布于 2026-07-31
📖 1 分钟阅读☕ 轻松阅读

原作者: Haozhe Hu, Hao Wu, Peiran Yin, Chao Han, Yunpu Ma, Xiaoyu Shen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图在一个微小的、电池供电的设备上运行一个庞大的、极其聪明的机器人大脑。这个机器人大脑是一个大语言模型(LLM),一种可以写故事、解数学题并像人类一样聊天的 AI 类型。但问题在于,这些大脑太大了。它们如此庞大且渴望能量,以至于通常需要超级计算机才能运行,这使得在你的手机或笔记本电脑上使用它们时既慢又昂oly。

为了解决这个问题,科学家们一直尝试对这些大脑进行“剪枝”(pruning)。把剪枝想象成修剪一株巨大的、过度生长的灌木丛。你剪掉那些没做什么工作的枝条,使植物变得更小、更快。长期以来,最好的方法是永久地剪掉灌木的整个部分,无论这株植物当天正在做什么。但这有点笨拙;有时你会剪掉一根实际上在特定任务中仍有用的枝条,导致机器人变得健忘。最近,一些更聪明的方法被发明了出来,让机器人可以在“思考时”决定使用哪些部分。然而,这些聪明的方法仍然有点粗糙——它们要么使用整个区域,要么完全跳过,就像决定是使用整个房间还是让整个房子空着一样,而不是仅仅点亮几盏特定的灯。

这篇论文介绍了一个名为 WIDE(基于宽度的推理与动态执行)的新系统。它就像是为机器人的大脑中的每一盏灯泡都配备了一个超精密的调光开关。与其关闭整个房间,WIDE 允许机器人针对它处理的每一个单词,精确地决定哪些微小的神经元组(大脑细胞)应该亮起,哪些应该保持黑暗。研究人员构建了一个特殊的“交通控制器”(路由器),它学会了做出这些瞬间的决策。他们还设计了一种新的方式,让计算机硬件能够处理这些决策而不会感到困惑或变慢。结果是,机器人在保持原有智能水平的同时,运行得更快,消耗的能量也更少,即使我们剪掉了它一半的大脑容量。

问题所在:“全或无”的陷阱

想象你是一名经营着大型厨房的厨师。你有数百名厨师(神经元)共同协作烹饪美食。在过去,如果你想节省时间,你可能会永久解雇一半的厨房员工。如果你总是烹饪同样的简单菜肴,这没问题;但如果你突然需要烤一个复杂的蛋糕,你可能已经解雇了唯一需要的面包师。这就是静态剪枝发生的情况:模型的修剪是一次性的,无论它在回答什么具体问题。

后来出现了动态剪枝,这就像聘请了一位经理,他可以告诉厨师们:“嘿,对于这道特定的订单,只需要烤架站即可;烘焙站可以休息了。”这虽然有所进步,但那位经理仍然有点笨拙。他们会说:“跳过整个烘焙站,”即便烘焙站只需要使用十个烤箱中的两个。对于大块的厨房区域来说,这是一个“全或无”的决策。

问题在于,现代 AI 模型如此复杂,跳过一大块区域往往会丢弃有用的信息,从而损害答案的质量。此外,如果经理每秒钟都在不断更改排班表,厨师们就会感到困惑,由于所有的切换开销,实际的烹饪速度并不会变得快多少。

解决方案:WIDE 的“调光开关”

这篇论文的作者(来自宁波数字孪生研究院和慕尼黑大学 LMU)提出了 WIDE。与其解雇整个部门或跳过整个房间,WIDE 让模型可以针对处理的每一个单词(token),精确地决定激活哪些小组神经元。

把模型的脑部想象成一个巨大的灯光开关网格。

  • 旧的动态方法: “关掉房子的整个左翼。”
  • WIDE: “对于这个特定的单词,点亮厨房里的灯,但仅限于炉灶和冰箱上方的那些。让厨房的其他地方保持黑暗。”

WIDE 通过在模型的每一层都连接一个轻量级的“路由器”(一个微型决策者)来实现这一点。这个路由器观察当前的单词并询问:“我需要这一组注意力头(观察其他单词的部分)吗?”以及“我需要这一组 FFN 通道(处理含义的部分)吗?”它做出一个二元选择:使用这一组或跳过它。

至关重要的是,WIDE 不仅仅停留在做出决策,它还解决了硬件方面的难题。通常,如果你告诉计算机跳过计算的随机部分,计算机会在寻找数据位置时变得效率低下。WIDE 使用了一种被称为**掩码重排序(mask reordering)**的巧妙技巧。想象你有一堆乱七八糟的邮件,其中一些是用于投递的信件,而另一些是垃圾邮件。与其先扔掉垃圾再尝试分拣邮件,WIDE 会先将这堆邮件重新排列,使所有“保留”的信件整齐地排在顶部的一个块中,而所有“垃圾”信件则排在底部。这使得计算机可以非常高效地处理“保留”块,而不需要停下来检查每一件邮件。

研究发现:速度与智能

研究人员在流行的 AI 模型(如 Llama 3.1,80 亿参数和 Llama 3.2,30 亿参数)上测试了 WIDE。他们将其与现有的最优秀的静态和动态剪枝方法进行了对比。

以下是数据所反映的情况:

  • 更聪明的剪枝: 当他们剪掉 50% 的模型容量(一种非常激进的修剪)时,WIDE 比其他任何方法都能更好地保持模型的智能。例如,在 Llama 3.1 模型上,WIDE 在剪枝后保留了 86.42% 的原始准确度,而排名第二的动态方法(SkipGPT)仅保留了 59.42%。甚至在没有额外微调的情况下,WIDE 已经超越了最好的静态方法。
  • 现实世界的速度: 论文测量了模型实际运行的速度。对于“预填充”(prefill)阶段(读取长提示词),WIDE 比原始模型快了 1.68 倍。对于“解码”(decode)阶段(逐字生成答案),它快了 1.55 倍
  • 内核级魔法: 如果只看数学计算(忽略其他开销),加速效果更加显著,在预填充阶段达到了 1.98 倍,在解码阶段达到了 4.95 倍。这表明瓶颈在于以往方法处理“跳过”操作时的低效方式,而 WIDE 的新硬件设计解决了这个问题。

作者还发现模型学会了非常有策略性。它不仅仅是随机跳过部分,而是学会了跳过“无聊”的词(如“the”或“a”)并保留“重要”的词(如“running”或“track”)。在一项测试中,模型跳过了 66% 的注意力工作,但仅跳过了 28% 的处理工作,这表明它清楚地知道在哪里节省能量。

核心结论

WIDE 表明,高效 AI 的未来不仅仅在于把模型剪得更小,而是在于让模型更聪明地使用其剩余的部分。通过从“跳过整个房间”转向“调暗特定的灯光”,并通过重新设计厨房以高效处理这些调光器,作者创建了一个框架,使大型 AI 模型在不变得健忘的前提下,运行得更快、更高效。

虽然结果令人鼓舞,但论文指出,这是一个针对 GPU 硬件(计算机中的芯片)的特定解决方案,并且依赖于一个两阶段训练过程:模型首先学习如何做出决策,然后通过快速微调来恢复任何损失的准确度。这是向让强大的 AI 在日常设备上普及迈出的重要一步,证明了你不需要一个巨大的大脑也能变得聪明——你只需要知道在正确的时间使用大脑的哪些部分。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →