← 最新论文
🤖 machine learning

TokenWeave: Efficient Compute-Communication Overlap for Distributed LLM Inference

TokenWeave 是一种新颖的系统,它通过利用专用 GPU 特性将 RMSNorm 操作与 AllReduce 通信融合,从而在分布式大语言模型推理的小批量场景下实现高效的计算与通信重叠,即使每轮迭代令牌数低至 1024 个,也能降低延迟并提高吞吐量。

原作者: Raja Gond, Nipun Kwatra, Ramachandran Ramjee

发布于 2026-05-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Raja Gond, Nipun Kwatra, Ramachandran Ramjee

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在运营一家大规模、高速运转的工厂(即大型语言模型),负责处理来自客户的请求。为了让这家工厂足够快,你雇佣了一支由 8 名专家工人(GPU)组成的团队协同工作。他们通过一套超高速传送带系统(NVLink)连接,以便即时共享工作成果。

然而,存在一个问题:工人们花费了太多时间等待彼此沟通。

即使拥有超高速传送带,工人们也必须停止实际的建造工作(计算),以便来回传递便条(通信)。在论文中,作者发现对于大型模型而言,这种“交谈时间”占据了总时间的约20%。这就像一位厨师在切下一块蔬菜之前,不得不停下来呼叫厨房里的其他厨师,只为了问一句:“你有盐吗?”

旧方法:将任务拆解

之前的尝试试图通过将工作拆分成微小的碎片来解决这个问题。其思路是:“当工人 A 向工人 B 传递便条时,工人 A 可以开始切下一块蔬菜。”

但作者发现,这种方法在处理小批量订单(即当你向 AI 提出简短问题时发生的情况)时效果不佳。将大任务拆分成微小碎片实际上反而让工人变慢了,因为他们不得不频繁地停止和启动。这就像试图进行一场接力赛,每跑 10 英尺就传递一次接力棒;你花在跑步上的时间,甚至少于停下来传递接力棒所花的时间!

新方案:TokenWeave

作者构建了一个名为 TokenWeave 的新系统。它就像一位智能经理,重新组织工厂车间以消除等待时间。以下是他们通过三个简单技巧实现这一目标的方式:

1. “智能拆分”(双车道高速公路)

TokenWeave 没有试图将工作拆分成一百万个微小碎片,而是将订单仅拆分为两个大块

  • 块 A 开始处理工作的前半部分。
  • 块 B 开始处理工作的后半部分。
  • 神奇之处:当块 A 忙于进行数学运算时,块 B 忙于传递便条。然后,它们互换角色。块 A 传递便条,而块 B 进行数学运算。
  • 为何有效:作者精确计算了如何拆分工作,以确保工人不会因等待传送带而“卡住”。他们称之为“波感知”(wave-aware),这意味着他们确保工人始终处于忙碌状态,就像精心设计的交通信号灯系统,让车辆持续行驶而无需停车。

2. “融合内核”(全能工具)

在旧工厂中,工人们必须分别做两件事:

  1. 传递便条(通信)。
  2. 归一化数据(一个称为 RMSNorm 的数学步骤)。

作者意识到,将这两个步骤分开执行是浪费的。这就像你必须走到储藏室去拿锤子,然后走回工作台钉钉子,再走回储藏室去拿螺丝刀。

  • 解决方案:他们构建了一种新的“超级工具”(融合内核),能够同时完成传递便条和数学步骤。
  • 额外优势:这个超级工具效率极高,仅需工厂总动力的极小部分(132 个工人中仅需 2–8 个)即可运行。这使得其余工人能够完全专注于繁重的体力劳动(计算)。

3. “智能重排序”(按正确顺序执行)

通常,工厂会先传递所有便条,然后再进行数学运算。但作者意识到,如果重新安排步骤,数学步骤(RMSNorm)可以在传递便条的过程中完成。

  • 类比:与其等待整辆卡车到达后再开始卸货,不如在卡车刚停稳时就立即开始卸下第一个箱子。TokenWeave 重新安排了步骤,使得数学运算在数据仍在传输时发生,从而节省了大量时间。

结果

该论文在配备真实世界模型(如 Llama 和 Qwen)的强大计算机(8x H100 GPU)上测试了这一新系统。

  • 速度:他们发现,与现有最佳系统相比,TokenWeave 使工厂速度提升了1.28 倍(即提升了 28%)。
  • 小批量订单:即使是对于非常短的问题(仅 1,000 个词),速度也提升了1.2 倍。而之前的系统在处理小批量订单时实际上会变慢。
  • 吞吐量:工厂每小时能处理的客户数量增加了19%
  • “神奇”的声明:在某些情况下,TokenWeave 的效率如此之高,以至于其表现优于一个理论上完全零通信的工厂版本。这是因为他们新的“超级工具”将数学步骤优化得如此出色,以至于弥补了沟通所花费的时间。

总结

TokenWeave 就像一位指挥家,统领着一支管弦乐队。它不让音乐家们停下来互相交谈(这会拖慢音乐节奏),而是教导他们在指挥家同时传递乐谱时演奏各自的声部。通过将工作仅拆分为两个智能块,并使用一种新的“全能”工具,他们消除了等待时间,使 AI 推理显著更快、更高效。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →