← 最新论文
🤖 AI

SMEPilot: Characterizing and Optimizing LLM Inference with Scalable Matrix Extensions

本文介绍了 SMEPilot,这是一种通过在仅 CPU、仅 SME 或协作执行策略之间进行动态选择,并利用分块级划分和布局复用来优化具有可扩展矩阵扩展(SME)的 CPU 上性能的 LLM 推理引擎,在多种模型和平台上实现了高达 3.94 倍的加速。

原作者: Feiyang Chen, Haibo Chen

发布于 2026-06-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Feiyang Chen, Haibo Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

大局观:为旧机器打造的新工具

想象一下,你有一个非常繁忙的厨房(现代计算机 CPU)。多年来,这个厨房一直依靠一群全能厨师(标准 CPU 核心)来切菜、搅拌锅里的食物以及摆盘。他们什么都会做,但在处理一项特定任务时并不是超级快:那就是将大量的蔬菜切成完美的方块(这就是大语言模型,即 LLM,进行“思考”时所需要的操作)。

最近,厨房得到了一件新设备:一台高速工业蔬菜切片机(被称为 SME,即可扩展矩阵扩展)。这台机器切菜的速度极快。然而,论文的作者发现了一个问题:仅仅拥有切片机并不意味着你应该把所有任务都交给它。

  • 问题所在: 如果你试图用切片机处理所有事情,你可能会堵塞传送带(内存带宽),或者在处理小任务时浪费时间进行设置。有时候,全能厨师在处理那些细碎、棘手的任务时反而更快。
  • 解决方案: 团队构建了 SMEPilot。把 SMEPilot 想象成一位极其聪明的厨房经理。它不会把所有活儿都丢给切片机;它会精确地决定哪个厨师负责哪项工作,何时使用机器,以及如何保持整个厨房高效运转而不让任何人闲着等待。

SMEPilot 是如何工作的:三大魔术招式

论文指出了 SMEPilot 让厨房运行得更快的三个主要方式。以下是对应的比喻:

1. “团队分工”(块级工作划分)

问题: 想象你要切一个巨大的披萨(一个巨大的数学问题)。

  • 如果你把整个披萨都交给工业切片机,厨师们就会无事可做。
  • 如果你把披萨交给厨师,切片机就会闲置。
  • 如果你只是把披萨对半切开,一半给切片机,另一半给厨师,切片机可能 1 秒钟就切完了,而厨师却要花 10 秒钟。这时切片机就在那儿干等着,浪费了时间。

SMEPilot 的解决方法: SMEPilot 将披萨切成一个个小块(tiles)。它给切片机分配一些小块,同时也给厨师分配一些小块。至关重要的是,它会精确计算出每方应该分到多少块,使得双方都能在完全相同的时间内完成任务。这保证了机器和厨师在 100% 的时间内都在忙碌。

2. “流水线作业”(感知阶段的流水线执行)

问题: 做三明治涉及两个步骤:

  1. 步骤 A: 切面包(需要工业切片机)。
  2. 步骤 B: 抹芥末酱(需要人工操作)。

在一个糟糕的厨房里,你会等整条面包被切完之后,才开始抹芥末酱。人类在机器工作时坐着不动;然后机器在人类抹芥末酱时又闲置下来。这被称为“时间空隙”(temporal bubble,即没有任何工作进行的停顿时间)。

SMEPilot 的解决方法: SMEPilot 创建了一条流水线。一旦切片机切好一片面包,它就会立即将面包传给人类去抹芥末酱,同时切片机立即开始处理下一片面包。机器和人类在处理三明治的不同部分时同时工作。这消除了等待时间。

3. “预包装午餐”(感知布局的运行时)

问题: 工业切片机只有在蔬菜被排列成非常特定的、紧密的网格(“打包”布局)时才能工作。但厨房里的其他食材通常储存在松散的标准袋子里。

  • 糟糕的做法: 每次你想用切片机时,你都要停下来,把蔬菜从袋子里拿出来,把它们完美地排列成网格,切片,然后再把它们装回袋子。这种“重新排列”所花费的时间几乎和切片本身一样长,从而抵消了速度上的优势。

SMEPilot 的解决方法: SMEPilot 非常聪明,知道何时进行重新排列。

  • 对于静态食材(如模型权重): 它在厨房开门时就将它们排列成完美的网格,以便每次订单到来时都能立即使用。
  • 对于新鲜食材(如新数据): 它在食材被创建时立即将其排列成网格,以便后续无需任何额外步骤即可直接用于切片机。这避免了“重新排列”带来的惩罚。

结果:有多快?

研究人员在手机、笔记本电脑和服务器上,使用流行的 AI 模型(如 Llama 和 Qwen)对 SMEPilot 进行了测试。

  • 速度: 与在 CPU 上运行这些模型的标准方式相比,SMEPilot 使 AI 的速度提升了高达 3.94 倍
  • 能耗: 因为它完成任务的速度更快,所以与标准方法相比,它的能耗不到一半
  • 对比: 在某些测试中,运行 SMEPilot 的 CPU 几乎达到了专用显卡(GPU)的速度,而 GPU 通常是处理 AI 的“主力军”。

核心总结

论文认为,SME(这个新机器)并不是一个可以取代旧厨师的“魔法棒”。相反,最佳的性能来自于一位聪明的管理者(SMEPilot),它知道:

  1. 何时使用机器,何时使用厨师。
  2. 如何分配工作以确保每个人都保持忙碌。
  3. 如何组织工作空间以避免浪费设置时间。

通过这样做,普通的计算机可以比以前更快、更高效地运行强大的 AI。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →