← 最新论文
🤖 machine learning

WiSP: A Working-Set View of Mixture-of-Experts Serving on Extremely Low-Resource Hardware

本文介绍了 WiSP,一种针对低资源硬件上混合专家模型(Mixture-of-Experts models)的路由感知工作集管理系统,该系统通过动态分页专家权重并优化专家与 KV 缓存之间的显存分配,在不修改底层推理引擎的情况下显著提高解码吞吐量。

原作者: Jiamu Zhang, Liang Wu, Mayank Darbari, Liangjie Hong

发布于 2026-06-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Jiamu Zhang, Liang Wu, Mayank Darbari, Liangjie Hong

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是关于论文《WiSP: A Working-Set View of Mixture-of-Experts Serving on Extremely Low-Resource Hardware》的解释,使用了简单的语言和日常类比。

核心问题:由于“太大而装不下”的 AI

想象你拥有一座巨大的图书馆(AI 模型),其中包含了数千亿页的内容。你想在一台微型、便携式电子阅读器(标准的计算机图形卡,或 GPU)上阅读其中一个特定的故事。

问题在于,电子阅读器的内存不足以一次性容纳整个图书馆。然而,对于你正在阅读的任何一个句子,你只需要从几本书中提取特定的几页。其余的图书馆内容都处于闲置状态。

目前的解决方案试图通过将整个图书馆保存在仓库(计算机的主内存)中来解决这个问题,并在你每翻一页时都冲向仓库去抓取所需的页面。这非常缓慢,因为去仓库的路程(数据传输)需要很长时间。

WiSP 的解决方案:一位“聪明的图书管理员”

作者创建了一个名为 WiSP(工作集分页,Working-Set Paging)的系统。WiSP 不再是在每次需要页面时都冲向仓库,而是扮演了一位聪明的图书管理员的角色,他会观察你在读什么,并将一叠可能被需要的书籍精选出来,直接放在你的书桌上(GPU 内存)。

它是如何工作的,分为三个简单部分:

1. “智能书堆”(专家分页)

在被称为“混合专家模型”(Mixture-of-Experts, MoE)的 AI 模型中,模型拥有许多不同的“专家”(专门的子模型),但对于生成的每个词,它只使用其中的几个。

  • 旧方法: 系统会抓取一层中的所有专家,即使它实际上只用到两个。这浪费了空间和时间。
  • WiSP 的方法: WiSP 只将你实际正在使用的特定专家放在你的书桌上。如果你需要一个新的专家,它会迅速从书堆中换出一个,并从仓库中抓取新的专家。
  • 结果: 因为它只移动你真正需要的微小部分,所以速度快得多。论文发现,在小型计算机上,这使得 AI 的运行速度比旧方法快了高达 2 倍

2. “共享桌面”(内存分配)

你的书桌(GPU 内存)非常小。你有两样东西在争夺空间:

  1. 专家书堆(Expert Stack): 你现在正要读的书。
  2. 上下文笔记(KV Cache): 你目前为止针对这个故事所写的笔记,以便你不会忘记发生了什么。

如果你把书桌填满了书,你就没有空间写笔记了。如果你把书桌填满了笔记,你就无法抓取所需的书。

  • WiSP 的解决方案 (MV-WSA): 这是一个决定如何划分你桌面空间的聪明规则。它不断地询问:“是桌上有更多的书更有用,还是有更多的笔记更有用?”
  • 它会动态地调整这种分配。如果你正在写一个长篇故事,它会给你更多的笔记空间。如果你在快速切换话题,它会给你更多的书籍空间。这确保了你永远不会在其中任何一方面耗尽空间。

3. “水晶球”的神话(为什么预测没有帮助)

研究人员想知道:“如果我们使用一个水晶球(AI 预测)来猜测你下一步需要哪本书,并在你开口要之前就把它抓过来,情况会怎样?”

  • 惊喜发现: 他们发现,在这种特定设置下(一次阅读一个句子),预测并不会让它变快。
  • 原因: 仓库与书桌之间的“路”(数据连接)太窄了。即使你预测得完美无缺,卡车一次也只能运载这么多东西。瓶颈不在于猜对哪本书,而在于卡车的速度
  • 真正的价值: “水晶球”仍然有用,但不是为了提速。它能帮助图书管理员知道书堆的大小应该针对具体调整到多大。这使得系统可以将书堆缩小到完美的尺寸,从而为你的笔记腾出更多桌面空间。

总结

该论文认为,在小型计算机上运行大型 AI 模型是一个内存管理问题,而不仅仅是计算问题。

  • WiSP 是一个充当聪明图书管理员的工具,它只将必要的书籍留在桌面上,并高效地进行更换。
  • 它并不改变 AI 模型本身;它只是更好地管理内存。
  • 它通过停止浪费时间移动不必要的数据,使 AI 在小型设备上运行速度显著提升。
  • 它告诉我们,在这种特定场景下,高效管理你的工作空间比试图预测未来更重要。

该系统表现出色,甚至可以让原本无法处理这些庞大模型的单张显卡也能流畅运行,且不会改变 AI 回答的质量。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →