PagedWeight: Efficient MoE LLM Serving with Dynamic Quality-Aware Weight Quantization
PagedWeight 是一种新型的 MoE LLM 服务框架,它在运行时动态量化模型权重,以平衡专家精度与 KV 缓存需求,在保持等同于 FP16 精度的情况下,实现了高达 72% 的 GPU 显存节省和 1.94 倍的吞吐量提升。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
技术摘要:PagedWeight
问题陈述
混合专家(MoE)大语言模型(LLM)通过仅激活每个 Token 的一部分专家来提供高效率和高准确度。然而,在推理场景中,MoE 模型面临着一个关键的内存张力:GPU 必须同时存储庞大的模型权重和不断增长的键值(KV)缓存。虽然 PagedAttention 等技术可以管理 KV 缓存的分片问题,但它们并未解决 MoE 权重巨大的内存占用问题,这些权重可能占据超过 60% 的 GPU 显存。
现有的量化方法大多是静态的,在推理开始前就固定了精度。虽然存在一些运行时精度自适应方法,但它们并未利用精度的变化来动态地在权重和 KV 缓存之间重新分配 GPU 内存。因此,目前缺乏能够随着 KV 缓存扩大而动态释放不那么关键的专家权重内存,且不牺牲任务准确性或中断推理的系统。
方法论:PagedWeight
作者提出了 PagedWeight,一种新型的 MoE LLM 服务管理系统,它通过在运行时动态量化模型权重,以平衡专家权重精度与 KV 缓存大小。该系统将专家权重视为类似于分页 KV 缓存块的单元,允许动态卸载(offloading)和重载(reloading)。
核心组件
分页权重表示(Paged Weight Representation):
- PagedWeight 在每专家线性块(由层、专家和模块类型
gate_up或down标识)的粒度上进行操作。 - 它利用 任意精度 LLM(Any-Precision LLM, APL) 技术,通过叠加的位平面格式(bit-plane format)及其关联的查找表(LUT)来表示权重。
- 权重页表(Weight Page Table) 追踪每个线性块的期望位宽()和已提交位宽()。页面可以处于 GPU 常驻、CPU 常驻或传输状态。
- PagedWeight 在每专家线性块(由层、专家和模块类型
质量感知运行时规划器(Quality-Aware Runtime Planner):
规划器根据三个因素来决定量化哪些权重(降低位宽),以最小化准确性损失:- 离线全局敏感度(Offline Global Sensitivity): 使用 Hessian 加权得分来估计每个线性块对量化的内在敏感度。
- 在线路由统计(Online Routing Statistics): 追踪专家的“路由质量”(选择的频率和权重)。频繁被路由到的“热点”专家会被保护,拥有更高的位宽底线和损伤乘数。
- 提示词残差(Prompt Residuals): 一个通过线性回归头预测的特定于提示词的修正项。它根据当前输入序列调整全局敏感度估计,承认量化影响会随提示词而变化。
规划器会计算潜在位宽降低的“损伤”得分。当 KV 缓存压力触发内存目标时,规划器会贪婪地选择损伤最低的减少方案(即单位节省字节所带来的最高质量)以达到目标。
异步执行与算子优化(Asynchronous Execution & Kernel Optimization):
- 异步页面移动(Asynchronous Page Movement): 为了隐藏延迟,系统将权重页面卸载到 CPU 内存并进行异步重载。位宽提交仅在安全边界(例如,计划完全执行后)进行更新,确保推理不被中断。
- 融合混合精度算子(Fused Mixed-Precision Kernel): 定制的 CUDA 算子直接读取 APL 位平面和查找表,支持在单个融合操作中为每个线性块使用不同的位宽,以减少开销。
核心贡献
- 系统设计: 提出了 PagedWeight,一种用于在线任意精度 MoE 权重的分页权重系统,能够动态管理已提交/期望的位宽、页面状态和内存消耗。
- 规划算法: 一个质量感知的运行时规划器,它综合了离线敏感度、在线路由统计和提示词残差,从而在内存压力下选择低损伤的权重降低策略。
- 执行策略: 实现了异步页面移动,以最小的吞吐量损失隐藏卸载/重载延迟,并配合融合的混合精度 MoE 算子。
- 实证验证: 在三个 MoE 模型(Qwen1.5-MoE-A2.7B, Mixtral-8×7B, Gemma-4-26B-A4B)上进行了全面评估,证明了其优于现有基准方法的性能。
结果
作者在语言建模、推理和长文本任务中,将 PagedWeight 与 FP16、APL、DP-LLM 和 MxMoE 进行了对比评估。
- 质量-内存权衡: 与基准方法相比,PagedWeight 在实现 FP16 等效准确度的同时,实现了高达 72.0% 的 GPU 内存节省,并带来了 1.94 倍的吞吐量提升。
- 固定预算下的质量: 在相似的内存预算下,PagedWeight 比量化方法提升了高达 39.3% 的任务质量,且吞吐量损失最多不超过 4.1%。
- 长文本性能: 在严苛的内存预算下(例如 10 GB),PagedWeight 保持了与 FP16 相当的长文本质量(文本检索、NarrativeQA),而静态量化基准(如 APL)则会出现显著退化。
- 吞吐量: PagedWeight 的吞吐量与均匀量化基准方法持平,在 Batch Size 为 4 时观察到的最大下降为 4.1%。
- 消融实验: 移除路由统计、提示词残差或页面移动等组件会导致性能持续下降,证实了全套系统设计的必要性。
意义
论文声称 PagedWeight 有效地驾驭了模型任务准确性、内存消耗以及吞吐量/延迟之间复杂的权衡关系。通过将专家权重视为可分页、可管理的单元而非静态资产,PagedWeight 开启了一个探索性的权衡空间,即在任务准确性与 GPU 内存(在权重与 KV 缓存之间)的分配之间进行平衡。该系统表明,与静态量化或不适应运行时内存压力的方法相比,动态的、质量感知的量化是一种可行且更优的 MoE 服务策略。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。