← 最新论文
🤖 machine learning

Every Expert Counts: ExactMoE for Memory-Efficient W4A16 Inference

ExactMoE 是一个针对 W4A16 混合专家模型(Mixture-of-Experts models)的高效内存推理框架,它仅对路由专家进行量化,并利用 GPU 常驻插槽缓存(GPU-resident slot cache)实现了高达 87% 的 GPU 显存减少,同时保留了超过 99% 的基准精度,并显著提高了相比于顺序执行的吞吐量。

原作者: Amjad Saab

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Amjad Saab

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

现代人工智能通常依赖于包含数十亿个参数的庞大数字大脑,这些参数是决定系统如何思考的可调节旋钮。为了使这些系统更快、更高效,工程师们开发了一种被称为“稀疏混合专家”(sparse mixture of experts)的设计。想象一个图书馆,与其让每一本书都摆在桌上供所有读者查阅,不如只抽出几本特定的卷册来回答特定的问题。在这些模型中,“书”是被称为“专家”的专业化子网络。对于模型处理的每一段文本,一个路由器会决定激活哪一小组专家,而让其余部分保持休眠状态。这种条件触发的方法在思考过程中节省了大量的计算能力。然而,对于任何试图在标准硬件上运行这些模型的人来说,一个重大的障碍仍然存在:尽管大多数专家在特定任务中并不会被使用,但整个专家的“图书馆”仍必须存储在计算机的内存中。这一要求往往迫使系统使用昂贵的高容量显卡,或者在不同类型的内存之间传输数据时显著减速。

一位研究人员提出了一种名为 ExactMoE 的新方法,旨在解决这个存储和速度问题,且不牺牲模型访问其全部知识库的能力。他们的研究重点是一种被称为“四比特量化”(four-bit quantization)的特定内存高效压缩技术。简单来说,这种技术降低了用于表示专家权重的数字的精度,在保持其可用性的同时,极大地缩小了它们的体积。这项创新的核心在于如何管理这些压缩数据。研究人员并没有尝试将整个庞大的图书馆塞进显卡有限但快速的内存中,而是将压缩后的专家存储在计算机的主内存中。然后,他们使用一个智能且灵活的系统,仅将当前时刻所需的特定专家移动到显卡的内存中,并以紧凑的分组批处理方式执行它们。至关重要的是,该系统确保每一个专家都保持可用,并完全按照模型路由器的指示进行执行,绝不会丢弃或替换原图书馆的任何部分。

研究人员在名为 OLMoE 的大型开源语言模型上测试了该系统,并在单张消费级显卡上运行。他们将这种新方法与未压缩的标准版本进行了对比。结果显示,运行该系统所需的内存大幅减少。当使用一种配置,即在任何给定时刻让适量的专家处于显卡内存就绪状态时,峰值内存占用量下降了近 87%。这种巨大的节省使得该模型能够在原本无法处理它的硬件上运行。在速度方面,在某些设置下,压缩后的模型比标准版本稍慢,但在内存被充分利用时,它能追平甚至超越标准版本。具体而言,当系统配置为将所有专家都保留在显卡内存中时,它处理文本的速度比标准版本快了约 47%,同时使用的总内存却显著减少。

除了速度和内存之外,研究人员还仔细测量了这种压缩是否会损害模型生成的答案质量。他们让模型通过了数千个涵盖各种主题的多选题,并将压缩版本的结果与原始模型进行了对比。发现结果非常接近。压缩模型的准确率保留了原始模型 99% 以上的水平。虽然存在微小的、在统计学上可测量的性能差异,但这种下降极其微小,表明该方法在现实世界中是可行的。研究还表明,通过将这些专家的执行进行分组,系统可以比逐一处理它们更加高效,其速度几乎是顺序处理方式的两倍。

这项工作凸显了一个内存、数据传输和处理速度交汇的实际前沿领域。研究人员强调,他们的方法并没有改变模型路由其思想的基本逻辑或其选择专家的逻辑;它只是改变了这些专家的存储和移动方式。路由器仍然做出相同的决策,并且每一个被选中的专家仍然执行其计算。唯一的区别在于,专家是以高度压缩的格式存储的,并且是以高效的批处理方式移动的,而不是以其完整、臃肿的形式被保留。这种区别至关重要,因为这意味着系统始终忠实于原始模型的设计,避免了其他可能通过修剪或永久禁用某些专家来节省空间的方法所带来的弊端。

最终,这项研究为在更易获取的硬件上部署复杂的语言模型提供了一条清晰的路径。通过证明模型可以在使用极小内存的同时,保持其整个专家库的可用性,研究人员表明,高性能人工智能并不一定需要庞大且专门的基础设施。该方法通过将压缩后的专家视为一个可以按需获取和使用的统一资源来发挥作用,确保了模型既具备能力又具备效率。虽然这项研究是在特定的模型和硬件设置下进行的,但其原理表明,只要能够仔细管理内存节省与数据移动之间的平衡,这种方法具有更广泛的应用潜力。结果表明,通过正确的工程设计,可以在不损害所交付的智能程度的前提下,显著降低运行这些复杂系统的门槛。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →