← 最新论文
🤖 machine learning

Benchmarking Composable Compression Techniques in Mixture-of-Experts LLMs

本文介绍了 MoEXBench,这是一个系统性的基准测试,用于评估在多种混合专家(Mixture-of-Experts)大语言模型中,结合专家剪枝、权重量化和 KV 缓存压缩所产生的复杂相互作用及部署效率,并揭示了它们的联合性能无法通过对单一技术的独立评估来预测。

原作者: Afsara Benazir, Chen Chen, Rongxiao Qu, Jiabo Huang, Jingtao Li, Lingjuan Lyu

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Afsara Benazir, Chen Chen, Rongxiao Qu, Jiabo Huang, Jingtao Li, Lingjuan Lyu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

大语言模型是当今许多最先进人工智能工具背后的引擎,它们能够编写代码、解决复杂的数学问题,并进行感觉异常像人类的对话。为了实现这种智能水平,这些模型拥有数十亿个参数,这些参数本质上是决定系统如何思考的内部旋钮和开关。然而,这种巨大的规模产生了一个显著的问题:模型过于庞大,需要极高的计算机内存才能运行,这使得它们难以安装在标准的笔记本电脑或服务器上。为了解决这个问题,研究人员开发了一种被称为“混合专家”(Mixture-of-Experts)的特定类型模型。这类模型不再是在处理每个问题时都动用大脑的所有部分,而是将每条信息路由到一小组专门的专家那里,在保持巨大的总容量的同时,使活跃的工作量保持在可控范围内。挑战依然存在:即便有了这种效率,这些模型在存储海量数据以及在长对话过程中进行复杂计算时,仍然会对普通硬件造成压力。

一个研究小组致力于研究如何让这些强大的模型适配日常计算机,同时又不损失其智能。他们专注于三种主要的缩减模型的方法:移除未使用的专家、降低模型所使用数字的精度,以及压缩长对话所需的内存。虽然这些方法中的每一种都被单独研究过,但还没有人系统地测试将它们堆叠在一起时会发生什么。研究人员构建了一个全面的测试框架,以模拟将一个庞大的模型进行压缩以用于实际应用的整个过程。他们测试了十种不同规模和设计的模型,应用了不同的压缩技术组合,以观察它们之间的相互作用。他们的目标不仅是看模型是否变小了,还要精确测量其性能下降了多少,以及更小的体积是否真的转化为了在真实硬件上的更快的速度。

研究揭示了一个令人惊讶的事实:节省的空间大小并不能预测智能损失的程度。研究人员发现,切除未使用的专家(这一过程被称为“剪枝”)对模型推理能力的破坏,远比仅仅降低其内部数字的精度要严重得多。事实上,移除相对较少比例的专家就可能导致性能显著下降,而激进地降低权重的位深(bit-depth)所产生的影响则温和得多。这意味着,用于缩小模型的具体方法,比缩减的总百分比更为重要。此外,研究人员发现,模型的架构(即其内部设计)在决定其在压缩过程中表现如何方面,起到了比整体规模更大的作用。较大的模型并不一定更具鲁棒性;一些规模较小但设计不同的模型,在应对压缩时比其庞大的对应物表现得好得多。

另一个关键发现是,压缩模型的平均性能可能会产生误导。虽然一个模型可能保持较高的综合评分,但它可能会在特定类型的任务(如编程或遵循复杂指令)上遭遇惨败,同时在其他任务上表现良好。研究人员还检查了这些压缩模型在实际计算机芯片(包括高端显卡和现代笔记本电脑中的处理器)上的表现。他们发现,减小模型体积并不自动意味着让它变得更快。虽然压缩成功减少了运行模型所需的内存,但处理信息所需的时间并不总是成比例地提高。在某些情况下,增加更多的压缩层反而会减慢模型的运行速度,因为计算机必须花费额外的时间来解压数据。这在长对话中尤为明显,因为管理压缩内存所需的额外步骤抵消了减少数据移动所带来的收益。

研究人员得出结论,不存在一种单一的“最佳”压缩方式。相反,这个过程必须被视为一种微妙的平衡行为,其技术的选择在很大程度上取决于具体的硬件和预期用途。他们发现,专家剪枝是最激进且风险最高的步骤,通常在质量损失中占据主导地位,而降低数字精度则是更安全的第一步。压缩长上下文使用的内存有助于节省空间,但不能保证速度提升,并且在某些场景下甚至可能导致速度变慢。研究表明,开发者不应仅仅追求最小的文件体积。相反,他们应该在目标硬件上对整个压缩流程进行综合测试,以找到模型保持准确性和响应速度的平衡点。通过提供关于这些不同压缩方法如何相互作用的清晰图谱,研究人员为将这些强大的智能系统部署到我们日常使用的设备上提供了实用的指南。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →