← 最新论文
🤖 machine learning

MosaicQuant: Inlier-Outlier Disaggregation for Unified 4-Bit LLM Quantization

MosaicQuant 引入了一种统一的 4 位 LLM 量化框架,该框架将权重解构为稠密基底和稀疏残差以保持精度,同时其 ZipperEngine 组件将它们的执行融合进单一低位流水线中,从而实现接近 FP116 的性能,且较基准测试提升了高达 1.24 倍的速度。

原作者: Yangjia Hu, Haodong Wang, Zicong Hong, Qianli Liu, Quanxin Shou, Jian Lin, Song Guo, Xiaowei Shen, Xiangjun Huang, Dian Wang, Jian Yang

发布于 2026-06-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Yangjia Hu, Haodong Wang, Zicong Hong, Qianli Liu, Quanxin Shou, Jian Lin, Song Guo, Xiaowei Shen, Xiangjun Huang, Dian Wang, Jian Yang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一个巨大的图书馆(大语言模型,或称 LLM),你想把它装进你的背包里。问题在于,这些书太厚太重了,你的背包根本装不下,而且阅读它们需要花费极长的时间。

为了解决这个问题,你决定缩小这些书的体积。你想把它们压缩成微小的 4-bit“口袋版”(量化)。这让它们变得轻便且易于阅读。然而,这里有一个陷阱:当你把书缩得太小时,你会丢失重要的细节。

大多数书都有很多常见的、无聊的词汇(比如“的”、“是”、“和”),这些词很容易被压缩。但每隔一段时间,就会出现一些罕见的、复杂的词汇或戏剧性的情节转折(离群值/outlier),这些对于故事至对至关重要。如果你试图将这些罕见的词汇也压缩到同样微小的尺寸,故事就会崩塌,AI 也会开始出错。

旧方法:“VIP 区”问题

以往的方法试图通过这种方式来解决问题:“好吧,让我们把那些罕见的、重要的词汇保持在它们原始的、沉重的格式(高精度)中,只压缩那些无聊的部分。”

虽然这保持了故事的准确性,但也产生了一个新问题。想象一辆公交车,大部分乘客都坐在微小的折叠凳上(小型、压缩的数据),但少数 VIP 却坐在巨大的、沉重的扶手椅上(高精度数据)。

  • 问题所在: 公交车司机(计算机芯片)必须不断切换档位来处理不同的座位。它必须停下来,搬动沉重的椅子,并将它们转换回去。这种切换减慢了公交车的速度,抵消了你通过缩小其他乘客体积所获得的提速。

新方法:MosaicQuant

论文作者提出了一种名为 MosaicQuant 的新系统。与其让 VIP 坐在大椅子上,不如让他们也坐在同样的微小折叠凳上(统一 4-bit)。但是,他们加入了一个巧妙的转折来处理那些罕见且困难的词汇。

以下是它的工作原理,使用“马赛克(Mosaic)”作为类比:

1. 基础层(稠密 4-bit)
他们将整本书压缩成统一的 4-bit 大小。这完美地捕捉了所有常见的词汇。然而,由于被迫进入了微小的格式,那些罕见且复杂的词汇会变得有些模糊或扭曲。

2. “缝合”层(稀疏残差)
他们并没有为罕见的词汇提供一个全新的大椅子,而是针对那些变得模糊的故事部分,创建了一个微小的、隐形的“补丁”或“缝合处”。

  • 他们不会修补整本书。他们只修补那些扭曲最严重的特定页面。
  • 这个补丁也是 4-bit 的,所以它也能挤在同样微小的折叠凳上。
  • 因为他们只修补了极少数特定的地方(大约占全书的 10%),所以它非常轻盈,不会增加背包的重量。

3. “拉链”引擎(ZipperEngine)
这是让它变快的秘诀。在旧有的“VIP”方法中,计算机必须在沉重的椅子和微小的折叠凳之间不断切换。

  • MosaicQuant 的 ZipperEngine 扮演着高级裁缝的角色。它将主书(稠密基础层)和微小的补丁(稀疏残差)缝合在一起,而是在公交车行驶的过程中进行。
  • 它不需要停下来切换档位。它在一次平滑的运动中同时处理主文本和补丁。这意味着计算机芯片永远不需要停下来“转换”数据,从而保持了高速运行。

为什么这很重要

论文在强大的 AI 模型(如 LLaMA 和 Qwen)上测试了该方法,并得到了两个主要结果:

  1. 准确性: 故事(AI 输出)几乎与原始沉重的书籍一样完美。由于“补丁”很好地修复了模糊的部分,AI 并没有失去智能。
  2. 速度: 因为不需要在不同格式之间切换,AI 的运行速度比标准的 16-bit 版本快了高达 1.24 倍,并且比其他尝试混合高精度和低精度的方案要快得多。

简而言之: MosaicQuant 就像是将整个图书馆缩小到口袋大小,但它并没有丢掉重要的部分或让它们变得沉重,而是添加了微小的、轻量级的“补丁”来修复错误,同时保持了阅读过程的流畅与快速。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →