想象一下,你拥有一个规模宏大、细节极其丰富的图书库(即大型语言模型)。为了能在智能手机这类小型设备上阅读这些书,你需要将它们缩小。通常有两种方法:
- “快而粗糙”的方法: 你快速地将书籍复印在微小的索引卡片上。这种方法很快,不需要额外的研究,但如果你缩得太小(低于 4 bit),文字就会变成乱码,故事也会随之崩溃。
- “慢而完美”的方法: 你雇佣了一支编辑团队,利用特定的参考书对每一句话进行精心的重写,以确保其含义保持完美。这种方法效果很好,但需要耗费数天时间,需要大量的昂贵计算机,而且你必须能够访问那些(通常并不存在或属于私有的)原始参考书。
迎来 EntQuant: 这篇论文介绍了一种名为 EntQuant 的新方法,它就像是一个“神奇的缩放射线”,兼具了两者的优点。它既快速,又不需要参考书,还能在极端缩小的尺寸下保持故事的完整性。
以下是它的工作原理,使用简单的类比:
1. 问题所在:“固定盒子”陷阱
现有的方法强迫图书馆的文字进入固定大小的盒子中。
- 如果你想节省空间,你就必须使用极小的盒子(低比特)。
- 但极小的盒子只能容纳极少数特定的词汇。如果图书馆需要表达一个复杂的想法,它会因为盒子太小而陷入困境。这就是为什么现有的方法在尝试将模型缩小到 4 bit 以下时会失效;它们耗尽了“表达能力”。
2. 解决方案:“智能归档系统”
EntQuant 改变了规则。它不再强迫文字进入微小的盒子,而是保留了标准且高质量的盒子(如 Float8 或 Int8),但通过极其巧妙的组织方式,让它们几乎不占用空间。
这就像是搬家时的打包服务:
- 旧方法: 你必须把家具塞进预先定好尺寸的板条箱里。如果你有一个巨大的沙发,你必须把它切碎才能塞进一个小板条箱。
- EntQuant 方法: 你保持家具的完整性(高精度),但通过紧凑的排列,让货车看起来几乎是空的。你使用一种“智能算法”来高效地堆叠物品,使得货车虽然装满了空气,但物品本身被完美地保存了下来。
3. 核心秘诀:“熵编码”
该论文使用了一种称为熵编码(具体为一种称为 ANS 的技术)的技术。
- 想象你在编写一种秘密代码。如果字母“E”出现的频率是 50%,你就给它一个非常短的代码(比如“1”)。如果“Z”很少出现,你就给它一个较长的代码(比如“11010”)。
- EntQuant 首先通过“训练”模型,使其更频繁地使用某些数字(使数据变为“低熵”)。
- 然后,它利用这种智能编码来压缩数据。因为这些数字是可预测的,所以计算机可以用平均每参数不到 2 bit 的空间来存储它们,尽管这些数字本身仍然是以高精度格式存储的。
4. 为什么这意义重大
- 无需“校准”: 大多数高质量的压缩方法都需要使用数据集进行“试驾”来调整模型。EntQuant 是无需数据的(data-free)。你可以拿走一个模型,在不到 10 分钟内完成压缩,然后它就能直接运行。这对于那些拥有私有或专业化数据的模型来说至关重要。
- 极端压缩: 它成功地将庞大的模型(如 700 亿参数的模型)压缩到了可以适配消费级显卡的尺寸,同时保持了模型足够聪明,能够遵循复杂的指令并解决数学问题。
- 速度: 虽然在读取时需要进行一定的“拆包”(解码)过程,但论文表明,在现代计算机上,这种速度损耗微乎其微(大约比原始速度慢 1.5 到 2 倍,这仍然非常快)。
总结
作者 Patrick Putzky、Martin Genzel(以及他们在 Merantix Momentum 的团队)创造了一个工具,让你能将巨大的 AI 模型缩小到像个小手提箱的大小,而不会丢失其智能,而且你可以瞬间完成,无需任何额外数据。这就像是能把一艘 70 英尺长的游艇装进背包里,且不损坏它。
关键要点: 他们打破了“为了节省空间就必须牺牲质量”的规则。通过使用智能归档系统(熵编码)而不是单纯地切割数据,他们在实现极端体积缩减的同时,保持了高质量。
技术摘要:EntQuant —— 熵编码实现无数据模型压缩
1. 问题陈述
大语言模型(LLM)的训练后量化(PTQ)目前面临着可访问性与保真度之间的权衡。
- 无数据方法(第 1 级): 如 NF4 和半二次量化(HQQ)等技术速度快、与模型无关,且不需要校准数据。然而,当压缩率低于 4 bit 时,它们会遭遇“功能崩溃”,无法保持模型性能。
- 数据依赖型方法(第 2–4 级): 利用校准数据或恢复训练(如 QuIP#、EfficientQAT)的方法在极端比特率下能获得更高的保真度,但会带来高昂的计算成本,并需要访问训练语料库。由于数据主权、法律限制(如 GDPR)或训练数据的不可用性,这对于专门的指令微调或推理模型通常是无法实现的。
现有方法严格地将压缩率与表示位宽耦合在一起。为了实现 8 倍压缩,标准框架会强制将权重放入 2-bit 表示(仅有 4 个不同数值)中,这缺乏模拟复杂权重分布的表达能力,从而导致性能下降。
2. 方法论:EntQuant
作者引入了 EntQuant,这是一个通过将熵编码直接集成到量化流水线中,从而将存储成本与表示精度解耦的框架。
核心概念
EntQuant 并非将权重强制固定在僵化的低位格式(如 Int2)中,而是保持较高的表示精度(Float8 或 Int8),但通过优化权重值来最小化其熵。这些低熵权重随后使用渐进算术编码(Asymmetric Numeral Systems, ANS)进行无损压缩。这使得模型能够在推理过程中保留基础格式的全动态范围,同时实现任意的有效比特率(低至约每参数 2 bit)。
技术组件
熵约束优化:
- 目标是在满足重构误差约束的情况下,最小化量化权重 Wq 的经验熵。
- 由于直接的熵最小化是不可微的,作者提出了一个松弛的拉格朗日目标函数:
Wqmind(W,W^)+λR(Wq)
其中 d 是相对 ℓ1 损失(对离群值具有鲁棒性),而 R(Wq)=∥Wq∥1 作为熵的可微代理。
- 优化针对每一层进行,使用 L-BFGS 算法,仅调整通过 AbsMax 算法初始化的逐通道缩放参数 S。
权重编码:
- 优化后的权重被展平为符号流,并通过经过 GPU 优化的 ANS 编码器(通过 NVIDIA 的
nvCOMP)进行压缩。
- 最终存储由压缩后的比特流、缩放参数和元数据组成。缩放参数的开销微乎其微(<1%)。
推理时解码:
- 与传统的离线压缩不同,EntQuant 将解码集成到推理流水线中。
- 权重以紧凑的比特流形式存储在 VRAM 中。在 Transformer 块的前向传播之前,并行的 ANS 解码器会在线将权重解压到缓冲区中。
- 这种受 DFloat11 启发的分块解压策略,允许在解压与前向计算内核之间进行密集的交替执行,从而保持高 GPU 利用率。
处理超级权重(Super Weights):
- 对于 Int8 基础格式,该方法包含一种机制,用于检测并将“超级权重”(早期下投影层中的极端离群值)排除在熵优化之外,从而防止出现类似于需要显式离群值处理方法的性能崩溃。
3. 主要贡献
- 无需校准的极端压缩: EntQuant 实现了在无需恢复训练或校准数据的情况下,将量化降至有效 2-bit 率。它是一种适用于数据访问受限模型的第 1 级方法。
- 解耦压缩率与位宽: 该方法打破了存储大小与量化精度之间的严格耦合。它实现了低比特存储成本(例如 2.1 bits/参数),同时保留了 Float8 或 Int8 的表达能力,避免了固定 2-bit 量化所见的函数崩溃。
- 简化的离群值处理: 通过使用逐通道缩放和熵优化,EntQuant 自然地将精度集中在需要的地方,而无需复杂的分组方案或显式的离群值检测(尽管它可以选择性地排除超级权重以处理 Int8)。
- 高速优化: 压缩阶段非常高效,对于 70B 参数的模型,耗时不到 10 分钟,与 HQQ 等快速无数据方法相当。
4. 实验结果
作者在超过 480 次运行中,对 16 个开源 LLM(包括 LLaMA-1/2/3、Qwen3、OLMo 和 Mistral Large)评估了 EntQuant。
- 无数据性能: 在 2–3 bit 区间内,EntQuant 显著优于现有的无数据方法(HQQ、NF4)。当 HQQ 和 NF4 在 2 bits 时表现出功能崩溃(例如困惑度爆炸至 >1000)时,EntQuant 能保持可用的性能(例如 LLaMA-2 70B 在 2.1 bits 下的困惑度为 6.47,而 HQQ 为 32.24)。
- 与校准方法的对比: 在 3 bits 时,EntQuant 的结果与最先进的校准和微调方法(如 QuIP#、EfficientQAT)相当,仅在 2 bits 时存在微小差距。至关重要的是,它在不需要访问训练数据的情况下实现了这一点。
- 指令微调模型: EntQuant 在指令遵循(IFEval)、数学推理(GSM8K CoT)和科学推理(GPQA)基准测试中保持了强大的性能,而其他无数据方法在这些专门任务上会发生灾难性失败。
- 推理开销: EntQuant 比 BFloat16 基准慢约 1.5–2 倍,但与 NF4 的推理速度相当。解压开销在较长序列长度下会被摊薄。
- 内存效率: 压缩至有效 2.1 bits 的 70B 参数模型可以容纳在约 18.8 GiB 的压缩权重中,这使得在 3 bits 或更低水平下,利用消费级 GPU(如 32 GiB RTX 5090)部署成为可能。
5. 重要性与主张
论文声称 EntQuant 代表了一种范式转变,即通过将经典的信息论原理(将离散化与高效表示分离)应用于现代大型基础模型。
- 打破障碍: 它被呈现为第一个在纯粹无数据的情况下实现功能性极端压缩(低于 3 bits)的方法,克服了固定位宽量化方法的性能壁垒。
- 实际效用: 通过使在消费级硬件上部署大规模模型(如 70B+)成为可能,且无需校准数据或重新训练,EntQuant 解决了内存限制场景下的关键瓶颈。
- 可访问性: 该方法使获取前沿模型变得民主化,能够立即采用每周发布的新模型,而无需像其他高保真方法那样经历数小时的校准流程。
作者承认,虽然 EntQuant 目前与未压缩基准相比会有适度的推理减速,但这属于预内核优化阶段,类似于早期的 GPTQ 实现,这表明通过专门的融合内核可以实现显著的提速。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。