← 最新论文
💬 NLP

pQuant: Towards Effective Low-Bit Language Models via Decoupled Linear Quantization-Aware Training

本文提出了 pQuant 方法,通过解耦线性层为高效的主干 1 比特分支和保留敏感参数的紧凑高精度分支(可扩展为稀疏专家),有效解决了全参数量化感知训练中参数敏感性同质化的瓶颈,从而在极低比特量化下实现了大语言模型的最优性能。

原作者: Wenzheng Zhang, Bingzheng Liu, Yang Hu, Xiaoying Bai, Wentao Zhang, Bin Cui

发布于 2026-02-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Wenzheng Zhang, Bingzheng Liu, Yang Hu, Xiaoying Bai, Wentao Zhang, Bin Cui

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一种名为 pQuant 的新方法,旨在解决大型语言模型(LLM)在“极度压缩”后变笨的问题。

为了让你轻松理解,我们可以把训练一个大型语言模型比作组建一支超级高效的特种部队,而“量化”(Quantization)就是给这支部队换装,把原本穿着厚重、功能齐全的“重型装甲”(高精度浮点数),换成轻便但脆弱的“单兵作战服”(极低比特数,比如 1 比特)。

1. 核心问题:为什么换装后部队变弱了?(参数民主化)

在传统的换装方法中,有一个巨大的副作用,作者称之为**“参数民主化”(Parameter Democratization)**。

  • 比喻:想象一下,你有一支由 1000 人组成的特种部队。其中只有 5 个人是真正的“狙击手”和“爆破专家”(敏感参数),他们决定了任务成败;剩下 995 人是普通步兵。
  • 现状:在现有的 1 比特换装方案中,为了追求极致的轻便,系统强制要求所有人都穿上同样的、最简陋的“草鞋”(1 比特权重)。
  • 后果:结果就是,那 5 个关键专家也被迫穿上了草鞋,失去了原本的高精度能力。更糟糕的是,系统不再区分谁重要、谁不重要,让所有人都变得“一样普通”。这就导致整支部队的战斗力(模型精度)大幅下降,无法完成复杂任务。

2. pQuant 的解决方案:解耦与“特种分队”

pQuant 的核心思想是**“打破平均主义,让专业的人穿专业的鞋”。它提出了一种解耦线性层(Decoupled Linear Layer)**的设计。

  • 比喻:pQuant 不再让所有人穿一样的草鞋,而是把部队拆分成两个特种分队

    1. 主力大队(1 比特分支):95% 的士兵依然穿着轻便的“草鞋”(1 比特),负责处理绝大多数常规任务,保证行军速度极快、消耗极低。
    2. 精英特战队(高精度分支):专门挑选出那 5% 最关键的“专家”,给他们穿上保留的“重型战术靴”(8 比特高精度)。这支小队伍专门负责处理那些最敏感、最复杂的“高难度动作”。
  • 如何分配?:系统不会预先规定谁穿什么,而是通过一种**“特征缩放”(Feature Scaling)**机制,像一位聪明的教官一样,动态地指挥:遇到复杂任务时,自动把信号引导给穿“战术靴”的精英分队;遇到简单任务,就交给穿“草鞋”的大队。

3. 进阶玩法:专家混合(MoE)与弹性扩容

为了让这支特种部队更强大,pQuant 还引入了**“专家混合”(Mixture of Experts, MoE)**的概念。

  • 比喻:如果任务特别难,光靠一个“精英特战队”不够怎么办?pQuant 可以瞬间召唤出多个“精英分队”(比如 4 个或 8 个)。
  • 关键优势:虽然仓库里存了多个分队(增加了总参数量),但在执行每一个具体任务时,只激活其中一个分队
    • 这就好比:你有一个巨大的图书馆(总参数多),但每次你只借一本书(激活参数少)。
    • 结果:模型的能力(智商)随着分队数量增加而大幅提升,但每次推理时的速度和内存占用却几乎不变,依然像 1 比特模型一样快。

4. 实际效果:快如闪电,强如原版

通过这种设计,pQuant 取得了惊人的效果:

  • 精度提升:在 1.35 比特的极低精度下,它的表现甚至超过了 2 比特的模型,并且非常接近原本 16 比特(FP16)的“全副武装”版本。
  • 效率极高:因为它大部分时间只运行 1 比特的计算,推理速度比传统的 2 比特模型快了近 20%,比 16 比特模型快了两倍以上。
  • 内存节省:在边缘设备(如手机、无人机)上,它占用的内存只有原版模型的 8% 左右。

总结

简单来说,pQuant 就像是为语言模型设计了一套**“智能换装系统”
它不再搞“一刀切”的压缩,而是
把“聪明的大脑”(敏感参数)保留在高级装备里,把“手脚”(普通参数)换成极简装备**。同时,它还允许模型在需要时灵活调用更多的高级装备,却不需要付出额外的速度代价。

这使得我们可以在手机、边缘设备等资源受限的硬件上,运行既聪明的超大型人工智能模型。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →