← 最新论文
🤖 machine learning

BPDQ: Bit-Plane Decomposition Quantization on a Variable Grid for Large Language Models

本文提出了一种名为位平面分解量化(BPDQ)的新方法,该方法利用可变量化网格和二阶优化,显著提升了大语言模型在超低位宽(2-3 位)下的精度,从而使得在单个消费级 GPU 上高效部署 72B 模型成为可能。

原作者: Junyu Chen, Jungang Li, Jing Xiong, Wenjie Wang, Qingyao Yang, He Xiao, Zhen Li, Taiqiang Wu, Mengzhao Chen, Zhen Peng, Chaofan Tao, Long Shi, Hongxia Yang, Ngai Wong

发布于 2026-05-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Junyu Chen, Jungang Li, Jing Xiong, Wenjie Wang, Qingyao Yang, He Xiao, Zhen Li, Taiqiang Wu, Mengzhao Chen, Zhen Peng, Chaofan Tao, Long Shi, Hongxia Yang, Ngai Wong

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你拥有一座庞大且细节惊人的知识库(大型语言模型),并希望将其装进口袋。问题在于,这座图书馆过于沉重且体积庞大,无法放入你的背包,而你的手机也无法快速阅读其中的书籍。

为解决这一问题,科学家采用了量化技术。这相当于将图书馆中复杂的高清书籍翻译成简化、低分辨率的版本,从而占用更少的空间。通常,他们会尝试将书籍压缩至 4 位(就像将 4K 电影转换为标准 DVD)。这种方法效果良好。但当他们试图进一步压缩至 2 位(就像将电影转换为微小且颗粒感强烈的 GIF)时,故事便支离破碎,意义丧失,图书馆变得毫无用处。

问题所在:“饼干模具”陷阱

论文指出,现有将模型压缩至 2 位的方法使用的是固定网格

想象你正试图将一堆形状各异的岩石(模型数据)装入一个盒子。

  • 旧方法(固定网格): 你拥有一个僵硬的饼干模具。无论岩石形状如何,你都必须强行将其塞入四个预先切割好的槽位之一:0、1、2 或 3。如果某块岩石需要"2.5"才能完美契合,旧方法会强行将其变为"2"或"3",从而产生空隙或裂缝。由于“饼干模具”的形状对每一组岩石都相同,当位数变得如此小时,模型会丢失过多细节。

解决方案:BPDQ(“定制模具”方法)

作者提出了一种名为**位平面分解量化(BPDQ)**的新方法。

BPDQ 不再为所有人使用单一的僵硬饼干模具,而是为每一组岩石构建一个定制模具

  • 工作原理: 它将数据分解为“位平面”(如同蛋糕的层次),并利用灵活的系数(可调节的旋钮)来塑造模具。
  • 结果: 数据不再被迫塞入 0、1、2 或 3 的僵硬槽位,而是可以根据特定岩石组的需求,适应一组灵活的值,如 0、1.2、3.5 或 4.1。

论文将这种方法称为**“可变网格”**。它打破了所有组必须看起来像同一模板放大版的规则。这赋予了模型更大的自由度去寻找完美契合点,从而最大限度地减少数据中的“裂缝”(误差)。

“二阶”魔力

为了确保这些定制模具完美无缺,该方法使用了一种称为**海森诱导几何(Hessian-induced geometry)**的技术。

  • 类比: 想象你试图平衡一摞盘子。简单的方法只是观察盘子并猜测放置位置。而 BPDQ 使用了一种“智能平衡”,能够理解整摞盘子的重量和晃动。它不仅仅修复一个盘子,而是调整整摞盘子,以确保修复一部分不会导致另一部分倒塌。这种“二阶”信息使模型在压缩数据时能够自我纠正错误。

成果:将巨人装入小型手机

作者在名为Qwen2.5-72B的巨型模型上测试了该方法(该模型通常需要超级计算机才能运行)。

  • 壮举: 利用 BPDQ,他们成功将该巨型模型压缩至2 位,并在单张消费级显卡(RTX 3090,你可能在高端游戏电脑中见到)上运行。
  • 性能: 即使在这种极端压缩下,该模型在数学问题(GSM8K)上仍保留了**83.85%**的原始智能。
  • 对比: 其他 2 位方法在这些相同的数学问题上惨败,准确率降至接近 0%。这就像试图阅读一本用你不懂的语言写成的书,而 BPDQ 则保持了语言的可读性。

意义所在

论文声称,以往方法在 2 位压缩下失败的主要原因并非数学错误,而是“饼干模具”(固定网格)过于僵硬。通过转向可变网格以适应数据,BPDQ 解锁了在更小、更便宜的硬件上运行庞大且智能的 AI 模型的能力,同时不会丧失处理数学或推理等复杂任务所需的“脑力”。

简而言之:BPDQ 通过使孔洞变得灵活,停止强行将方钉塞入圆孔,从而让庞大的 AI 模型能够装入微小的空间。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →