← 最新论文
🤖 machine learning

HARP: Hadamard-Preconditioned Adaptive Rotation Processor for Extreme LLM Quantization

HARP 引入了一种可学习的、结构化的双边正交处理器,该处理器根据特定层和校准数据调整量化基,在保持部署效率的同时,显著提升了极端低比特(2-4 比特)大语言模型量化的精度,优于固定的哈达玛方法。

原作者: Artur Zagitov, Gleb Molodtsov, Aleksandr Beznosikov

发布于 2026-05-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Artur Zagitov, Gleb Molodtsov, Aleksandr Beznosikov

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你拥有一座庞大且细节惊人的图书馆(即大型语言模型),并希望将其装入口袋。问题在于,书籍太重,书架太宽,无法放入一个小包中。为了使其便于携带,你决定将这些书籍压缩成微小的笔记。这被称为量化

然而,当你将这些书籍过度压缩(仅保留 2 或 3 位信息)时,几页纸会被揉皱或丢失。这些“揉皱的页面”被称为异常值——它们是极其重要的数值,远大于其他数值。如果你尝试使用标准方法压缩整本书,这些异常值会破坏压缩效果,使得笔记难以阅读。

旧方法:“随机洗牌”

此前,科学家使用一种称为RHT(随机哈达玛变换)的技巧。你可以将其想象为将书籍的所有页面随机打乱,然后进行压缩。

  • 优点:它速度快,并能将“揉皱的页面”分散开来,避免它们全部集中在一个位置被压坏。
  • 缺点:这是一种固定的洗牌方式。就像对每一本书都使用相同的随机洗牌模式,无论这本书是食谱、小说还是字典,它都不会根据书中的具体内容进行调整。

新方法:HARP(“智能裁缝”)

本文作者提出了HARP(哈达玛预条件自适应旋转处理器)。你可以将 HARP 想象为一位智能裁缝,它不仅仅使用通用的洗牌方式。

  1. 它学习合身度:HARP 不像随机洗牌那样随意,而是观察模型每一层中数据的特定“形状”(就像观察衬衫的具体面料)。它学习完美地重新排列数值,使它们能够适应微小的压缩空间,同时不丢失重要细节。
  2. 即插即用的升级:最棒的是,HARP 最初看起来与旧的“随机洗牌”(RHT)完全一样。它就像一套标准成衣,但隐藏着拉链和可调节的接缝。一旦穿上,裁缝(校准过程)会迅速调整,使其完美贴合。这意味着你可以用 HARP 替换旧方法,而无需重建整个系统。
  3. 结构化且快速:HARP 并非进行杂乱无章的复杂重排。它采用“蝴蝶”模式(一种特定的、高效的混合方式),在数学上保证可逆且快速。这就像整理图书馆时,不是随意将书籍扔得到处都是,而是使用一种高效、预先规划好的分类系统,只需几秒钟即可完成。

使用它会发生什么?

该论文在从小型(10 亿参数)到超大型(700 亿参数)的模型上进行了测试。

  • 质量提升:当他们将模型压缩到极端尺寸(2 到 4 位)时,HARP 使模型变得“更聪明”(困惑度更低,准确率更高),优于旧的随机洗牌方法。它特别擅长保存那些通常会被丢失的“揉皱页面”(异常值)。
  • 依然快速:尽管 HARP 学习了自定义的合身度,但它并未减慢模型速度。事实上,带有 HARP 的压缩模型仍然快得多(每秒 128 个令牌),而原始未压缩模型仅为每秒 61 个令牌。
  • 通用性强:他们证明,HARP 不仅适用于一种特定的压缩工具,还可以替换到不同的压缩系统(如 QTIP)中,并仍能提升其性能。

核心结论

HARP 是一种工具,它将人工智能压缩中使用的“一刀切”式随机洗牌转变为量身定制的合身度。它从少量数据样本中学习,找到在将数值压缩之前完美重排它们的最佳方式。其结果是得到一个更小、更快的 AI 模型,阅读效果更好,错误更少,而无需从头重新训练整个模型。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →