← 最新论文
🤖 machine learning

XFP: Quality-Targeted Adaptive Codebook Quantization with Sparse Outlier Separation for LLM Inference

XFP 是一种面向大语言模型推理的动态、无需校准的权重量化方法,它根据用户指定的质量阈值自动确定码本参数,有效分离稀疏异常值以实现高吞吐量和精度,同时通过其质量驱动的"H-Process"迭代机制使大规模模型能够适配受限内存。

原作者: Thomas Witt

发布于 2026-05-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Thomas Witt

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图将一座拥有 3970 亿块积木的巨型乐高城堡(一个巨型人工智能模型)塞进一个小背包(一台标准工作站电脑)里。

通常,为了让城堡能塞进去,你会尝试把所有积木都压碎成微小、均匀的粉尘(标准压缩)。但这会毁掉城堡;细节变得模糊,人工智能也开始犯错。

XFP 是一种更聪明的打包城堡的新方法。它不粉碎一切,而是采用“质量优先”的方法。以下是它的工作原理,使用简单的类比:

1. “质量底线”而非“位宽”

在旧方法中,你告诉电脑:“把每块积木打包成 4 位。”电脑会尽力而为,但如果积木形状怪异,结果就会很差。

XFP 则反其道而行之。你告诉电脑:“我需要城堡看起来至少保留 96% 的原貌。”
然后电脑自行计算其余部分。它会问:“好吧,为了保持 96% 的质量,这个特定部分实际上需要多少位?”

  • 对于某些部分,可能只需要 2 位。
  • 对于其他部分,可能需要 4 位。
  • 它不强制推行一刀切的规则。

2. “异常值”问题(巨大的积木)

想象一下,在你的乐高城堡中,99% 的积木都是小且正常的,但 1% 是巨大、沉重且形状怪异的积木。

  • 旧方法: 你试图把巨大的积木压扁以塞进小盒子。这会扭曲整个盒子,连小积木看起来也变差了。
  • XFP 方法: 它说:“让我们把这些巨大、怪异的积木拿出来,放进一个特殊的、独立的口袋里。”
    • 特殊口袋 以原始的高质量形式存放这些巨大积木(占用稍多空间,但仅针对少数需要的情况)。
    • 主盒子 只存放那 99% 的正常积木,由于它们都很相似,现在很容易压缩。

3. “自定义词典”(代码本)

XFP 不使用每个词长度都相同的标准词典,而是为人工智能的每一层学习一个自定义词典

  • 它观察城堡特定房间里的积木,学习哪些形状出现得最频繁。
  • 它创建一个只包含这些形状的微小列表(一个“代码本”)。
  • 然后,它不再存储整块积木,而是只存储一个指向列表中该形状的微小数字(索引)。
  • 因为这份列表是为那个特定房间量身定制的,所以效率极高。

4. 两条规则(严格 vs. 宽松)

人工智能有不同的房间类型:

  • “严格”房间: (如注意力机制,它关注细节)。XFP 在这里非常谨慎。它使用高质量的词典,并在特殊口袋里保留更多巨大积木。
  • “宽松”房间: (如“路由专家”,即专业化组件)。这些房间更灵活。XFP 在这里使用更小、更粗糙的词典,因为这些人工智能部分更能容忍被挤压而不会损坏。

这使得 XFP 能够在不破坏人工智能“大脑”的情况下节省大量空间。

5. "H-过程”(极度挤压)

该论文描述了一个具体挑战:将拥有 3970 亿参数的模型塞进两张通常无法容纳它的标准显卡中。

  • 他们使用了一个称为H-过程的流程。
  • 这就像玩“金发姑娘”游戏。他们不断调整“严格”和“宽松”的规则。
    • 如果规则太严格,模型就塞不进背包(内存不足)。
    • 如果规则太宽松,人工智能就开始胡言乱语(输出垃圾)。
  • 他们找到了“刚刚好”的设置(称为H1.5),模型完美契合,运行快速,且仍能给出良好的答案。

结果

  • 速度: 在高端工作站电脑上,对于 1220 亿参数的模型,XFP 的运行速度比当前最佳标准方法(Marlin INT4)快 49%
  • 质量: 它几乎完全保留了人工智能的智能,与原始未压缩版本无异。
  • 可及性: 它允许研究人员在标准的、功能强大的台式电脑上运行巨型人工智能模型,而无需昂贵的数据中心超级计算机。

简而言之: XFP 是一个智能打包系统,它不强迫一切塞进统一的盒子。它将怪异、沉重的物品分离出来,为其余部分学习自定义词典,并让你决定要保留多少质量,自动计算出将所有内容塞进去的最有效方式。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →