← 最新论文
🤖 AI

ARCQuant: Boosting NVFP4 Quantization with Augmented Residual Channels for LLMs

ARCQuant 是一个新颖的框架,它通过增强残差通道来提升 NVFP4 量化,从而在补偿量化误差的同时保持硬件统一的精度并利用标准 GEMM 内核,进而为大语言模型实现了最先进的准确率和显著的推理加速。

原作者: Haoqian Meng, Yilun Luo, Yafei Zhao, Wenyuan Liu, Peng Zhang, Xindian Ma

发布于 2026-07-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Haoqian Meng, Yilun Luo, Yafei Zhao, Wenyuan Liu, Peng Zhang, Xindian Ma

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一座庞大且细节极其丰富的知识图书馆(即大语言模型,LLM)。为了让这座图书馆能装进一个小背包(你的计算机内存)并快速运行,你需要缩小这些书的体积。这个过程被称为量化(Quantization)

通常,你可以通过将书籍缩减为 8 位的“平装本”来缩小体积。但为了让它们变得更小、更快,研究人员正尝试将它们缩减成极小的 4 位“明信片”。

然而,这里有一个问题:有些图书馆的页面包含巨大的、戏剧性的段落(称为离群值/Outliers),它们无法很好地适应微小的明信片。如果你试图把它们压扁,整个页面就会发生扭曲,导致故事变得毫无逻辑。

当前解决方案的问题

科学家们尝试过两种主要的方法来解决这个问题,但两者都有缺陷:

  1. “洗牌”法(The "Shuffle" Method): 想象一下,你试图通过重新排列房间里的家具来整理混乱的房间,好让那张大沙发能塞进一个小角落。虽然沙发塞进去了,但你也让整个房间变得混乱不堪。在 AI 领域,这种“旋转”操作会将大数值分散开来,破坏了新一代计算机芯片(如 NVIDIA 的 Blackwell 架构)高效工作所依赖的整齐、有序的块状结构。
  2. “混合尺寸”法(The "Mixed-Size" Method): 想象一下,你把大沙发放在一个巨大的箱子里(高精度),而把小椅子放在极小的箱子里(低精度)。问题在于,你的运输卡车(计算机硬件)被设计为一次只能运送一种尺寸的箱子。混合尺寸会导致卡车被迫停下来切换档位,从而降低速度。

解决方案:ARCQuant(“残差背包”)

来自天津大学的研究人员提出了名为 ARCQuant 的新方法。它不使用洗牌或混合箱子的策略,而是使用了一个聪明的技巧:增强残差通道(Augmented Residual Channel)

以下是类比:

想象你正在为旅行打包一个行李箱(数据)。

  • 主物品: 你有一件厚重的大衣(“离群值”数据)。
  • 问题: 行李箱太小,无法平整地装下这件大衣。
  • 旧方法: 你试图强行塞进去,结果压坏了大衣(丢失精度);或者你买了第二个不同尺寸的行李箱(混合精度),但航空公司不允许你这样高效地托运。
  • ARCQuant 的做法: 你把大衣紧紧折叠起来,然后把它放在侧面一个特殊的、薄薄的“残差口袋”里。
    • 主行李箱可以完美地装下你的其他衣服。
    • 这个薄口袋装的是大衣被挤压后丢失的具体细节。
    • 至关重要的一点是: 航空公司(计算机硬件)将它视为一个单一、统一的行李箱。他们不需要停下来切换档位,只需将整个整体作为一个单元进行处理即可。

它是如何工作的(简单易懂版)

  1. 识别问题: 系统会扫描数据,寻找那些“厚重的大衣”(对于 4 位量化来说太大的离群数值)。
  2. 分离与保存: 它提取这些大数值,计算如果将它们压扁会损失多少信息,并将这些“丢失的差异”(即残差)保存在一个特殊的额外列中。
  3. 统一打包: 它将主数据和“差异”数据一起打包成计算机芯片能够完美理解的标准格式。
  4. 神奇的数学运算: 当计算机读取行李箱时,它会瞬间将主部分和“差异”部分重新加在一起。因为这一切都是同步完成的,所以速度极快。

该论文的成果

研究人员在流行的 AI 模型(如 LLaMA 和 Qwen)上进行了测试,并使用了最新的 NVIDIA 图形卡(RTX 5090 和 PRO 6000)。

  • 准确度: 他们的这种方法非常出色,AI 的表现几乎与未压缩的全尺寸版本完全一致。它击败了目前所有现有的 4 位量化方法。
  • 速度: 由于它不会迫使计算机在不同的数据格式之间切换,因此运行速度比标准的高精度版本快达 3 倍
  • 效率: 尽管它通过额外的数学运算来修复那些“厚重的大衣”,但它占用的内存更少,且不会拖慢计算机的速度。

总结

ARCQuant 就像是一种智能的 AI 打包系统。它能找到那些尺寸过大的物品,用一层特殊的薄层将其包裹,并将其附着在主箱体上。通过这种方式,AI 既保持了聪明和准确,又能以更小、更快的封装形式运行,且能完美适配计算机硬件,不会出现任何卡顿。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →