← 最新论文
🤖 machine learning

ReRound: Reconstructive Rounding to Resolve Midpoint Ambiguity in Calibration-Free LLM Quantization

ReRound 是一种无需校准的训练后量化方法,它利用条件扩散模型来解决低比特大语言模型权重中的中点舍入歧义问题,在 3 比特和 4 比特量化方面持续优于标准技术,同时保持了离线效率。

原作者: He-Yen Hsieh, H. T. Kung

发布于 2026-08-12
📖 1 分钟阅读☕ 轻松阅读

原作者: He-Yen Hsieh, H. T. Kung

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图将一座巨大且极其详尽的知识图书馆缩小,以便装进一个微小的、便携式的背包里。这就是大语言模型(LLM)的世界——这些超级聪明的 AI 大脑可以写故事、解数学题,并像人类一样聊天。这些大脑是由数十亿个被称为“权重”的小数字组成的。为了让它们能在普通的手机或笔记本电脑上快速且廉价地运行,科学家们尝试将这些数字挤进更小的盒子中。这个过程被称为量化(quantization)

把原始的、全尺寸的数字想象成高分辨率的照片。为了节省空间,我们想把它们变成低分辨率的像素艺术。实现这一目标的标准方法叫做“最近舍入”(Round-to-Nearest, RTN)。这就像是在看一个数字,然后问:“它更接近 1 还是 2?”如果它是 1.4,我们就向下舍入为 1;如果它是 1.6,我们就向上舍入为 2。这是一个简单的、自动化的规则。但有一个棘手的地方:如果这个数字正好是 1.5 呢?或者非常接近 1.5,比如 1.48 呢?在这个“中点”位置,决策是模糊的。向下舍入或向上舍入产生的误差几乎一样,所以简单的规则只是武断地选择其中一个。在拥有数十亿个数字的海量图书馆中,做出成千上万个这种微小的、武断的猜测,可能会在无意中扰乱整个书籍的含义,让 AI 变得更笨。

这就是 ReRound 发挥作用的地方。ReRound 不再盲目地在这些棘手的中点处进行猜测,而是像一名侦探一样,观察数字周围的“邻里环境”,以确定最佳选择。它使用一种特殊的 AI 训练技术——“扩散模型”(与生成图像的扩散技术相同),来学习 AI 大脑中数字排列的隐藏模式。当它看到一个数字卡在中点时,它会询问:“基于这个数字所处的环境,它应该是向上舍入,还是应该向下舍入?”通过使用这些学到的模式来引导舍入,ReRound 可以在不重新训练整个 AI 或喂入新样本的情况下,修复标准方法产生的错误。这是一种巧妙的方法,能从更小的背包中挤出更多的准确性,让强大的 AI 触手可及,而无需昂贵的超级计算机。

更优 AI 的侦探指南

在人工智能领域,追求让模型更小、更快的探索经常会撞上一堵墙:即“中点问题”。当科学家试图缩小 AI 内部庞大的数字(这个过程称为量化)时,他们通常使用一个简单的规则:如果一个数字更接近底端,则向下舍入;如果更接近顶端,则向上舍入。但当一个数字正好处于房间中间时会发生什么呢?该论文《ReRound: Reconstructive Rounding to Resolve Midpoint Ambiguity in Calibration-Free LLM Quantization》(ReRound:通过重构舍入解决无校准 LLM 量化中的中点歧义)指出,这种“抛硬币”的行为是一种错失的机会。

作者 He-Yen Hsieh 和 H. T. Kung 来自哈佛大学,他们提出了一种名为 ReRound 的新策略。ReRound 不会在数字接近中间时盲目舍入,而是使用一种“扩散先验”(diffusion prior)——即关于原始、完美数字在被缩小前长什么样的已知推测。想象一下,你有一张模糊、像素化的猫的照片。标准的舍入规则可能会根据其直接相邻的像素来猜测一个模糊像素的颜色。然而,ReRound 使用一个经过训练的 AI(具体是一个 U-Net 扩散模型)来“幻觉”或重构整片照片应该看起来是什么样子,其依据是它从原始高质量图像中学习到的模式。

以下是魔法发生的步骤:

  1. 训练阶段: 在 AI 被缩小之前,ReRound 会先窥视模型的全尺寸、高精度权重。它将这些权重切成微小的 64x64 块,并训练一个扩散模型,使其仅通过观察低比特、模糊的版本,就能预测出原始的全尺寸块。这就像是教一名侦探仅仅通过触摸一小块模糊的布料,就能识别出特定织物的纹理。
  2. 重构: 当需要缩小模型时,ReRound 不仅仅是舍入数字。它将模糊的、低比特的数字输入到训练好的“侦探”(扩散模型)中,以生成一个“重构”后的权重版本。这并不是最终的权重,而是一个指南。这就像侦探在说:“我知道这个模糊的像素靠近中点,但根据整片区域的模式,它应该稍微高一点。”
  3. 智能舍入: 只有当标准规则真正感到困惑(靠近中点)时,ReRound 才会使用这个侦探的建议。如果一个数字明显接近底端或顶端,它会坚持使用标准规则。但如果一个数字在中间位置摇摆不定,ReRound 会检查重构后的值。如果重构结果表明应该向另一个方向舍入,且该数值距离中点的“距离”不是太大,ReRound 就会切换开关。
  4. 安全检查: 为了确保它不会因为切换了太多开关而破坏模型,ReRound 会生成几个不同版本的缩减模型,每个版本对“信任程度”的设定略有不同。然后,它通过观察矩阵的“骨架”(其奇异值)来挑选胜出者。它选择的是那个能最大限度保留原始全尺寸模型重要结构模式的版本。

结果令人印象深刻,尤其是在较小的 AI 模型上。论文显示,在将模型压缩至 3-bit 和 4-bit 精度时,ReRound 始终优于标准的“最近舍入”方法。例如,在 Gemma 2 2B 和 Gemma 3 1B 等模型上,ReRound 在各种语言任务中将准确率提高了 0.1 到 1.3 个百分点。在某些情况下,它甚至超越了那些需要“校准数据”(即喂给 AI 数千个例句来学习如何舍入)的方法,而 ReRound 在整个过程中完全没有使用额外的数据。它完全是在离线状态下工作的,仅利用模型自身的权重。

作者也谨慎地指出,这并非解决所有问题的万灵药。该方法在量化参数(如缩放比例和零点)已经固定的情况下效果最好。此外,它需要为每个特定的 AI 训练一个单独的扩散模型,这需要前期的计算时间(大约 2 到 3 小时的训练时间以及每个模型数小时的推理时间)。然而,一旦完成这些工作,实际缩小模型的过程非常快,仅需数秒到数分钟。

至关重要的是,ReRound 不会改变你的手机或笔记本电脑运行 AI 的方式。它只改变了存储在内存中的最终整数值。这意味着 AI 的运行速度与之前完全一样,但保留了更多的“脑力”。论文表明,这种使用“重构权重”作为舍入指南的方法,可以成为使 AI 变得更小、更聪明的标准方法,证明了有时最好的决策方式不是孤立地看待一个数字,而是询问它的“邻里”是如何看待它的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →