← 最新论文
🤖 machine learning

When Local Variance Optimality Is Not Enough: RoPE-Aligned Q/K Rotations for Dynamic 4-Bit Quantisation

本文表明,尽管在严格的交换性约束下,与 RoPE 对齐的两两旋转在最小化特定池化方差代理指标方面在解析上是最优的,但由于该代理指标的假设与量化器所使用的逐标记统计特性之间存在根本性的失配,它们无法比全头哈达玛变换提升动态 4 位量化的精度。

原作者: Shuhan Wang, Yilin Luo, Nan Xu, Chi Wang Cheung

发布于 2026-08-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Shuhan Wang, Yilin Luo, Nan Xu, Chi Wang Cheung

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图将一团巨大的、蓬松的数据云塞进一个微小且僵硬的盒子里。这就是为了让庞大的人工智能(AI)模型能够运行在普通电脑或手机上,从而使其变得更小、更快的日常挣扎。为了实现这一点,科学家们使用了一种叫做“量化”(quantization)的技巧,这就像是将云朵压缩成较低的分辨率。但问题在于,这团云中存在一些超级明亮、超级沉重的点,被称为“离群值”(outliers)。如果你不加小心地压缩整个云团,这些沉重的点会被压碎,导致 AI 开始犯傻。

为了解决这个问题,研究人员一直在使用一种叫做“旋转”(rotation)的方法。想象一下这团云是由无数根意面组成的。如果你只是单纯地挤压整捆意面,粗壮的线条就会断裂。但如果你先扭转这捆意面,就可以将厚度均匀地分散开来,从而更容易进行挤压而不至于损坏。一种流行的扭转这些线条的方法是基于所谓的“RoPE”(旋转位置嵌入),它就像一本特殊的说明书,告诉 AI 如何理解句子中词语的顺序。这本说明书自然地将意面分成了成对连接在一起的线条。

核心问题在于:当我们为了让数据适配而进行扭转时,我们应该一次性扭转整捆线条,还是应该只扭转说明书中指定的那些特定配对的线条?从逻辑上看,尊重说明书中的配对似乎会更好,对吧?作者们着手测试这个想法,希望能找到一种更聪明、更高效的扭转数据的方法。

失败的扭转

研究人员 Shuhan Wang、Yilin Luo 及其团队决定对这个“成对扭转”的想法进行实测。他们建立了一个数学理论,证明如果你想以一种完美契合 RoPE 说明书的方式来扭转数据,你在数学上就被迫只能扭转那些特定的配对线条。他们甚至计算出了扭转每一对线条的最佳角度,以使数据的“可挤压性”(方差)降到最低,从而创造出一个在理论上对于该特定配对而言是最优的局部解。

然而,当他们真正将此应用于现实世界中的动态 4 位量化(一种特定的缩小数据的方法)时,结果却是一个剧情反转。尽管他们进行了完美的数学计算,但这种“仅限成对”的方法实际上让 AI 对语言的理解能力变差了,相比于以前那种扭转整捆线条的方法。

在针对包括 Llama 和 Mistral 在内的四种不同 AI 模型的实验中,用这种新的“成对扭转”取代原有的“全头扭转”(full-head twist),增加了模型的困惑度。论文使用一个叫做“困惑度”(perplexity)的分数来衡量这种困惑。困惑度越高,意味着模型越迷茫。他们发现,成对扭转法使模型的困惑度增加了 0.05 到 1.33 点不等。例如,在 Llama-3.2-1B 模型上,成对扭转法比标准方法让模型多出了 1.33 点的困惑。即使他们尝试通过只观察被挤压的数据(“K”流)来修正数学计算,成对扭转法仍然无法赶上全头扭转法。

为什么完美的数学失效了?

作者们意识到,问题不在于他们的数学错了,而在于他们的数学是在为所使用的特定工具解决一个“错误”的问题。

可以这样理解:研究人员设计了一把钥匙(成对旋转),它能完美契合一把特定的锁(数据对的数学方差)。但他们试图打开的门(量化器)使用的并不是这把锁。那扇门使用的是完全不同的机制:它观察的是跨越更大一组线条的数据范围,而不仅仅是微小的配对。

论文解释说,“成对”方法的能力仅限于通过两条线条来分散一个沉重的点。但“全头”方法可以将那个沉重的点分散到 128 条线条中(或者该模型中的任何数量)。这就像试图压平一块巨大的岩石。如果你只有一个只能同时击中两个点的锤子,你一定会留下凸起;但如果你有一个可以同时击中整块岩石的锤子,你就能将其完全压平。这里的“混合支持”(mixing support)——即扭转可以影响的线条数量——才是真正的关键。正如作者测试了将越来越大的线条块(从 2 到 128)进行扭转时所看到的,他们可以混合的线条越多,模型就越不困惑。

启示

主要的教训是:仅仅因为一种方法在遵循某一特定规则(如尊重 RoPE 配对)方面在数学上是完美的,并不意味着它在实际任务(将数据放入微小盒子)中表现最好。作者发现,对于动态量化而言,将数据在整个线条组中进行混合和分散的能力,比严格遵守 AI 架构的结构化规则更为重要。

他们并没有找到一种更好的扭转数据的新方法;相反,他们发现了一个非常清晰的原因,解释了为什么一种看似更聪明、更有结构的方案实际上失败了。“局部”的完美(成对扭转)无法战胜“全局”的优势(全头扭转)。最后,论文表明,在设计这些 AI 工具时,我们需要确保我们的数学目标与我们正在使用的量化器的实际规则相匹配,而不是仅仅假设遵循 AI 架构的结构规则会自动带来更好的结果。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →