← 最新论文
🤖 machine learning

Output-Aware Rotation for INT2 KV-Cache Quantization

本文提出了 OptR,一种输出感知的旋转方法,通过逐头正交修正和键(key)重参数化来最小化投影后的注意力输出误差,从而在保持极低推理开销的同时,显著提升了大语言模型 INT2 KV 缓存量化的性能。

原作者: Vincent-Daniel Yun, Woosang Lim, Minsoo Cheong, Sunwoo Lee, Murali Annavaram, Sai Praneeth Karimireddy, Sungjoo Yoo

发布于 2026-08-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Vincent-Daniel Yun, Woosang Lim, Minsoo Cheong, Sunwoo Lee, Murali Annavaram, Sai Praneeth Karimireddy, Sungjoo Yoo

原始论文根据 CC0 1.0(http://creativecommons.org/publicdomain/zero/1.0/)发布到公有领域。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图记住一个宏大的故事并讲给朋友听。你有一个笔记本,你在上面记录下目前为止听到的每一个重要细节。故事越大,你需要的页面就越多。现在,想象你的笔记本快要用完了,而你也买不起更大的一个。为了解决这个问题,你决定缩小你的字迹。你不再写出完整、清晰的字母,而是用四个微小的符号——点、横线、圆圈和叉号——潦草地记录下来。这就像是将海量的信息压缩进一个非常小的空间。

在人工智能领域,特别是大型语言模型(LLMs)中,这些笔记本被称为“KV 缓存”(Key-Value caches)。它们存储着对话的上下文,以便 AI 能够记住之前说过的话。随着对话变得越来越长,这些缓存会变得巨大,消耗大量内存并降低速度。为了解决这个问题,科学家们尝试将数据压缩到仅 2 比特(即只使用四个等级,就像我们的四个符号一样)。但问题在于:当你把数据压得这么紧时,“离群值”(那些真正重要、不寻常的细节)会被压扁成错误的形状,导致 AI 开始犯错。这就像试图把一个巨大的、凹凸不平的土豆塞进一个很小的盒子里;土豆会被挤压变形,当你把它拿出来时,它看起来不再像你放进去时的那个土豆了。

一段时间以来,研究人员尝试通过在挤压之前旋转这个“土豆”来修复这个问题,希望将凹凸不平的部分均匀地分散开。然而,他们衡量成功标准的方式是观察盒子内部的土豆看起来有多好,而不是看 AI 稍后如何利用它来讲述故事。这项研究介绍了一种名为 OptR(输出感知旋转,Output-Aware Rotation)的新方法,它改变了游戏规则。OptR 不仅仅是试图让挤压后的数据看起来很完美,它还会检查 AI 在数据被挤压并还原后是否仍能理解故事。事实证明,通过关注最终结果,AI 即使使用这种极小的、只有四个符号的笔记本,也能记忆得更加准确。

问题所在:“挤压土豆”效应

当 AI 阅读一段长文本时,它会构建一个关于所见词汇的心理地图。这张地图存储在 KV 缓存中。为了节省空间,研究人员使用一种称为量化(quantization)的技术来缩小这张地图。最极端的版本是 INT2 量化,它将数据减少到仅有的四个可能值。这种方式效率极高——仅使用标准格式 1/8 的内存——但风险也很大。

把缓存中的数据想象成排成一列的学生。大多数学生身高适中,但有少数是巨人。如果你试图把他们都挤进一个小房间(INT2 的范围),巨人会被压扁,而普通学生也会被挤压,因为房间对巨人来说太小了。这会导致“量化误差”,即 AI 既记错了巨人,也记错了普通学生。

为了解决这个问题,以前的方法使用了旋转技术。想象一下,旋转这排学生,让他们不再直立站着,而是侧着身子倾斜。这样可以将他们的身高分布在整个房间里,使每个人更容易被容纳而不会被压扁。然而,本文指出,现有的方法犯了一个错误。他们旋转学生只是为了让他们在房间里看起来很整齐(最小化存储数据的误差),但他们并没有检查学生离开房间后是否还能正确地参加比赛。

作者指出这里存在一个偏差:那种让数据在盒子内看起来最好的旋转方式,并不一定是能让 AI 在使用该数据后表现最好的旋转方式。AI 并不在乎数据在缓存中看起来是否完美,它在乎的是最终答案是否正确。

解决方案:OptR(输出感知旋转)

该论文提出了 OptR,一种根据 AI 的最终输出而非仅仅根据存储情况来优化旋转的方法。

以下是 OptR 的工作步骤:

  1. 数据中心化(“找平”技巧): 在挤压数据之前,OptR 会减去键(keys)的平均值(即“键重参数化”)。想象一下,如果我们那排学生中的巨人其实只是站在一个高台上。OptR 降低了这个平台,让所有人都在同一水平面上站立。这不会改变彼此之间的高矮比例,但它阻止了巨人撞到小房间的天花板。至关重要的是,这一步是“注意力等效”的,这意味着它改变了数值,但保持了 AI 的注意力焦点完全不变。它缩小了数值范围,使得 INT2 挤压的过程不再那么痛苦。

  2. 学习完美的旋转(“输出感知”步骤): 不同于使用固定的旋转方式(如标准的数学旋转),OptR 为模型的每一个“头”(即 AI 大脑中的特定部分)学习一种定制的旋转。它是通过模拟整个过程来实现的:挤压数据、还原数据、运行 AI 的注意力机制,最后将其投影到最终答案。

    • 它观察最终答案中的误差(即“后 WO 注意力输出误差”)。
    • 它将这种误差分解为两个部分:由(决定了 AI 注意什么)引起的误差,以及由(决定了实际检索到什么信息)引起的误差。
    • 然后,它会对旋转角度进行微调,以最小化最终答案中的误差,而不仅仅是存储中的误差。

这就像是在调收音机。旧的方法试图让扬声器盒子内部的静电声尽可能小;而 OptR 则通过聆听从扬声器传出的音乐,并不断调整旋钮,直到音乐听起来完美无瑕,即便盒子内部的静电声并不完全消失。

研究发现

研究人员在三个不同的 AI 模型(Qwen3-4B, Qwen3-8B, 和 Phi4-14B)以及五个具有挑战性的基准测试(包括数学题 AIME25、编程任务 LiveCodeBench 以及长文本检索——即在 64,000 字的“大海捞针”)上测试了 OptR。

结果令人瞩目:

  • 巨大的准确率提升: 在 Qwen3-8B 模型上,使用标准 INT2 量化配合之前的最佳方法(QuaRot)时,在难度极高的数学测试中准确率仅为 17.33%。而加入 OptR 后,准确率飙升至 66.67%。这几乎是近四倍的提升。
  • 超越基准: 即使与已经相当优秀的当前最先进方法(OSCAR)相比,OptR 也将准确率从 54.67% 提升到了 66.00%
  • 长文本超能力: 最令人印象深刻的发现是在长文本任务中。随着故事变长(高达 64,000 个 token),标准的 INT2 方法表现糟糕,准确率趋于零。OptR 则保持了极高的检索准确率,仅从 4k token 时的 99.83% 轻微下降到 64k token 时的 70.02%,而标准方法则直接崩塌到了 0.04%
  • 无速度惩罚: 作者确认这种神奇效果并没有带来沉重的代价。他们将 OptR 集成到系统中,发现它增加的开销微乎其微。AI 的速度(延迟)和处理数据的量(吞吐量)与标准方法几乎完全一致。这就像是给汽车换了一个超强引擎,却没增加任何额外的重量。

为什么这很重要

论文表明,对于超低比特量化(如 INT2)而言,我们不能仅仅孤立地看待数据。我们必须观察数据如何流经整个系统并转化为最终答案。通过针对输出而非存储进行优化,OptR 弥合了极端压缩与高性能之间的鸿沟。

作者强调,这不仅仅是一个理论上的胜利,更是一个实际的胜利。它允许 AI 模型处理更长的对话和更大规模的用户群体,而不会耗尽内存,同时保持模型足以解决难题、编写代码的智能水平。他们不仅提出了这可能奏效,还通过跨多个模型的测量证明了这一点,从而证实了“输出感知”优化是解锁 2-bit AI 全部潜力的关键。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →