← 最新论文
🤖 machine learning

SPECTRA: Pushing the KV Cache Beyond the 2-Bit Cliff via Spectral Transform Coding

SPECTRA 是一种无需训练、即插即用的编解码器,它通过应用谱变换编码来使特征去相关,并将比特预算集中在最具信息量的通道上,从而克服了 LLM KV 缓存中的 2 比特量化悬崖,实现了高达 12 倍的高保真压缩比,用于长上下文推理。

原作者: Jiamu Zhang, Liang Wu, Kelly Wan, Hanjie Chen, Liangjie Hong

发布于 2026-08-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Jiamu Zhang, Liang Wu, Kelly Wan, Hanjie Chen, Liangjie Hong

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图背着一个装满大量书籍的背包。在人工智能领域,特别是那些能写故事、写代码并与我们聊天的“大语言模型”(LLMs)中,也存在着类似的问题。当这些模型阅读长文档或进行长对话时,它们必须记住之前看到的每一个词,才能理解下一个词。它们将这种记忆存储在一个特殊的、高速的口袋里,叫做“KV 缓存”(Key-Value cache)。你可以把这个缓存想象成一个随身携带的笔记本,模型在上面记录下它所读到的所有重要细节。

麻烦在于,随着对话的进行,这个笔记本会变得越来越大。如果你试图把一整部小说都塞进你的背包,可能还没读完第一章,空间就会用尽。为了解决这个问题,科学家们尝试通过使用更小、更简单的笔迹来缩小笔记本,这种技术被称为“量化”。他们尝试将每一条笔记压缩到仅剩两个比特(即最小的数据单位)的信息。但问题在于,当他们尝试比两个比特更小的尺寸时,笔迹变得极其混乱,导致模型开始遗忘内容或胡言乱语。它撞上了一个“悬崖”,即一旦笔记变得过小,模型就会崩溃。这篇论文提出了一个简单的问题:有没有一种更聪明的方法来打包背包,让我们能在不让模型感到困惑的情况下,装入更多的内容?

开发 SPECTRA 的研究人员表示,答案是肯定的,但我们需要改变的是“我们在打包什么”,而不仅仅是“我们如何写得更小”。他们发现,模型的记忆信息并不是像一堆随机的石头那样均匀分布的。相反,它就像一个音乐和弦:少数音符响亮且承载着旋律,而其他大多数音符则几乎听不见,只是微弱的背景噪音。

以往方法的问题在于,它们对每一个音符一视同仁。它们试图以完全相同的程度去缩小响亮的音符和安静的音符。当他们试图将所有东西都缩小到只有一颗小石子(两个比特)的大小时,响亮的音符被挤压成了安静的音符,整个乐曲变成了杂音。作者意识到,模型的记忆是“相关的”,这意味着音符是纠缠在一起的,这使得仅凭观察很难分辨出哪些是重要的。

为了解决这个问题,SPECTRA 扮演了一个神奇解码环的角色。在打包记忆之前,它首先将音符解开纠缠,并将它们重新排列成一种新的顺序,在这种顺序下,响亮的、重要的音符与安静的、不重要的音符被清晰地分隔开来。一旦记忆按这种方式排序,模型就可以对响亮的音符非常慷慨(给它们充足的空间以保持清晰),而对安静的音符则非常吝啬(将它们压缩到几乎不存在,甚至完全丢弃)。

论文显示,这种方法效果惊人。在对 Llama-3.1 和 Qwen2.5 等流行 AI 模型的测试中,SPECTRA 在不损失任何质量的情况下,实现了 4 倍的记忆压缩。更令人印象深刻的是,它在 8 倍甚至 12 倍压缩时依然保持可用,而在此水平下,其他方法早已完全崩溃且模型停止工作。通过使用这种“频谱”排序技巧,原本只能处理短对话的同一块计算机芯片,现在可以装下一整本书或庞大的代码库,从而让 AI 智能体能够在不耗尽内存的情况下处理更长的任务。作者发现,这不仅仅是一个小小的改进;它是一个根本性的转变——从试图平等地缩小一切,转变为智能地将有限的空间仅花在最重要的地方。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →