想象一位才华横溢但健忘的图书管理员,试图基于一本庞大且无尽的书籍来回答问题。为了完成工作,这位管理员会保留一个“草稿纸”(称为KV 缓存),其中记录了他迄今为止读过的最重要部分。
问题在于:随着书籍变长,这张草稿纸会变得巨大无比。最终,管理员的桌面空间(内存)耗尽,他们不得不扔掉一些页面以腾出空间容纳新页面。
旧方法:“非此即彼”的垃圾桶
过去,图书管理员使用一条简单的规则:“如果某页此刻不是超级重要,就永远把它扔进垃圾桶。”
- 问题所在:这就像仅仅因为你“这一秒”没在看某页,就把它扔掉。即使你不需要立即使用它,那页可能包含一个你稍后很容易猜出或重构的事实。通过将其完全丢弃,你永久地丢失了该信息。
新方法:VECTOR(“三抽屉”系统)
这篇论文介绍了VECTOR,这是一个新系统,它为图书管理员提供了三个不同的抽屉,而不仅仅是“保留”或“丢弃”。
- “保留”抽屉(保留):对于最关键的页面(如主角的名字或情节转折),管理员保留原始、完美的副本。
- “丢弃”抽屉(驱逐):对于真正无关紧要的页面(如章节中间的随机广告),它们会被完全扔掉。
- “草图”抽屉(近似):这是神奇的创新步骤。对于那些有些重要但非关键的页面,管理员不会直接丢弃。相反,他们扔掉全文,但保留一个简单草图或数学提示,以便在需要时重新绘制该页面。
“草图”如何运作?
论文解释说,在这些 AI 模型中,“键”(页面标签)和“值”(实际内容)在数学上是相互关联的,就像锁和钥匙一样。
- 洞察:“键”非常敏感;如果弄错了,管理员就会困惑该去哪里查找。但“值”(内容)则更具包容性。
- 技巧:VECTOR 会安全地保留“键”。然后,它使用一个预计算的数学公式(称为OLS),根据该“键”来推测“值”应该呈现的样子。
- 结果:如果猜测准确(论文证明通常如此),管理员通过仅存储“键”和公式,而不是完整且庞大的文本,从而节省了巨大的空间。如果猜测不佳,他们则保留完整文本。
“三方”决策过程
当管理员需要腾出空间时,VECTOR 会对每一页提出两个问题:
- 这页重要吗?(如果否 → 将其丢弃)。
- 如果它重要,我们能轻易根据其标签重新绘制它吗?
- 如果是(易于重绘)→ 放入**“草图”抽屉**(节省空间)。
- 如果否(难以重绘)→ 保留完整副本(保证准确性)。
他们发现了什么?
作者在几个具有严格内存限制的 AI 模型上测试了这种方法(就像试图把整本百科全书塞进鞋盒里)。
- 结果:通过使用这个“草图”抽屉,模型的运行表现比以往任何时候都好,尤其是在内存极度紧张的情况下。它们能够记住更多细节,并在不需要更多计算机内存的情况下更准确地回答问题。
- 局限:当管理员本身对保留内容已经极其挑剔时,该方法效果最佳。如果管理员已经只保留最完美的页面,那么就没有太多空间来使用“草图”技巧了。
一句话总结
VECTOR是 AI 内存管理的一项智能升级。它不再仅仅决定“保留”或“丢弃”,而是增加了一个中间选项:“保留一个提示,以便我们稍后重建它。”这使得 AI 模型能够处理更长的故事和更复杂的任务而不会耗尽内存,仅仅是因为它们对丢弃的内容变得更加聪明。
技术摘要:VECTOR
问题陈述
大型语言模型(LLM)在长上下文推理中面临关键瓶颈,即键值(KV)缓存内存随序列长度线性增长。这种内存成本限制了其在需要长上下文窗口的应用中的实际部署,例如检索密集型问答、智能体工作流和多轮推理。
现有的 KV 缓存压缩方法通常分为两类,但两者均存在局限性:
- 基于重要性的淘汰:如 SnapKV 和 KeyDiff 等方法对 token 进行评分并永久丢弃低分条目。虽然高效,但这种二元决策(保留或淘汰)是不可逆的。在内存预算紧张的情况下,这可能导致性能显著下降,因为那些虽非必须精确保留但可重构的 token 被丢弃了。
- 表示近似:如 AQUA-KV 和 EliteKV 等方法通过量化或投影压缩 KV 表示。然而,许多方法需要架构修改、重新训练或昂贵的在线计算(例如基于检索的重构)。
此外,现有的多状态分配方法(如 ARKV、D2O)改进了二元淘汰,但仅依赖 token 重要性信号。它们未能显式建模可重构性——即一个 token 的 KV 表示能否在有限误差下从其他可用信息中准确恢复。此外,尽管 prior 工作指出,由于 softmax 注意力机制中误差的非线性放大,值(V)通常比对键(K)更能容忍近似,但大多数 token 级压缩方法并未在内存分配中显式利用这种不对称性。
方法论:VECTOR
作者提出了VECTOR(基于共线性与三向正交路由的值估计),这是一种用于基于淘汰流水线的即插即用增强方案。VECTOR 引入了一种三向 token 路由机制:保留、近似和淘汰。
核心机制
非对称处理(K 与 V):
- 键(K):候选池中所有 token 的键均被精确保留。这保持了注意力路由机制的完整性,因为键的扰动会被 softmax 函数指数级放大。
- 值(V):接受三向决策。
- 保留:对高重要性或难以重构的 token 进行精确存储。
- 近似:对具有高可重构性的 token 进行丢弃并在线重构。
- 淘汰:对低重要性 token 进行永久移除。
基于 OLS 的可重构性:
- 该方法利用了 K 和 V 共享的内在低秩结构(两者均为同一隐藏状态的线性投影)。
- 它采用离线校准的**普通最小二乘法(OLS)**回归模型,从 K 预测 V(V≈WOLSK)。
- 为处理旋转位置编码(RoPE),该方法在重构前对键应用逆旋转,解耦位置信息,使静态的 WOLS 矩阵能在所有位置上工作。
三向分配流水线:
给定目标压缩率 pc 和近似率 pa:
- 步骤 1(预算放宽):基础淘汰算法识别出大小为 1−pc+pa 的扩展候选池。
- 步骤 2(残差评估):计算该池中每个 token 的重构误差 ϵi=∥Vi−WOLSKi∥2。
- 步骤 3(非对称截断):
- 所有 1−pc+pa 个 token 的键均被保留。
- 重构误差最低的 2pa 个 token 的值被丢弃,并通过 WOLSK 进行重构。
- 剩余的 1−pc−pa 个 token 同时保留精确的 K 和 V。
- 这确保了总内存占用量符合 1−pc 个完整 KV 对的目标预算。
主要贡献
- 感知可重构性的分配:本文将 KV 压缩重新框架化为统一的“保留 - 近似 - 淘汰”问题,联合考虑 token 重要性和可重构性,而非二元决策。
- 轻量级 K→V 重构:一次离线 OLS 校准即可实现从存储的键中在线重构值,推理时开销可忽略且无需模型重新训练。
- 即插即用集成:VECTOR 可附加到现有的 token 重要性淘汰方法(包括查询感知和查询无关方法),只需最小化适配。
- 理论分析:作者推导了扩展近似层级以减少信息损失的条件,将所需的 OLS 预测质量(Rapprox2)与重要性分数分布的偏度联系起来。
实验结果
实验在 LongBench(16 个任务)和 Needle-in-a-Haystack(NIAH)上进行,使用了 Llama-3.1-8B、Qwen3-14B 和 Qwen3-0.6B 模型。
- 高压缩增益:VECTOR 在高压缩区域(pc∈{0.75,0.90})持续提升下游性能。
- 查询无关基线:在 KeyDiff 和 KVzip 上观察到最显著的增益。例如,在 Qwen3-14B 配合 KeyDiff 的情况下,VECTOR 在 pc=0.50 时平均分数提升 +7.03,在 pc=0.75 时提升 +9.15,在 pc=0.90 时提升 +9.73。
- 查询感知基线:在 SnapKV 和 PyramidKV 上的提升较为温和,特别是在中等压缩下,因为这些方法已经保留了最相关的 token,留给近似的“余地”较少。但在 pc=0.90 时观察到了持续的增益。
- 鲁棒性(NIAH):在 pc=0.90 的 NIAH 压力测试中,VECTOR 持续提升了检索质量。它将失败模式从大范围的连续低分区域转变为更局部的困难单元,表明鲁棒性有所提高。
- 敏感性:性能在中等近似率(pa)时达到峰值。如果 pa 过低,可恢复的信息会丢失;如果过高,保留层级会缩小,迫使难以重构的 token 进入近似层级。
意义与主张
本文主张,VECTOR 通过结合感知重要性的淘汰与感知可重构性的近似,展示了长上下文推理系统的一个有前景的方向。
- 效率:它恢复了在二元淘汰下本会不可逆丢失的有用值信息,同时保留键向量以维持注意力稳定性。
- 实用性:该方法无需架构更改或重新训练,使其成为现有系统的实用增强方案。
- 权衡优化:在严格的内存预算下,VECTOR 实现了更优的质量 - 内存权衡,特别是对于那些仅依赖上下文内在评分(查询无关)的方法,其中重要性和可重构性捕捉了效用中相互正交的维度。
作者承认了局限性,指出近似率 pa 目前是通过经验公式设定而非动态优化,且相对于查询感知基线的提升受限于这些方法本身的高基线性能。未来的工作可以探索自适应分配策略。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。