← 最新论文
🤖 machine learning

InferScale: GPU-Native KV Injection for Personalized LLM Serving

InferScale 是一个 GPU 原生内存系统,它通过将预计算并直接注入 vLLM 缓存的可重用 KV 状态,来加速个性化 LLM 服务,从而在保持高准确度的同时,实现首字延迟(TTFT)与检索上下文大小的解耦。

原作者: Peter Li, Prashant Pandey

发布于 2026-07-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Peter Li, Prashant Pandey

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个超级聪明的机器人你完整的人生故事,以便它能回答关于你的问题。每次你问机器人一个问题时,你都必须把你的整部传记粘贴进它的脑子里,它才能开始思考。如果你的传记很短,机器人思考得很快。但如果你的传记很长——充满了多年的记忆、内部笑话和过去的冒险——机器人就必须重新阅读并处理那部传记中的每一个字,才能回答一个简单的“我最喜欢的颜色是什么?”这个重新阅读的过程既慢又昂贵,就像一位图书管理员在递给你一本书之前,必须先把图书馆里的所有书都重新上架一样。这就是目前“个性化”AI的现状:你的记忆越多,它和你交流的速度就越慢。

你即将阅读的论文通过一种来自计算机科学领域的巧妙技巧——“键值缓存”(Key-Value caching)——来解决这个问题。把机器人的大脑想象成一块巨大的白板,它会在上面写下目前所读到的最重要的部分,这样它就不必重新阅读原始文本。通常情况下,如果你改变了书架上书的顺序,机器人就必须重写整个白板。但如果机器人可以从抽屉里直接取出预先写好的笔记,并瞬间将它们贴到白板上,无论你想把它们放在哪里呢?这正是这项研究的核心思想:与其强迫机器人每次都重新阅读你的记忆,不如我们预先计算好每一段记忆的“笔记”,并将它们存储在机器人超快的内部硬盘中。然后,当你提问时,我们只需将这些笔记直接“注入”到机器人的大脑中。

问题所在:“重新阅读”陷阱
今天,当你使用一个拥有长对话历史的AI助手时,系统必须找到最相关的记忆,并将它们粘贴到你的新问题中。这被称为“提示词注入”(prompt injection)。想象一下你在向一位朋友寻求建议,但每次你说话之前,都必须大声朗读你日记里的最后50页,然后才能说出你真正的问题。你读的页面越多,获取建议的时间就越长。即使你问完全相同的问题十次,这位朋友也必须把那50页读上十遍。这使得AI显得反应迟钝,尤其是随着你的个人记忆不断增长时。

解决方案:InferScale
研究人员 Peter Li 和 Prashant Pandey 构建了一个名为 InferScale 的新系统。InferScale 不再让AI重新阅读记忆,而是在你开始交谈之前就完成了所有的繁重工作。它提取每一个记忆事实(例如“我喜欢披萨”或“我的狗名叫 Rexes”),并提前计算出它们的“大脑笔记”(称为 KV states)。这些笔记被直接存储在显卡(GPU)上,也就是计算机的超快大脑。

当你提出问题时,系统不会向AI发送记忆的文本,而是从GPU中找到正确的“大脑笔记”,并将其直接注入到AI的运行内存中。这就像是一个图书馆,管理员不再是把书递给你,而是将你需要的精确段落瞬间粘贴到你的桌面上。AI永远不需要重新阅读源文本;它只需要使用这些笔记即可。

神奇的技巧
为了实现这一点,团队必须解决两个棘手的谜题:

  1. “移动目标”问题 (Chunked RoPE):
    通常,这些“大脑笔记”是与文本中的特定位置绑定的。如果你把一段记忆从故事的开头移动到中间,笔记就会出错。研究人员发明了一种名为 Chunked RoPE 的技术。想象这些笔记是写在一种特殊的纸上的,这种纸可以旋转。无论你把这张纸放在桌子的哪个位置,你都可以通过旋转它来完美匹配新的位置。这使得系统可以将存储在某一处的记忆,在不破坏数学逻辑的前提下,精准地放入对话中的任何位置。

  2. “上下文”问题 (Context-Window Encoding):
    如果你只取一个单独的句子,比如“他去了商店”,AI可能不知道“他”是谁。如果你孤立地存储记忆,就会丢失上下文。为了解决这个问题,系统会将该记忆与它之前的少量句子(例如“约翰去了商店”)一起存储。然而,它只保存特定记忆部分的“大脑笔记”,而不是整个窗口。这样,AI就能理解上下文(“他”就是约翰),而无需每次都重新阅读整个段落。

研究发现
结果令人印象深刻。研究人员在三个不同的AI模型(Llama-3.1-8B, Mistral-7B, Qwen2.5-7B)上使用了一个长对话数据集进行了测试。

  • 速度: 在旧方法(Mem0)中,随着检索记忆数量从5个增加到50个,AI开始说话的时间(首字延迟,Time-to-First-Token)增加了 106%(从 33.2 ms 跳升至 68.3 ms)。而使用 InferScale 时,同样的增加仅导致了 4% 的减速(从 16.6 ms 变为 17.3 ms)。
  • 吞吐量: 当100个人同时使用该系统时,InferScale 处理每秒问题的数量比旧系统高出 3.7 到 4.5 倍
  • 准确性: 由于系统有时会单独存储记忆,存在AI产生困惑的风险。然而,通过使用“上下文窗口”技巧,他们几乎恢复了所有的准确性。在最高记忆负载下,InferScale 的正确率达到了 60.3%,非常接近旧系统的 63.3%,但速度要快得多。

为什么这很重要
这篇论文证明了你不需要在“聪明且记忆丰富的AI”和“快速的AI”之间做选择。通过将记忆存储转移到GPU并直接注入“大脑笔记”,他们实现了AI速度与记忆大小的解耦。该系统不需要对AI模型进行重新训练,也不需要更改底层引擎,这使其成为未来个性化AI助手的实用升级方案。即使记忆数据太大无法放入快速的GPU,他们也展示了将其卸载到常规计算机内存中仍能保持系统比现有方法显著更快的速度。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →