← 最新论文
🤖 machine learning

Cache-Aware Prompt Compression:A Two-Tier Cost Model for LLM API Caching

本文介绍了缓存感知提示词压缩(Cache-Aware Prompt Compression, CAPC),这是一种结合了查询无关压缩、显式缓存控制以及层级保持边界的策略,旨在克服查询感知方法的局限性,在保持多种生产环境大语言模型(LLM)工作负载质量的同时,实现显著的成本降低(高达 90%)。

原作者: Yan Song

发布于 2026-07-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Yan Song

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在经营着一座规模宏大、极其聪明的图书馆,一位非常昂贵的图书管理员(AI)在帮你寻找答案。为了节省开支,这座图书馆有两个特别的窍门。首先是“VIP休息室”(缓存):如果你反复询问关于同一本书章节的问题,管理员就不必重新阅读整本书,只需瞥一眼他们的笔记即可,这要便宜得多。第二是“摘要器”(压缩):与其把一部500页的小说交给管理员,不如给他们一份50页的摘要,这样处理起来也更便宜。

长期以来,人们认为这两个窍门最好分开使用。你要么用“VIP休息室”来处理那些又长又枯燥的书籍,要么用“摘要器”来处理简短且棘手的问题。但问题在于,这个“摘要器”通常会为了让内容更契合新的问题,而在每次提问时对故事进行微小的改动。而“VIP休息室”却是一个极其死板的守规矩者。如果故事哪怕发生了一丁点变化,管理员就会说:“抱歉,这是一本新书!”然后扔掉之前的笔记,迫使你支付全价来重新阅读整本书。这篇论文提出了一个简单的问题:我们能否在不破坏规则的前提下,同时使用这两个窍门?

PayPal的研究人员决定在名为Sonnet 4.6的真实世界AI系统上测试这个问题。他们发现,“VIP休息室”并不像大家想象中那样完美。它有一个用于短笔记的“热区”和一个用于长笔记的“持久区”,如果你在摘要上玩得太花,就会不小心把你的笔记踢出昂贵的“热区”。他们发现,以往那种“针对每个问题都改变摘要”的做法,实际上是在浪费钱,因为它会让管理员无法重复使用那些便宜的笔记。

为了解决这个问题,他们发明了一种名为 CAPC(缓存感知提示词压缩)的新策略。你可以这样理解:与其为每个问题重写故事,不如先为那些枯燥的部分制作一份完美的、压缩过的摘要,并将其锁定在“VIP休息室”中。然后,对于每一个新问题,你只需将具体的问题添加到那个被锁定的摘要之后,而不去改变摘要本身。这就像拥有一份永远不会改变的预写剧本,这样管理员每次都能重复使用他们廉价的笔记。

结果令人惊讶。在针对16种不同类型文档的测试中,这种新方法每一次都是最省钱的选择,相比于仅使用“VIP休息室”节省了约49%,相比于旧有的“改变摘要”方法则节省了64%。他们还在现实世界的任务中进行了测试,比如一个使用工具修复计算机代码的机器人,以及一个搜索庞大知识图谱的系统。在其中一个案例中,他们在不损失任何质量的前提下,节省了超过50%的成本。在另一个案例中,他们证明了旧有的“改变摘要”方法实际上比完全不做任何处理还要贵40%,因为它不断地破坏缓存。该论文得出结论:通过聪明地决定“何时压缩”以及“缓存什么”,我们可以让AI的使用成本大幅降低,而不会让它变笨。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →