← 最新论文
🤖 machine learning

Tail-Replay: Escaping the Curse of Linear Attention in Prefix Caching for Hybrid LLMs

Tail-Replay 是一种针对混合型大语言模型的前缀缓存机制,它通过仅重放匹配前缀的一个短促且近期的后缀来重构线性注意力状态,从而实现了无约束的标记级复用,在消除对循环状态检查点需求的同时,实现了近乎完美的质量保持和显著的推理加速。

原作者: Yirui Liu, Ruoling Qi, Xuaner Wu, Penghang Liu, Jian Chen

发布于 2026-09-01✓ Author reviewed
📖 1 分钟阅读☕ 轻松阅读

原作者: Yirui Liu, Ruoling Qi, Xuaner Wu, Penghang Liu, Jian Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在现代人工智能领域,大型语言模型已成为从写作助手到复杂数据分析等各种应用背后的引擎。这些系统通过逐个标记(token)地处理海量文本来预测接下来的内容。然而,随着这些模型被要求处理越来越长的对话或文档,它们面临着一个显著的瓶颈:记住目前为止所读内容的成本。为了解决这个问题,研究人员开发了两种主要策略。一种方法涉及改变模型的内部架构使其更加高效,即使用标准记忆层与专门的、精简化的信息压缩层(用于总结信息而非存储每一个细节)相结合的混合结构。另一种策略是一种被称为“前缀缓存”(prefix caching)的系统技巧,它识别出不同用户通常会以相同的词句开始他们的请求。系统不再每次都重新阅读这些相同的开头句子,而是保存第一次处理的结果并进行复用。虽然这两种策略各自都能很好地工作,但将它们结合起来却被证明非常困难,因为精简化的记忆层无法像其标准对应层那样在任何点轻松地暂停和重启。

这种不兼容性为试图构建更快、更高效的人工智能系统的工程师们制造了一个特定的问题。当重用标准记忆层时,系统可以直接跳转到保存文本的任何一点。但这些旨在压缩信息的精简层维持着一种连续的状态,这种状态无法在不丢失其含义的情况下回溯到任意起始点。之前的解决方案尝试通过在固定间隔保存系统状态的快照来绕过这个问题,但这意味着系统只有在共享部分恰好结束于其中一个快照时才能重用文本。如果用户的请求包含一段很长的共有词句,且该段落恰好结束在快照之后不久,系统就必须丢弃匹配项并重新开始,从而浪费了效率增益。

中国电信人工智能研究院与上海交通大学的研究人员开发了一种名为“尾部重放”(Tail-Replay)的新方法来解决这一问题。他们的方法允许系统在任何位置重用共享文本,无论快照是在何处提取的。其核心思想依赖于精简化记忆层的一个特定属性:它们被设计为对近期信息赋予更高的权重,而对旧信息的权重较低。随着系统处理长文本,最初的词汇影响会逐渐减弱,而最新的词汇则主导当前状态。研究人员意识到,要重建匹配前缀的状态,系统并不需要重放该文本的整个历史。相反,它只需要重放该共享文本中最近的一小段内容。

这种新方法的工作原理是:为每一个词保存标准层的精确、详细记忆,同时省略精简层的快照。当一个新的请求到达且与之前的请求拥有较长的开头时,系统会检索匹配部分的已保存标准记忆。对于精简层,系统不再尝试寻找完美的快照,而是提取共享文本最后几个词的已保存详细记忆,并从头开始运行这些词以通过精简层进行处理。这种短促的重放能够高精度地重建必要的状态。由于系统只需要重放一小段“尾部”文本,因此过程非常迅速,且不需要存储那些以往限制了灵活性的沉重的中间快照。

团队在三种不同的混合语言模型上测试了该方法,并使用了旨在衡量长文档处理能力和复杂推理任务的标准基准测试。他们发现,通过仅重放匹配文本的5%到10%,系统就能保留其从头开始处理整个文本时所能达到的92.8%至99.9%的质量。从实际意义上讲,这意味着系统可以在不牺牲答案准确性的情况下,跳过重读数千个单词的繁重工作。结果显示,该方法在从长篇故事中回答问题到从海量数据集中检索特定事实等各类任务中,均表现出一致的稳定性。

除了准确性之外,该方法还带来了显著的速度提升。当系统被要求处理具有8,000、16,000或32,000个单词共享前缀的请求时,生成第一个答案所需的时间大幅下降。对于最长的文本,新方法比传统的重新阅读所有内容的方法快了多达14.3倍。随着文本变长,加速效果更加明显,这表明效率增益在上下文需求最严苛时最具价值。研究人员还开发了优化措施,以进一步减少在内存与处理器之间移动数据所花费的时间,确保重放过程不会成为新的瓶颈。

这项工作证明,可以在不损害性能的前提下,克服结合高效模型架构与智能缓存系统的局限性。通过理解在这些精简层中旧信息的影响会自然消退,研究人员将一个约束转化为了一个机遇。“尾部重放”方法允许系统根据词汇本身而非由任意检查点决定来自由地重用共享文本。这一进展为开发更具响应性、更高效的人工智能服务指明了方向,使其能够在无需大幅增加计算能力的情况下,应对长上下文应用日益增长的需求。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →