← 最新论文
💬 NLP

Latent-Condensed Transformer for Efficient Long Context Modeling

该论文提出了一种名为潜在凝聚注意力(LCA)的新机制,通过在多头潜在注意力(MLA)的潜在空间内直接凝聚上下文,实现了计算成本与 KV 缓存的同时降低,在 128K 长上下文下显著提升了预填充速度并减少了缓存占用,同时保持了模型性能。

原作者: Zeng You, Yaofo Chen, Qiuwu Chen, Ying Sun, Shuhai Zhang, Yingjian Li, Yaowei Wang, Mingkui Tan

发布于 2026-04-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Zeng You, Yaofo Chen, Qiuwu Chen, Ying Sun, Shuhai Zhang, Yingjian Li, Yaowei Wang, Mingkui Tan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一种名为 LCA (Latent-Condensed Attention,潜在空间凝聚注意力) 的新方法,旨在解决大型语言模型(LLM)在处理超长文本(比如整本书、长篇对话记录)时遇到的“内存爆炸”和“计算太慢”的问题。

为了让你轻松理解,我们可以把大模型处理长文本的过程想象成一位博学的图书管理员在整理和阅读一本巨大的百科全书

1. 现在的困境:书架太挤,找书太慢

想象一下,这位图书管理员(大模型)正在阅读一本有 128,000 页的巨著。

  • 问题一:书架不够用(KV Cache 爆炸)
    传统的做法是,管理员每读一页,就要把这一页的“关键信息”抄写在一张小卡片上,放在手边的书架(KV Cache)里,以便随时回顾。
    但是,书有 12 万页,书架就塞满了 12 万张卡片。书架(显存)很快就被撑爆了,导致根本读不完这么长的书。
    现有的方案(MLA): 有人发明了一种“压缩卡片”技术,把每张卡片的内容压缩成只有原来 1/10 大小。虽然书架省空间了,但卡片数量还是 12 万张,书架还是快满了。

  • 问题二:找书太慢(计算太慢)
    当管理员要回答一个问题时,他需要把当前的问题和书架上所有 12 万张卡片逐一比对,看看哪张卡片最相关。
    卡片越多,比对次数就呈平方级增长(12 万 x 12 万)。这就像要在 12 万张卡片里大海捞针,速度慢得让人抓狂。
    现有的方案(稀疏注意力): 有人建议“只挑重要的卡片看”。但这有个大问题:如果之前的卡片已经被压缩过了(像上面的 MLA),直接挑卡片会破坏压缩后的结构,导致要么无法压缩,要么把重要信息弄丢了。

2. LCA 的解决方案:聪明的“摘要”与“路标”

LCA 提出了一种全新的思路:不要试图记住每一页的细节,而是把长书分成若干章节,每章只保留一个“精华摘要”和一个“路标”。

LCA 的核心思想是把信息拆成两部分处理,就像把一张卡片分成“内容”和“位置”:

A. 语义凝聚(把内容变成“精华摘要”)

  • 比喻: 假设连续 16 页都在讲“如何种土豆”。
  • 做法: 传统的做法是保留 16 张卡片。LCA 的做法是,把这 16 页的内容融合1 张“超级摘要卡片”
  • 技巧: 它不是简单地把 16 页加起来,而是根据当前的问题,智能地给每一页打分。如果第 5 页讲得最清楚,这张摘要卡片就会更多地保留第 5 页的精华。
  • 结果: 16 页变成了 1 张卡片,书架空间瞬间释放了 15/16!而且因为保留了所有信息的加权精华,内容没有丢失。

B. 位置锚定(保留“路标”)

  • 比喻: 虽然内容可以融合,但位置不能乱。比如“第 5 页”和“第 100 页”种土豆的方法可能完全不同。如果把它们混在一起,管理员就不知道具体该参考哪一页了。
  • 做法: LCA 在融合内容时,绝不融合位置信息。它会从这 16 页里,挑出最重要的那一页(比如第 5 页),只保留它的“页码标签”(位置锚点)。
  • 结果: 管理员手里拿着“种土豆的精华摘要”,同时知道“这个摘要来自第 5 页附近”。这样既省了空间,又没搞乱时间线。

C. 最近的历史(保留“新鲜事”)

  • 比喻: 对于刚刚读过的最后几页(比如最近 1024 页),因为细节最重要,LCA 决定完全不压缩,原样保留。这就像管理员手边永远放着刚读完的那几页,随时翻看。

3. 带来的巨大好处

通过这种“分组摘要 + 保留路标 + 最近不压缩”的策略,LCA 实现了惊人的效果:

  1. 书架(显存)变小了 90%:
    原本需要存 12 万张卡片,现在只需要存几千张“精华摘要”加上最后几百页。就像把 12 万张纸压缩成了几本小册子。
  2. 找书(计算)速度快了 2.5 倍:
    管理员不需要再对比 12 万次,只需要对比几千次“摘要”和几百次“原文”。速度直接起飞。
  3. 不需要重新学习(无需额外参数):
    这个方法不需要给图书管理员(模型)增加新的脑子(参数),只需要换一种整理卡片的方法。稍微微调一下,就能直接用在现有的模型上。

4. 总结:为什么这很重要?

以前的模型处理长文本,就像是用放大镜去数沙滩上的每一粒沙子,既累又慢,还容易把沙子撒得到处都是。

LCA 就像是给管理员发了一本智能索引手册

  • 对于远处的沙子,它只记录“这里有一堆沙子,大概有这么多,位置在 A 区”(凝聚 + 锚点)。
  • 对于眼前的沙子,它依然仔细数清楚。

最终效果:

  • 省内存: 能处理以前根本读不完的超长文档(如整本小说、法律条文)。
  • 速度快: 生成回答的速度大幅提升。
  • 不丢分: 即使压缩了,理解能力和回答准确率依然和没压缩时一样好。

这篇论文就是告诉我们要学会“抓大放小,保留关键路标”,让大模型在长文本的世界里也能跑得飞快。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →