← 最新论文
💬 NLP

End-to-End Context Compression at Scale

本文介绍了潜在上下文语言模型(Latent Context Language Modelss, LCLMs),这是一个在海量数据集上训练的编码器-解码器压缩器家族,通过降低内存使用量和压缩时间,同时保持高模型质量,显著提升了长上下文推理的准确率-效率前沿。

原作者: Ang Li, Sean McLeish, Haozhe Chen, Nimit Kalra, Zaiqian Chen, Artem Gazizov, Venkata Anoop Suhas Kumar Morisetty, Bhavya Kailkhura, Harshitha Menon, Zhuang Liu, Brian R. Bartoldson, Tom Goldstein, San
发布于 2026-06-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Ang Li, Sean McLeish, Haozhe Chen, Nimit Kalra, Zaiqian Chen, Artem Gazizov, Venkata Anoop Suhas Kumar Morisetty, Bhavya Kailkhura, Harshitha Menon, Zhuang Liu, Brian R. Bartoldson, Tom Goldstein, Sanae Lotfi, Micah Goldblum, Pavel Izmailov

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一个才华横溢、超级聪明的助手(一个大语言模型),他可以阅读数百万页的文本。问题在于,他的“工作记忆”非常小(就像一个微型笔记本)。每当你给他们一份长文档阅读时,他们必须把每一行字都写在那个笔记本上才能记住。如果文档太长,笔记本就会填满,助手会感到不堪重负,整个过程会变得极其缓慢且昂贵。

这篇论文介绍了一种名为 潜性上下文语言模型 (Latent Context Language Models, LCLMs) 的新工具来解决这个问题。你可以把 LCLMs 想象成一个位于你和助手之间的超高效“总结专家”或“压缩专家”

以下是它的工作原理,使用简单的类比:

1. 问题所在:“笔记本”瓶颈

目前,如果你要求 AI 阅读一本 100 页的书,它会尝试将这 100 页中的每一个字都保留在它的活跃记忆中(KV 缓存)。

  • 类比: 想象一下,你在跑马拉松时试图在口袋里揣着一本 100 页的书。这很重,会减慢你的速度,最终你的口袋会被撑破(内存耗尽)。
  • 旧方案: 以前的方法试图扔掉它们认为不重要的页面(比如删除章节),或者尝试缩小字体。但这些方法往往会导致助手忘记关键细节,或者需要花费大量时间去“编辑”这本书,因此并不划算。

2. 解决方案:“智能压缩” (LCLM)

作者创建了一个系统,它不仅仅是删除文字,而是将书翻译成一种高度浓缩的秘密代码。

  • 编码器 (翻译官): 这是一个更小、更专门的 AI,它逐块(例如按段落)读取你的文本,并将其转化为单个、稠密的“思想标记 (thought token)”。
    • 类比: 与其给助手整本 100 页的书,不如让编码器读完一页,然后只写下一个完美的句子来捕捉这一页的全部含义。它对整本书进行此操作,将 100 页变成仅仅 10 个句子。
  • 解码器 (助手): 这是你想使用的主要 AI。它接收的是这 10 个压缩后的句子,而不是那 100 页的内容。因为“笔记本”现在变得小得多,助手可以瞬间阅读它,消耗更少的能量,并且依然能理解故事。

3. 它是如何构建的(“配方”)

作者并非凭空猜测如何构建它;他们测试了数千种变化,以找到完美的配方。

  • “均值 (Mean)” vs. “拼接 (Concat)” 测试: 他们尝试了不同的组合信息的方式。
    • 类比: 想象你拥有 16 种食材来做汤。
      • 选项 A (拼接/Concat): 你把所有 16 种食材分开放在一个大碗里。
      • 选项 B (均值/Mean): 你把所有 16 种食材搅拌在一起,变成一碗浓郁顺滑的肉汤。
    • 他们发现,对于非常长的文本,混合它们 (均值池化/Mean Pooling) 效果最好,能创造出一种平滑、信息密集的“浓汤”,让助手能够轻松消化。
  • 训练: 他们通过向系统喂入海量数据(3500 亿个单词)来教导这个系统,在阅读普通文本和阅读压缩文本之间交替进行。这教会了系统即使在被缩减的情况下,也能保留原始文本的“风味”。

4. 结果:更快、更轻、更聪明

论文声称他们的系统开创了一个“新前沿”,让你获得两全其美:

  • 速度: 处理长文档的速度显著提升。
    • 类比: 与其在图书馆里走来走去寻找一本书,LCLM 给出了一个直接指向正确书架的地图。
  • 内存: 它使用的计算机内存要少得多。
    • 类比: 你现在可以用背包背起整个图书馆,而不是用手推车。
  • 准确度: 不同于那些会让助手变“笨”或健忘的旧方法,LCLMs 保持了助手的高智能。它们仍然可以回答棘手的问题,并找到隐藏在文本中的特定细节。

5. “智能体 (Agent)”功能:“展开”按钮

论文还展示了这如何应用于 AI 智能体(执行任务的机器人)。

  • 场景: 假设一个智能体需要在庞大的代码库(一个巨大的软件项目)中寻找一个特定的漏洞 (bug)。
  • 技巧: 智能体首先阅读整个代码库的压缩版本,以获得“鸟瞰图”。它看到了整体结构,并大致知道问题可能在哪里。
  • “展开 (Expand)”工具: 一旦智能体在压缩视图中发现了可疑区域,它可以按下**“展开”**按钮。系统随后会将那个特定的小块重新解压回完整的、详细的文本,以便智能体能够精确地修复漏洞。
  • 类比: 这就像是先看城市地图来找到正确的街区,然后放大查看具体的街道地址。你不需要同时观察城市里的每一条街道;只有当你需要时才进行放大。

总结

该论文提出了一种处理海量文本的新方法。与其强迫 AI 携带沉重、笨拙的原始数据负载,不如使用一个聪明的“压缩专家”将数据缩减为轻量级、高质量的摘要。这使得 AI 能够以更快的速度、更少的内存处理更长的文档,同时不会丧失理解细节的能力。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →