← 最新论文
💬 NLP

Compressing Sequences in the Latent Embedding Space: KK-Token Merging for Large Language Models

本文提出了一种名为"K-Token Merging"的潜在空间压缩框架,通过将连续 K 个 Token 嵌入合并为单个嵌入,在显著降低大语言模型处理长序列计算成本的同时,实现了高达 75% 的输入长度缩减且仅带来极小的性能损失。

原作者: Zihao Xu, John Harvill, Ziwei Fan, Yizhou Sun, Hao Ding, Hao Wang

发布于 2026-04-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Zihao Xu, John Harvill, Ziwei Fan, Yizhou Sun, Hao Ding, Hao Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一种让大型语言模型(LLM)“变聪明、跑得快”的新方法,叫做 K-Token Merging(K 词合并)

为了让你轻松理解,我们可以把大语言模型想象成一个超级繁忙的图书馆管理员,而用户输入的提示词(Prompt)就是借书清单

1. 现在的痛点:清单太长,管理员累坏了

想象一下,如果你给管理员一张长达 100 页的借书清单,上面密密麻麻写满了书名。

  • 传统做法:管理员必须一页一页、一个字一个字地读完这 100 页,才能开始找书。
  • 问题:随着清单变长,管理员的工作量不是线性增加,而是指数级爆炸(就像你要在 100 页里找书,每多一页,他需要对比的次数就翻倍)。这导致处理长文本时,电脑内存不够用,速度也慢得像蜗牛。

2. 以前的尝试:粗暴删减 vs. 换个说法

为了解决这个问题,以前的科学家尝试过两种方法:

  • 硬压缩(Hard Compression):就像让管理员直接撕掉清单上他觉得“不重要”的页码。
    • 缺点:有时候被撕掉的页码里藏着关键信息(比如“不要红色的书”),结果管理员找错了书。
  • 软压缩(Soft Compression):让管理员学会用缩写暗号来记录清单。
    • 缺点:这些方法大多还是在“词”的层面上做文章,没有触及到更深层的“含义”层面。

3. 这篇论文的新招:K-Token Merging(打包合并)

这篇论文提出了一种更聪明的办法:不要删词,也不要改词,而是把连续的词“打包”成一个超级压缩包。

📦 核心比喻:快递打包

想象你的借书清单是:

“苹果、香蕉、橙子、葡萄、西瓜、哈密瓜……"

  • 传统管理员:要把这 6 个词一个个读进去,记在脑子里。
  • K-Token Merging 管理员
    1. 他有一个智能打包机(论文里的“轻量级编码器”)。
    2. 他把连续的 K 个词(比如每 4 个词)扔进打包机。
    3. 打包机“咔嚓”一下,把这 4 个词压缩成一个超级包裹(一个压缩后的向量)。
    4. 现在,原本 100 页的清单,可能只需要 25 个“超级包裹”就能装下!

🧠 为什么这招这么厉害?

这就好比,虽然清单变短了,但包裹里的信息一点没少

  • 不丢信息:以前的“硬压缩”是扔掉词,这里是把词“压缩”了。就像把衣服塞进真空袋,体积变小了,但衣服还是那件衣服。
  • 适应性强:这个打包机是专门训练过的,它知道怎么把“苹果、香蕉、橙子、葡萄”打包成一个能代表“水果”概念的包裹。
  • 生成时恢复原状:当管理员开始找书(生成回答)时,他依然输出正常的、完整的词(比如“苹果”),而不是输出“包裹”。所以用户看到的回答和以前一样自然。

4. 实验结果:又快又好

作者在三个不同的“考场”测试了这个方法:

  1. 逻辑推理(树状图):就像在复杂的家族树里找亲戚关系。
  2. 情感分析(亚马逊评论):判断评论是夸还是骂。
  3. 代码修改(CommitPackFT):根据指令修改代码。

结果令人震惊:

  • 他们成功把输入长度缩短了 75%(100 页的清单变成了 25 页)。
  • 但是,管理员的准确率几乎没有下降(只掉了不到 2%)。
  • 这意味着,电脑处理这些任务时,计算量减少了 94%!就像原本需要跑 100 公里的马拉松,现在只需要跑 6 公里就能到达终点。

5. 总结:给大模型装上“压缩引擎”

这篇论文的核心思想就是:大模型在处理输入时,其实浪费了很多空间。 就像我们说话时,很多词连在一起其实可以概括成一个概念。

K-Token Merging 就像给大模型装了一个智能压缩引擎

  • 输入时:把长长的句子压缩成短小的“压缩包”。
  • 思考时:用更少的内存和算力去处理这些压缩包。
  • 输出时:解压并输出完美的回答。

一句话总结
这就好比给大语言模型戴上了一副“透视眼镜”,让它能一眼看穿长文本的本质,把冗长的废话打包扔掉,只保留核心精华,从而跑得更快、更省内存,而且还能保持极高的智商。这对于未来处理超长文档、长视频分析等任务来说,是一个巨大的进步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →