← 最新论文
💻 computer science

A Survey of Token Compression for Efficient Multimodal Large Language Models

本文介绍了首个针对高效多模态大语言模型中 Token 压缩技术的系统性综述,通过根据其目标模态(图像、视频和音频)以及底层机制对现有方法进行分类,以整合当前进展并指导未来的研究。

原作者: Kele Shao, Keda Tao, Kejia Zhang, Sicheng Feng, Mu Cai, Yuzhang Shang, Haoxuan You, Can Qin, Yang Sui, Huan Wang

发布于 2026-02-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Kele Shao, Keda Tao, Kejia Zhang, Sicheng Feng, Mu Cai, Yuzhang Shang, Haoxuan You, Can Qin, Yang Sui, Huan Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你有一个超级聪明的助手(一个多模态大语言模型,简称 MLLM),它能阅读文本、观察图片、观看视频并聆听音频。这个助手才华横溢,但它有一个重大问题:当你一次性给它太多信息时,它会感到不堪重负。

把助手接收到的信息想象成一种“标记”(tokens,即数据的微小块)的流。

  • 文本提示词就像一封短小的信件。
  • 高分辨率照片就像是一封被放大成巨大的、细节丰富的壁画的信件。
  • 视频就像是成千上万张这样的壁画组成的图书馆,每一秒都在变化。
  • 音频就像是连续的高速声波流。

当你给这个助手喂进一部 90 分钟的电影时,它看到的不仅仅是“一部电影”。它看到了 5400 万个标记。这就像是试图在一次呼吸间读完一整个图书馆的书籍。助手的“大脑”(它的“自注意力”机制)必须将每一个标记与所有其他标记进行比较。这种计算量增长得极其迅速且沉重,以至于计算机要么耗尽内存,要么需要花费极长的时间才能给出答案。

解决方案:标记压缩 (Token Compression)
这篇论文是一本宏大的指南(综述),讲述了如何教这个助手变得更高效,同时又不失其聪明才智。作者们称之为 标记压缩。

把标记压缩想象成 为旅行收拾行李。

  • 问题在于: 你的行李箱里装满了衣服,但其中 80% 都是重复的(比如 50 件一模一样的白色 T 恤)或者是不需要的(比如去海滩度假却带了厚重的冬装)。
  • 目标是: 你希望把所有重要的东西都装进一个更小的包里,以便你可以更快地旅行,同时又不会丢掉任何真正需要的东西。

这篇论文将目前所有的“打包”方法归纳为两个主要维度:数据是什么类型的? 以及 如何打包?

1. 按数据类型分类(“是什么”)

不同类型的数据有不同种类的“杂乱”(冗余)。

  • 图像(静态照片):
    • 杂乱之处: 一张蓝天的照片可能有数百万个完全相同的蓝色像素。
    • 解决方法: 计算机不再发送每一个蓝色的像素,而是将它们组合在一起。它会说:“这一整块区域只是蓝天”,然后发送一个标记来代表整个区域。
  • 视频(动态图像):
    • 杂乱之处: 在一段人说话的视频中,背景(墙壁或树木)在 10 秒钟内保持不变,而人却在轻微移动。
    • 解决方法: 计算机意识到:“我们不需要每秒钟发送 30 次背景。” 它保留背景,只发送运动部分的更新。这就像是发送一份“变更日志”,而不是重新发送整个场景的每一帧。
  • 音频(声波):
    • 杂乱之处: 语音录音通常会有长时间的停顿、沉默或不增加意义的背景杂音。
    • 解决方法: 计算机切除沉默部分并合并相似的声音,只保留人声说话或音乐变化的片段。

2. 按方法分类(“怎么做”)

论文将用于这种“打包”的技术分为四种主要策略:

  • “缩放射线”(基于变换):
    想象一下,你拿出一张高分辨率照片并直接将其缩小。你会丢失一些细节,但保留了大致的形状和颜色。这是通过数学方式压缩数据(如池化或平均化)来缩短标记列表。
  • “分组游戏”(基于相似性):
    想象你有一堆 1,000 个红色乐高积木。与其列出所有 1,000 个,不如说:“这里有一个红色的积木,还有 999 个和它几乎一样的。” 计算机寻找看起来或听起来非常相似的标记,并将它们合并为一个单一的“代表性”标记。
  • “聚光灯”(基于注意力):
    想象一位老师在观察教室。老师只关心那些举手的学生(重要的标记),而忽略那些在后排睡觉的学生。计算机查看它自己的“注意力分数”(它对每块数据的关注程度),并丢弃那些它本来就在忽略的标记。
  • “问题指南”(基于查询):
    想象你在草堆里寻找一根特定的针。你不是在看每一根草,而是问:“针在哪里?” 计算机使用你的问题(查询)来过滤掉所有与你询问内容不匹配的东西,只保留相关的标记。

为什么这很重要

作者解释说,这不仅仅是为了让计算机运行得更快,更是为了让它们可用。

  • 如果没有压缩,目前的模型无法实时处理一部 90 分钟的电影。
  • 有了压缩,模型可以“观看”电影,理解剧情,并回答相关问题,同时仅使用极小部分的内存。

难点(挑战)

论文也警告说,这并非魔法。如果你把行李箱塞得太紧:

  • 你可能会丢失细节: 如果你过度压缩一张照片,你可能会错过背景中一个微小但重要的标志。
  • 它会破坏流畅度: 在视频中,如果你合并了过多的帧,动作可能会看起来很卡顿或令人困惑。
  • 它很难适配: 一些这些“打包”技巧很难与当今最快的计算机芯片配合使用,因为它们需要计算机以不同的方式停止并进行计算。

总结:
这篇论文是研究人员的一份地图。它说:“我们遇到了一个问题:我们的 AI 正淹没在过量的数据中。以下是我们尝试教它如何过滤、分组和压缩这些数据,以便它能在现实世界中实际运作的所有方法。” 它通过观察图像、视频或声音,以及通过执行这项工作的具体数学技巧,对这些方法进行了分类整理。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →