想象一下你有一个超级聪明的助手(一个多模态大语言模型,简称 MLLM),它能阅读文本、观察图片、观看视频并聆听音频。这个助手才华横溢,但它有一个重大问题:当你一次性给它太多信息时,它会感到不堪重负。
把助手接收到的信息想象成一种“标记”(tokens,即数据的微小块)的流。
- 文本提示词就像一封短小的信件。
- 高分辨率照片就像是一封被放大成巨大的、细节丰富的壁画的信件。
- 视频就像是成千上万张这样的壁画组成的图书馆,每一秒都在变化。
- 音频就像是连续的高速声波流。
当你给这个助手喂进一部 90 分钟的电影时,它看到的不仅仅是“一部电影”。它看到了 5400 万个标记。这就像是试图在一次呼吸间读完一整个图书馆的书籍。助手的“大脑”(它的“自注意力”机制)必须将每一个标记与所有其他标记进行比较。这种计算量增长得极其迅速且沉重,以至于计算机要么耗尽内存,要么需要花费极长的时间才能给出答案。
解决方案:标记压缩 (Token Compression)
这篇论文是一本宏大的指南(综述),讲述了如何教这个助手变得更高效,同时又不失其聪明才智。作者们称之为 标记压缩。
把标记压缩想象成 为旅行收拾行李。
- 问题在于: 你的行李箱里装满了衣服,但其中 80% 都是重复的(比如 50 件一模一样的白色 T 恤)或者是不需要的(比如去海滩度假却带了厚重的冬装)。
- 目标是: 你希望把所有重要的东西都装进一个更小的包里,以便你可以更快地旅行,同时又不会丢掉任何真正需要的东西。
这篇论文将目前所有的“打包”方法归纳为两个主要维度:数据是什么类型的? 以及 如何打包?
1. 按数据类型分类(“是什么”)
不同类型的数据有不同种类的“杂乱”(冗余)。
- 图像(静态照片):
- 杂乱之处: 一张蓝天的照片可能有数百万个完全相同的蓝色像素。
- 解决方法: 计算机不再发送每一个蓝色的像素,而是将它们组合在一起。它会说:“这一整块区域只是蓝天”,然后发送一个标记来代表整个区域。
- 视频(动态图像):
- 杂乱之处: 在一段人说话的视频中,背景(墙壁或树木)在 10 秒钟内保持不变,而人却在轻微移动。
- 解决方法: 计算机意识到:“我们不需要每秒钟发送 30 次背景。” 它保留背景,只发送运动部分的更新。这就像是发送一份“变更日志”,而不是重新发送整个场景的每一帧。
- 音频(声波):
- 杂乱之处: 语音录音通常会有长时间的停顿、沉默或不增加意义的背景杂音。
- 解决方法: 计算机切除沉默部分并合并相似的声音,只保留人声说话或音乐变化的片段。
2. 按方法分类(“怎么做”)
论文将用于这种“打包”的技术分为四种主要策略:
- “缩放射线”(基于变换):
想象一下,你拿出一张高分辨率照片并直接将其缩小。你会丢失一些细节,但保留了大致的形状和颜色。这是通过数学方式压缩数据(如池化或平均化)来缩短标记列表。
- “分组游戏”(基于相似性):
想象你有一堆 1,000 个红色乐高积木。与其列出所有 1,000 个,不如说:“这里有一个红色的积木,还有 999 个和它几乎一样的。” 计算机寻找看起来或听起来非常相似的标记,并将它们合并为一个单一的“代表性”标记。
- “聚光灯”(基于注意力):
想象一位老师在观察教室。老师只关心那些举手的学生(重要的标记),而忽略那些在后排睡觉的学生。计算机查看它自己的“注意力分数”(它对每块数据的关注程度),并丢弃那些它本来就在忽略的标记。
- “问题指南”(基于查询):
想象你在草堆里寻找一根特定的针。你不是在看每一根草,而是问:“针在哪里?” 计算机使用你的问题(查询)来过滤掉所有与你询问内容不匹配的东西,只保留相关的标记。
为什么这很重要
作者解释说,这不仅仅是为了让计算机运行得更快,更是为了让它们可用。
- 如果没有压缩,目前的模型无法实时处理一部 90 分钟的电影。
- 有了压缩,模型可以“观看”电影,理解剧情,并回答相关问题,同时仅使用极小部分的内存。
难点(挑战)
论文也警告说,这并非魔法。如果你把行李箱塞得太紧:
- 你可能会丢失细节: 如果你过度压缩一张照片,你可能会错过背景中一个微小但重要的标志。
- 它会破坏流畅度: 在视频中,如果你合并了过多的帧,动作可能会看起来很卡顿或令人困惑。
- 它很难适配: 一些这些“打包”技巧很难与当今最快的计算机芯片配合使用,因为它们需要计算机以不同的方式停止并进行计算。
总结:
这篇论文是研究人员的一份地图。它说:“我们遇到了一个问题:我们的 AI 正淹没在过量的数据中。以下是我们尝试教它如何过滤、分组和压缩这些数据,以便它能在现实世界中实际运作的所有方法。” 它通过观察图像、视频或声音,以及通过执行这项工作的具体数学技巧,对这些方法进行了分类整理。
技术总结:多模态大语言模型高效 Token 压缩综述
1. 问题陈述
多模态大语言模型(MLLMs)通过处理包括高分辨率图像、长视频序列和长音频输入在内的复杂上下文,取得了卓越的性能。然而,这种能力引入了一个显著的计算瓶 much 瓶颈:自注意力机制相对于输入 Token 数量(N)具有二次方复杂度(O(N2))。
与文本(其 Token 数量相对可控)不同,视觉和听觉数据生成的序列长度要长出几个数量级。例如,一段 90 分钟的视频可能会产生约 5400 万个 Token,而单张高分辨率图像或 2 小时的音频文件会生成数万甚至数百万个 Token。这种差异导致了严重的推理延迟和内存消耗,阻碍了 MLLMs 的实际部署。此外,多模态数据包含大量的冗余(图像中的空间冗余、视频中的时空冗余以及音频中的时域/频谱冗余),研究表明,在典型的 MLLM 序列中,超过 50% 的 Token 在推理过程中获得的注意力极低。
2. 方法论与分类法
本文对专门针对 MLLMs 的 Token 压缩技术进行了首次系统的综述与合成。作者将Token 压缩严格定义为显式减少传递给后续层的 Token 数量(M<N)的方法,并将其与输入层采样(如帧提取)以及保持序列长度但减少计算路径的注意力稀疏机制区分开来。
本综述通过两个主要维度对现有方法进行分类:
A. 以模态为中心的分类
考虑到不同模态的冗余模式存在差异,方法根据其主要关注的数据类型进行分组:
- 以图像为中心的压缩: 处理静态视觉数据中的空间冗余。相邻的补丁(Patches)通常代表相似的纹理或颜色。
- 以视频为中心的压缩: 针对动态序列中的时空冗余,其中连续帧共享大量的背景元素和有限的运动。
- 以音频为中心的压缩: 处理声学信号中的时域和频谱冗余,其中显著信息通常集中在寂静或噪声中的稀疏片段中。
B. 以机制为中心的分类
除了模态之外,本文还根据其底层的算法原理(这些原理通常可以超越特定数据类型)对方法进行了剖析:
- 基于变换的方法: 通过改变尺度或表示形式直接转换跨模态信息以压缩 Token(例如:Pixel Unshuffle、空间/时间池化、卷积)。这些方法通常能保留结构化表示,但压缩率的灵活性有限。
- 基于相似度的方法: 基于隐式空间中的距离或相似性识别并合并 Token(例如:K-最近邻、聚类)。虽然有效,但如果 Token 被过度泛化,则存在丢失细粒度空间或时间信息的风险。
- 基于注意力的方法: 利用注意力机制的稀疏性来剪枝注意力得分较低的 Token。这些方法可以应用于编码器(视觉/音频编码器)或解码器(LLM 主干)。尽管功能强大,但由于与计算注意力是隐式进行的优化加速库(如 FlashAttention)不兼容,因此在部署方面面临挑战。
- 基于查询的方法: 使用外部查询(提示词)来引导压缩,包括通过Token 蒸馏(学习用更少的 Token 表示视觉/音频信息)或跨模态选择(基于相关性过滤 Token)。这些方法具有高度的任务相关性,但在查询发生变化的多轮对话中可能会遇到困难。
3. 核心贡献
- 首个结构化综述: 本工作提供了第一个专门针对 MLLMs 的 Token 压缩综合分类法,弥合了以文本为中心的提示词压缩与视觉/音频特定技术之间的鸿沟。
- 统一框架: 本文证明了尽管存在模态特定的冗余,但基本的算法原理(重要性识别、冗余量化和 Token 合并/剪枝)在视觉、时间及听觉领域是一致的。
- 批判性权衡分析: 文中详细阐述了每种机制的优缺点,例如池化方法的无参数特性与卷积的可学习抽象性之间的对比,以及基于注意力的剪枝效率与其与当前硬件加速器不兼容性之间的矛盾。
- 识别挑战: 综述强调了关键障碍,包括在高压缩率下性能下降(尤其是在较大模型中)、丢失 OCR 或时间定位等任务所需的细粒度细节,以及将动态剪枝集成到多轮对话系统中的难度。
4. 结果与观察
本文综合了众多最先进的模型和方法(例如 InternVL、Qwen2-VL、FastV、ToMe、HoliTom、SpeechPrune)的研究结果:
- 效率与性能: 在性能损失极小的情况下,可以实现显著的 Token 缩减。例如,仅保留 10-25% 的视觉 Token 通常能在 VQA2 和 VideoMME 等基准测试中保持竞争力的性能。然而,过度的压缩会导致性能急剧下降,尤其是在具有更高表征能力的模型(如 Qwen2.5-VL、LLaVA-OV-72B)中。
- 任务敏感性: 压缩策略并非普遍适用。需要高信息密度(如光学字符识别 OCR)或精确时间推理的任务,比一般的视觉问答任务更容易受到 Token 合并或剪枝的影响。
- 部署差距: 许多基于注意力的方法虽然在理论上是高效的,但由于它们依赖于显式的注意力得分,而这些得分在融合且优化的推理流水线中是无法获取的,因此难以在现实场景中部署。
5. 意义与未来方向
论文指出,Token 压缩不仅是一种后优化技术,更是 MLLMs 可扩展性的关键赋能者。其意义在于:
- 单次长上下文理解: 通过将信息浓缩为稠密 Token,MLLMs 可以在单次处理中理解整个代码库或长视频,而无需像 RingAttention 那样进行架构重构。
- 增强模态对齐: 压缩方法(尤其是基于查询的蒸馏)可以通过过滤掉低密度或无关信息,从而提高多模态输入与语言表示之间的对齐度。
- 正交协同效应: 论文指出,Token 压缩(减少序列长度 N)在结构上与权重压缩(减少模型维度 D)是正交的,这表明结合这些方法(例如:量化 + Token 剪枝)可以产生复合的效率提升。
确定的未来方向:
- 联合多模态压缩: 超越单模态策略,开发能够利用跨模态协同效应(例如使用音频线索来剪枝视频 Token)的框架,以构建全模态(Omni)大模型。
- 架构设计: 从“补救式压缩”转向设计在特征抽象阶段就能本质上考虑数据冗余的模型。
- 评估标准: 论文呼吁建立专门用于评估 Token 压缩效能的新基准,超越通用的 VQA 指标,转向需要细粒度时间定位和高保真细节保留的任务。
总之,本综述为研究人员和开发者建立了基础性的资源,总结了当前进展,并勾勒出了高效、可扩展且鲁棒的多模态大语言模型的演进路径。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。