这篇论文介绍了一种名为 ASAP 的新方法,旨在让“大型视觉 - 语言模型”(LVLM,比如能看图说话的 AI)运行得更快、更省电,同时不降低它的聪明程度。
为了让你轻松理解,我们可以把 AI 看成一个正在看画展的超级侦探,而这张画(输入的图片)被切成了成千上万个小碎片(Token)。
1. 核心问题:侦探被“碎片”淹没了
现在的 AI 模型非常强大,但处理高清图片时,它会把图片切成几千个小方块(Token)。
- 传统做法的痛点:AI 处理这些碎片时,就像侦探在几千个碎片里一个个找线索。因为碎片太多,计算量呈爆炸式增长(就像要读几千页书一样),导致 AI 反应很慢,甚至需要昂贵的显卡。
- 现有的“偷懒”方法:以前的方法试图通过“扔掉”一些不重要的碎片来加速。但这里有两个大坑:
- 盲目丢弃:它们只看碎片本身,不看侦探在问什么(比如问“车在哪里”,它可能扔掉了背景里的车)。
- “注意力偏移”的错觉:这是论文发现的一个关键问题。由于 AI 的某种内部机制(叫 RoPE),它总是下意识地更关注图片“底部”的碎片,而忽略了“顶部”的。
- 比喻:就像侦探因为某种奇怪的规则,总是盯着画展地板上的灰尘看,而忽略了挂在墙上的名画。结果,如果画里有一辆车在远处(画面上方),侦探就完全看不到了。
2. 解决方案:ASAP(注意力感知修剪)
ASAP 就像给侦探配了一位聪明的“策展人”助手,它不需要重新训练侦探,而是直接优化工作流程。它分三步走:
第一步:修正“视力偏差”(双向注意力)
- 问题:以前的 AI 只能按顺序看碎片(从左到右,从上到下),导致它很难把远处的碎片和近处的联系起来,而且容易受“底部偏见”影响。
- ASAP 的做法:它允许侦探自由地“回头看”和“向前看”。
- 比喻:以前侦探只能盯着脚下的路走;现在,ASAP 给他一副360 度全景眼镜。如果侦探在画展中间,他不仅能看前面,还能立刻“瞥一眼”后面的碎片。这样,即使车在远处(画面上方),侦探也能立刻注意到,不会因为位置靠后就被忽略。
第二步:合并“重复的废话”(加权合并)
- 问题:图片里有很多重复的地方,比如一大片蓝天或大海。这些碎片长得几乎一样,留着全是浪费。
- ASAP 的做法:它不是简单地把相似的碎片删掉,而是把相似且重要的碎片合并成一个“超级碎片”。
- 比喻:如果画里有 100 块一模一样的蓝天碎片,ASAP 不会把它们全扔了,而是把它们压缩成 1 块“精华蓝天”。而且,它会保留那些最有信息量的碎片(比如蓝天里有一只鸟),把那些没用的纯蓝色块扔掉。
第三步:把“捡回来的宝贝”补位(预算重分配)
- 问题:合并碎片后,侦探手里的“碎片名额”空出来了。
- ASAP 的做法:它会把之前被暂时淘汰、但很有价值的碎片(比如刚才合并时没选上的关键细节)重新捡回来,填补空缺。
- 比喻:就像侦探整理背包,把重复的干粮合并后,腾出了空间,他立刻把之前因为太重被放下的“关键地图”捡回来放进包里。
3. 效果如何?
ASAP 的效果非常惊人,可以用“四两拨千斤”来形容:
- 速度极快:它把 AI 的计算量(FLOPs)减少了约 80%。这意味着 AI 反应快了 5 倍,手机或普通电脑也能跑得动。
- 几乎无损:虽然扔掉了 80% 的碎片,但 AI 的聪明程度(准确率)保留了 99% 以上。
- 甚至更强:在某些复杂的任务上(比如数清楚远处有多少辆车),ASAP 甚至比没经过优化的原版 AI 表现更好,因为它纠正了原本“只看脚下”的毛病。
总结
简单来说,ASAP 就是给 AI 装了一个智能过滤器。它不再盲目地按顺序处理所有图片碎片,而是:
- 纠正视力,确保不忽略图片的任何角落(解决“注意力偏移”)。
- 去粗取精,把重复的信息合并,把重要的信息保留。
- 动态调整,确保留下的每一个碎片都是最有价值的。
这让 AI 既能跑得飞快(省资源),又能看得更准(不丢细节),是未来让 AI 在普通设备上流畅运行的重要一步。
论文技术总结:ASAP - 面向高效 LVLM 推理的注意力偏移感知剪枝
1. 研究背景与问题定义
背景:大型视觉 - 语言模型(LVLMs,如 LLaVA-NeXT)在处理高分辨率图像时,会将图像分割成大量视觉 Token(例如 LLaVA-NeXT 将图像分为 4x4 块,产生约 2304 个 Token)。由于 Transformer 架构中自注意力机制的计算复杂度随序列长度呈二次方增长(O(N2)),这种 Token 数量的激增导致了巨大的计算瓶颈,严重限制了推理效率。
现有方法的局限性:
目前的 Token 剪枝(Token Pruning)方法主要分为两类,但均存在显著缺陷:
- 视觉编码器内剪枝:在输入 LLM 之前进行剪枝。这类方法通常是**文本无关(Text-agnostic)**的,无法利用用户查询(Prompt)的上下文信息,导致剪枝决策缺乏针对性。
- LLM 骨干网内剪枝:利用文本 - 视觉交叉注意力(Cross-Attention)进行剪枝。这类方法虽然利用了上下文,但忽视了一个关键现象——“注意力偏移”(Attention Shift)。
- 注意力偏移问题:由于旋转位置编码(RoPE)的**距离衰减(Distance Decay)**特性,在 LVLM 中,位于序列后端的视觉 Token(通常对应图像的底部或右侧)会获得人为的高注意力分数,而并非因为它们包含更多语义信息。这导致基于原始注意力分数的剪枝策略倾向于保留图像底部区域,而丢失了重要的背景或远处物体信息(如论文图 2 所示,剪枝后无法数清远处的汽车)。
核心问题:如何在大幅减少计算量(FLOPs)的同时,解决注意力偏移导致的空间偏差,并有效消除视觉信息的冗余,实现无损或近无损的压缩?
2. 方法论:ASAP 框架
ASAP(Attention-Shift-Aware Pruning)是一个无需训练(Training-free)、兼容 KV Cache且支持多轮对话的剪枝框架。它包含三个核心组件:
2.1 注意力偏移感知剪枝:显著性引导的双向注意力掩码 (SG-BiMask)
为了解决 RoPE 引起的注意力偏移,ASAP 提出了一种动态的双向软注意力掩码(Soft Bidirectional Attention Mask)。
- 机制:传统的因果掩码(Causal Mask)严格禁止当前 Token 关注后续 Token。ASAP 针对视觉 Token 放松了这一限制,允许早期的视觉 Token“窥视”后续的 Token。
- 显著性引导:为了避免均匀的双向掩码引入背景噪声,ASAP 利用预 Softmax 的注意力矩阵计算每个 Token 的**注意力质量(Attention Mass)**作为其结构显著性(Salience)的代理。
- 动态掩码:构建一个可学习的惩罚矩阵 Mbidir。对于未来的 Token j,如果其显著性高,则允许当前 Token i 以较小的惩罚(ln(λj))关注它;如果显著性低,则保持强抑制。
- 效果:这使得模型能够根据语义重要性而非位置距离来分配注意力,恢复了早期视觉特征(如图像顶部或远处物体)的权重,从而纠正了空间偏差。
2.2 显著性加权合并 (Salience-Weighted Consolidation)
在识别出重要 Token 后,ASAP 进一步处理语义冗余(如均匀背景中的相邻 Patch)。
- 机制:计算保留 Token 集合中特征向量的成对余弦相似度。
- 加权融合:不同于简单的平均合并,ASAP 提出使用显著性加权的凸组合来合并冗余 Token。合并后的特征向量由显著性最高的源 Token 主导,确保融合后的特征保留最关键的语义信息,防止特征稀释。
- 路由策略:只有当源 Token 的显著性低于目标 Token 且相似度超过阈值时,才进行合并,确保信息流向结构上更重要的锚点。
2.3 预算重分配 (Budget Reallocation)
- 机制:合并操作会腾出 Token 预算槽位。ASAP 不会简单地丢弃被剪枝的 Token,而是将之前被剪除池中注意力质量最高的 Token 重新召回,填充到腾出的槽位中。
- 目的:最大化固定 Token 预算下的信息密度和语义多样性。
3. 主要贡献
- 理论洞察:系统性地识别并归因于 LVLM 中的“注意力偏移”现象,指出其根源在于 RoPE 的距离衰减特性,而非 Token 本身的语义重要性。
- 结构创新:首次提出通过显著性引导的双向注意力机制在结构上缓解注意力偏移,解决了基于注意力分数的剪枝在 LVLM 中的根本性失效问题。
- 框架设计:提出了 ASAP 框架,结合了注意力偏移感知剪枝、基于特征的加权冗余消除以及预算重分配机制。该框架完全无需训练,且兼容标准的 KV Cache 和多轮对话。
- 性能突破:在多个基准测试中实现了显著优于现有基线(如 FastV, PruMerge+, DivPrune 等)的性能。
4. 实验结果
ASAP 在 LLaVA-1.5、LLaVA-NeXT 和 InternVL 2.5 等多个模型上进行了广泛验证:
- LLaVA-NeXT-7B 上的表现:
- 在保留 21.19% 原始 FLOPs(即剪枝掉约 80% 的计算量)的情况下,ASAP 保留了 99.02% 的原始模型性能。
- 在某些基准测试(如 MMBench)上,ASAP 甚至实现了**超越原始模型(Supra-vanilla)**的性能(例如在 MME 基准上得分更高)。
- LLaVA-1.5-13B 上的表现:
- 在保留 128 个 Token(FLOPs 降至 20.90%)的极端压缩下,平均性能保留了 97.10%,显著优于次优基线 DivPrune(96.02%)。
- 在保留 192 个 Token 时,平均性能保留了 98.68%。
- 消融实验:
- 仅使用双向注意力(去除合并模块)即可带来显著的性能提升(TextVQA 提升 +3.23,MME 提升 +92.50),证明了缓解注意力偏移的有效性。
- 加入加权合并和预算重分配后,性能进一步提升,证明了处理冗余和最大化信息密度的重要性。
- 系统效率:
- 在减少 FLOPs 的同时,ASAP 还减少了 KV Cache 的存储占用(约减少 15%),尽管引入了约 2ms 的推理延迟,但整体实现了内存效率与下游性能的极佳平衡。
5. 意义与影响
ASAP 为高效 LVLM 推理提供了一种新的范式。它证明了通过纠正架构诱导的偏差(RoPE 偏移)和优化信息密度(加权合并),可以在不牺牲模型能力的前提下,大幅降低计算成本。
- 实际价值:使得高分辨率图像理解任务能够在资源受限的设备(如边缘设备或单卡 GPU)上高效运行。
- 通用性:作为一种即插即用(Plug-and-play)的无训练方法,ASAP 可轻松集成到各种现有的 LVLM 架构中,无需微调,具有极高的实用价值。
总结:ASAP 通过解决“注意力偏移”这一被忽视的关键问题,并结合智能的冗余消除策略,成功打破了 LVLM 推理效率与性能之间的权衡困境,实现了近乎无损的高压缩比推理。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。