✨ 要点🔬 技术摘要
想象一下,你正试图教一个超级聪明的机器人如何同时实现视觉与语言的结合。这就是多模态大语言模型(MLLMs)的世界——这些 AI 之星可以看着日落的照片写下一首诗,或者分析复杂的图表并回答相关问题。为了实现这一点,机器人不仅仅是在“看”图像,它还会将图片分解成数千个被称为“视觉标记”(vision tokens)的微小数字拼图碎片。你可以把这些标记看作是单个像素,但它们要聪明得多——它们承载了图像的所有细节。
然而,这里有一个难点。当你给机器人输入一张高分辨率照片或一段长视频时,它会生成如此之多的标记,以至于机器人会被淹没。这就像试图同时阅读一整个图书馆的书籍一样;这个过程变得缓慢、昂贵且低效。科学家们一直试图通过弄清楚哪些拼图碎片真正重要,哪些只是杂乱信息来解决这个问题。一些方法试图通过观察机器人如何关注文字来推测重要性,另一些则试图寻找重复的碎片。但这些方法往往陷入自身复杂性的泥潭,在试图加速机器人的同时反而让它变得更慢。核心问题仍然存在:我们如何在不丢失画面的情况下剔除杂乱信息?
SepPrune 登场了,它是一种为这些 AI 模型充当聪明编辑的新方法。这项工作的研究人员在观察这些模型的思考方式时,发现了一些迷人的现象。他们发现,在处理的早期阶段,模型会对特殊的“分隔符”(separator)标记投入大量的注意力——这些微小的标记位于图像数据和文本数据之间,充当着两个世界之间的桥梁。事实证明,这些分隔符正是理解图像的关键。
SepPrune 并没有尝试通过比较每一个视觉标记来计算其重要性(这既缓慢又混乱),而是将分隔符作为一个“主查询”(master query)。想象一下,分隔符就像一位站在博物馆入口处的导游。导游不再询问每一幅画作:“你重要吗?”,而是环视整个展厅并指着说:“你,你,还有你,你们是杰作;其他的可以稍后再看。”通过使用分隔符来快速为视觉标记评分,SepPrune 可以瞬间识别出图像中最具信息量的部分并丢弃其余部分。
结果令人印象深刻。在对 Qwen2.5-VL-7B 等强大模型进行测试时,SepPrune 成功丢弃了超过 80% 的视觉标记,同时仍保持了原模型 96.3% 的准确度。即使当剪枝程度被推向极端的 90.2% 时,模型仍保留了 87.2% 的性能。与许多在深度剪枝时难以维持如此高准确度的其他方法相比,这是一个巨大的飞跃。此外,由于该方法不需要在每个标记之间进行复杂的计算,它运行得更快,并且能与现有的加速技术无缝衔接。
研究人员还证明了他们特定的选择至关重要。他们展示了使用分隔符作为“向导”比使用文本的其他部分效果更好,并且在选择过程中忽略标记的“位置”(即它们在图像中的位置)可以防止模型意外地只保留图片的下半部分。简而言之,SepPrune 表明,通过倾听图像与文本之间的桥梁,我们可以让这些 AI 视觉专家变得更快、更高效,而不会让他们对真正重要的细节视而不见。
技术摘要:SepPrune
问题陈述
近期的多模态大语言模型(MLLMs),如 Qwen2.5-VL 和 InternVL3,采用了“任意分辨率”(any-res)视觉编码器结构,这会产生海量的视觉标记(vision tokens),尤其是在处理高分辨率输入(如 4K/8K 视频或高像素图像)时。这种标记量显著超过了文本输入的规模,造成了巨大的计算开销和推理延迟。虽然现有的视觉标记剪枝方法旨在缓解这一问题,但它们面临着关键的局限性:
基于注意力的(Attention-based)方法 通常依赖于跨模态注意力分数,这会中断计算流,导致无法使用高效的硬件算子(如 FlashAttention),或者依赖于在现代视觉骨干网络中并不存在的特定架构标记(例如 [CLS])。
基于多样性的(Diversity-based)方法 通常需要计算标记间相似度矩阵,其计算复杂度为二次方级(O ( N 2 ) O(N^2) O ( N 2 ) ),这反而增加了延迟,抵消了剪枝带来的效率增益。
方法论:SepPrune
作者提出了 SepPrune ,这是一个即插即用、无需训练的视觉标记剪枝框架,它利用了模态分隔符(modality separator)标记的内在作用。该方法在 LLM 骨干网络之前运行,确保了与 FlashAttention 等加速技术的兼容性。
核心洞察
通过对 Qwen2.5-VL-7B 等模型的注意力分布进行分析,作者观察到:
分隔符峰值(Separator Peaks): 在浅层网络中,来自视觉和文本标记的注意力分数在模态分隔符(用于分隔视觉和文本模态的特殊标记)处达到峰值,而非在具有语义丰富的视觉内容上。
桥梁功能(Bridge Function): 消融实验表明,移除分隔符标记比移除等量的视觉或文本标记会导致更显著的性能下降,这表明分隔符在早期阶段的对齐过程中起到了关键的跨模态桥梁作用。
算法工作流
SepPrune 利用分隔符标记作为统一查询(unified query)来评估视觉标记,且不改变 LLM 的架构:
统一查询(Unified Query): 使用位于视觉序列之后 的分隔符标记(S r i g h t S_{right} S r i g h t )作为查询向量(Q s e p Q_{sep} Q se p )。选择该标记是因为在因果注意力掩码(causal attention masks)下,它是唯一能够注意到完整视觉标记集(K v i s u a l K_{visual} K v i s u a l )的标记。
偏差消除(Bias Elimination): 为了确保标记仅根据语义重要性而非空间位置进行排序,该方法在评分阶段显式地忽略了旋转位置嵌入(RoPE) 。这防止了模型因为位置偏差而优先保留特定图像区域(例如底部)的标记。
评分与剪枝(Scoring and Pruning): 使用以下公式计算注意力分数:Score p r u n e = softmax ( Q s e p K v i s u a l T d k ) \text{Score}_{prune} = \text{softmax}\left(\frac{Q_{sep} K_{visual}^T}{\sqrt{d_k}}\right) Score p r u n e = softmax ( d k Q se p K v i s u a l T ) 这使复杂度从 O ( N 2 ) O(N^2) O ( N 2 ) 降低到 O ( N ) O(N) O ( N ) 。根据这些分数保留前 k k k 个最具信息量的视觉标记,其余则被剪枝。
投影复用(Projection Reuse): 该方法复用了 LLM 第一层的内置投影参数(q _ p r o j q\_proj q _ p r o j , k _ p r o j k\_proj k _ p r o j ),无需额外的可学习参数。
核心贡献
机制发现: 本文首次揭示并验证了模态分隔符在 MLLM 中作为跨模态桥梁的作用,证明了它们在早期阶段视觉-语言融合中的至关重要性。
新颖的剪枝策略: 引入了 SepPrune,一种轻量级、无需训练且即插即用的方法,利用分隔符标记进行全局视觉标记评估。
高效性与兼容性: 该方法实现了线性时间复杂度(O ( N ) O(N) O ( N ) ),并且完全兼容现有的推理加速框架(如 FlashAttention)和 KV-cache 管理,这与以往基于注意力的方案不同。
实验结果
作者在涵盖通用 VQA、幻觉检测和面向文本的 VQA 等 12 个基准测试中,对 Qwen2.5-VL-7B 和 InternVL3-8B 进行了评估。
性能保持: 在 Qwen2.5-VL-7B 上,SepPrune 在剪枝 80.2% 视觉标记的情况下,仍保留了 96.3% 的原始准确率。其表现显著优于最先进的基准方法(例如,在 80.2% 剪枝率下,比 CDPruner 高出约 3 个百分点)。
极端压缩: 即使在 90.1% 的剪枝率下,SepPrune 仍能维持 87.2% 的原始性能,展示了在 TextVQA 和 ChartQA 等信息密集型任务中的卓越鲁棒性。
泛化能力: 在 InternVL3-8B 上也观察到了类似的性能提升,SepPrune 在 80% 剪枝时达到了 93.1% 的相对得分。
效率: 在 NVIDIA H20 GPU 上的实测显示,与未剪枝的基准线(760.4s)和其他剪枝方法相比,SepPrune 实现了最低的端到端延迟(591.4s),验证了其线性可扩展性。
重要性与主张
本文声称,SepPrune 通过从模态交互的角度重新思考剪枝机制,解决了高分辨率 MLLM 推理中的效率瓶颈。通过将分隔符标记识别为天然的“全局查询”,该方法避免了基于多样性的矩阵计算带来的计算开销,也避开了基于注意力的方法的架构约束。作者断言,这种方法可以在保持强大模型性能的同时,实现大幅度的推理成本降低,为在资源受限的环境中部署 MLLM 提供了一种切实可行的解决方案。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。