想象一下,你正在试图解开一个谜题,但你拿到的不是寥寥几个线索,而是一个包含了数百万本书的图书馆,而且所有的书都同时翻开了。这本质上就是现代“大型视觉语言模型”(LVLMs)的工作方式。这些是超级聪明的计算机程序,它们可以观察一张图片并回答关于它的问题,就像一个数字侦探。为了做到这一点,它们将图像分解成数千个微小的数字碎片,称为“标记”(tokens)。把这些标记想象成一个个独立的拼图碎片。问题在于,计算机在看你的问题之前,会尝试阅读每一个拼图碎片,即使那些只是蓝天或空地板的部分也是如此。这使得整个过程极其缓慢且极其消耗计算资源,就像为了找出猫项圈的颜色而不得不读完一整部百科全书一样。
长期以来,科学家们一直试图通过两种方式来提高速度:要么随机扔掉一些拼图碎片(但这有时会把猫的项圈也删掉),要么等到计算机已经开始阅读整本书之后再决定跳过哪些部分(但这对于节省时间来说已经太晚了)。一个大问题是:我们能否教会计算机先看问题,然后再只挑选出回答该问题所需的特定拼图碎片,且不减慢整个系统的速度?
这就是名为 CRISP 的一种新方法登场的地方。把 CRISP 想象成一位在侦探开始阅读之前就开始工作的超级高效图书管理员。它不会把整个图书馆都倒在桌子上,而是先听取你的问题。如果你问:“手提包是什么颜色的?”,CRISP 会瞬间扫描图像,并只抓取显示手提包及其周围区域的拼图碎片。它不仅限于此;它还会多抓取一些额外的碎片,以确保背景语境(比如街道或拿着包的人)不会丢失。
研发 CRISP 的研究人员发现,这种“先问,后看”的方法比传统的“先看,后问”方法要聪明得多。在测试中,他们展示了 CRISP 可以丢弃高达 88.9% 的视觉拼图碎片(将图像从数百个标记减少到仅 64 或 128 个),同时仍能保持计算机的准确率与查看完整图像时几乎完全一致。事实上,在某些测试中,它寻找正确线索的能力如此出色,甚至减少了“幻觉”现象——即 AI 凭空捏造不存在的事物的时刻。
论文明确反对目前常用的两种处理方式。一种是不管问题是什么,只挑选图像中最“重要”的碎片(即与文本无关的方法),作者认为这就像是在不知道自己在找什么之前就盯着一幅画看。另一种方法是等到计算机进入深度思考过程后才开始删除碎片,作者认为这浪费了太多能量,因为计算机已经完成了阅读所有内容的繁重工作。CRISP 拒绝了这两者,证明了通过在沉重的思考开始之前进行剪枝,你可以同时实现快速与智能。
结果是经过精确测量且非常具体的。在名为 LLaVA-1.5 的流行模型上,CRISP 在仅使用 128 个标记而非通常 576 个标记的情况下,保留了 99.5% 的原始性能。在更新的模型 LLaVA-NeXT 上,它在仅使用 320 个标记的情况下保留了 96.9% 的性能。或许最令人印象深刻的是,这种加速不仅节省了准确性,还将获得答案的时间缩短了一半以上。作者指出,这种方法是一种实用的、即插即用的解决方案,可以让这些智能图像阅读计算机运行得更快、更便宜,尤其是在那些没有巨大功率的设备上。
技术摘要:CRISP —— 前 LLM 阶段的文本驱动视觉 Token 修剪
1. 问题陈述
大型视觉语言模型(LVLMs)面临着显著的推理开销问题,因为它们将图像编码为长序列的视觉 Token(通常为数百到数千个),并且这些 Token 会被大语言模型(LLM)进行完整处理。这为在延迟敏感或资源受限的场景中部署带来了瓶颈。
现有的视觉 Token 修剪方法面临着一个根本性的权衡:
- 前 LLM 修剪(Pre-LLM Pruning): 在 LLM 之前运行,使用与文本无关的启发式算法(例如 CLS 注意力或特征相似度)。虽然这种方法效率很高,但它们是“文本无关”的,这意味着无论具体的文本查询是什么,修剪的都是相同的 Token。这模拟了一种“先看后问”的认知策略,其效率低于自然的“先读后看”过程,并且经常丢弃与查询相关的细节。
- 内 LLM 修剪(Intra-LLM Pruning): 在 LLM 内部运行,利用跨模态注意力分数根据当前文本来修剪 Token。虽然具有文本驱动性,但在浅层进行修剪会受到位置偏差和注意力分散的影响,从而降低准确性。在深层进行修剪可以保持准确性,但要求视觉 Token 必须穿过许多 LLM 模块,从而削弱了计算节省的效果。此外,提取注意力权重会破坏 FlashAttention,损害效率。
因此,需要一种能够在 LLM 之前执行修剪(以最大化效率)但仍保持 文本驱动(以保留任务相关信息)的方法,且无需访问 LLM 的内部注意力机制。
2. 方法论:CRISP
作者提出了 CRISP(CRItical-first and Semantically-covered Pre-LLM token pruning,即“关键优先且语义覆盖的前 LLM Token 修剪”),这是一个在视觉投影器(vision projector)和 LLM 之间运行的无需训练的框架。它利用两阶段流水线来选择一个紧凑的视觉 Token 子集 (K),以平衡指令相关性与场景上下文。
第一阶段:关键优先 Token 选择
此阶段识别与文本查询最相关的视觉 Token。
- 关键词提取: 系统使用轻量级 NLP 处理从查询中提取名词(例如,“滑雪者”、“手套”),因为名词通常对应于具体的图像区域。
- 跨模态相关性计算: 投影后的视觉 Token 和词嵌入(从子词 Token 聚合而来)存在于同一个语义空间中。系统计算视觉 Token 与词嵌入之间的余弦相似度矩阵。
- 词级配额分配: 并非所有单词在图像中的落地程度都相同。系统使用来自视觉编码器的 CLS 注意力 来确定与每个单词相关的区域的重要性。具有较高 CLS 注意力分数的单词会获得更多的 Token 预算。
- 选择: 根据与特定单词的相关性及其分配的配额,选择前 K 个视觉 Token。如果没有检测到名词,系统将回退到纯粹基于全局 CLS 注意力的选择模式。
第二阶段:语义覆盖 Token 补全
仅依赖文本对齐的 Token 可能会丢失必要的上下文(例如,空间布局、背景)。
- 系统从剩余池中迭代选择额外的 Token,以达到总预算 K。
- 它选择与已选集合具有 语义互补性 的 Token。具体而言,它选择与当前集合的最大相似度 最低 的 Token,从而实现语义多样性的最大化,并确保保留基本的场景上下文。
3. 核心贡献
- 文本驱动的前 LLM 修剪: CRISP 通过在 LLM 之前进行修剪,同时动态适应文本查询,弥合了效率与相关性之间的鸿沟,避免了以往前 LLM 方法“文本无关”的局限性。
- 两阶段流水线: “关键优先”选择(确保查询对齐)与“语义覆盖”补全(确保上下文多样性)的结合,使得模型能够在不牺牲场景理解能力的前提下,保留关键证据。
- 无需训练且高效: 该方法不需要额外的训练,不访问 LLM 的注意力权重(保持了 FlashAttention 的兼容性),并且完全运行在投影器与 LLM 之间。
4. 实验结果
作者在 LLaVA-1.5-7B 和 LLaVA-NeXT-7B 上通过九个基准测试(包括 MME, GQA, SQA, POPE 和 VQA-v2)对 CRISP 进行了评估。
性能保持:
- 在 LLaVA-1.5-7B 上,当修剪率为 77.8%(仅保留 128 个 Token)时,CRISP 达到了全 Token 模型性能的 99.5%,优于次优方法(97.9%)。
- 在 LLaVA-1.5-7B 上,即使在 88.9% 的激进修剪率下(64 个 Token),它仍能维持 97.7% 的性能。
- 在 LLaVA-NeXT-7B 上,在 88.9% 的修剪率下(320 个 Token),CRISP 保留了 96.9% 的性能,超越了所有基准方法。
- 值得注意的是,CRISP 在 POPE 基准测试(物体幻觉检测)上甚至超过了全 Token 基线,这表明其聚焦的选择有效地抑制了伪相关性。
效率提升:
- CRISP 降低的推理 FLOPs 和 KV-cache 内存使用量随 Token 数量的减少几乎呈线性关系。
- 它实现了 >2 倍的解码加速,并显著减少了两个模型上的总端到端评估时间。
5. 意义与主张
论文声称 CRISP 为高效的 LVLM 推理提供了一个 实用且通用的解决方案。通过将文本驱动的相关性与 LLM 的内部处理解耦,CRISP 实现了比现有方法更优的准确性-效率权衡。作者强调,该方法对于 资源受限的场景 和延迟敏感型部署特别有价值,使得使用高性能 LVLM 而无需承担处理完整视觉 Token 序列的巨大计算成本成为可能。结果表明,只要剩余预算用于维持多样化的上下文落地,仅需少量的文本相关 Token 即可保留关键证据。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。