← 最新论文
💻 computer science

CRISP: Pre-LLM Yet Text-Driven Visual Token Pruning for Efficient LVLM Inference

CRISP 是一个前 LLM 时代的文本驱动视觉标记剪枝框架,它利用一个两阶段流水线来识别指令相关标记并增强语义多样性,在实现超过 99.5% 的准确率保留的同时,为大型视觉语言模型降低了 2 倍以上的推理延迟。

原作者: Xu Li, Yi Zheng, Mengyang Zhao, Yuxuan Liang, Zhe Liu, Rui Zhu, Xiaolei Chen, Wei Zhou, Baoquan Zhao, Juncen Guo

发布于 2026-07-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Xu Li, Yi Zheng, Mengyang Zhao, Yuxuan Liang, Zhe Liu, Rui Zhu, Xiaolei Chen, Wei Zhou, Baoquan Zhao, Juncen Guo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图解开一个谜题,但你拿到的不是寥寥几个线索,而是一个包含了数百万本书的图书馆,而且所有的书都同时翻开了。这本质上就是现代“大型视觉语言模型”(LVLMs)的工作方式。这些是超级聪明的计算机程序,它们可以观察一张图片并回答关于它的问题,就像一个数字侦探。为了做到这一点,它们将图像分解成数千个微小的数字碎片,称为“标记”(tokens)。把这些标记想象成一个个独立的拼图碎片。问题在于,计算机在看你的问题之前,会尝试阅读每一个拼图碎片,即使那些只是蓝天或空地板的部分也是如此。这使得整个过程极其缓慢且极其消耗计算资源,就像为了找出猫项圈的颜色而不得不读完一整部百科全书一样。

长期以来,科学家们一直试图通过两种方式来提高速度:要么随机扔掉一些拼图碎片(但这有时会把猫的项圈也删掉),要么等到计算机已经开始阅读整本书之后再决定跳过哪些部分(但这对于节省时间来说已经太晚了)。一个大问题是:我们能否教会计算机先看问题,然后再只挑选出回答该问题所需的特定拼图碎片,且不减慢整个系统的速度?

这就是名为 CRISP 的一种新方法登场的地方。把 CRISP 想象成一位在侦探开始阅读之前就开始工作的超级高效图书管理员。它不会把整个图书馆都倒在桌子上,而是先听取你的问题。如果你问:“手提包是什么颜色的?”,CRISP 会瞬间扫描图像,并只抓取显示手提包及其周围区域的拼图碎片。它不仅限于此;它还会多抓取一些额外的碎片,以确保背景语境(比如街道或拿着包的人)不会丢失。

研发 CRISP 的研究人员发现,这种“先问,后看”的方法比传统的“先看,后问”方法要聪明得多。在测试中,他们展示了 CRISP 可以丢弃高达 88.9% 的视觉拼图碎片(将图像从数百个标记减少到仅 64 或 128 个),同时仍能保持计算机的准确率与查看完整图像时几乎完全一致。事实上,在某些测试中,它寻找正确线索的能力如此出色,甚至减少了“幻觉”现象——即 AI 凭空捏造不存在的事物的时刻。

论文明确反对目前常用的两种处理方式。一种是不管问题是什么,只挑选图像中最“重要”的碎片(即与文本无关的方法),作者认为这就像是在不知道自己在找什么之前就盯着一幅画看。另一种方法是等到计算机进入深度思考过程后才开始删除碎片,作者认为这浪费了太多能量,因为计算机已经完成了阅读所有内容的繁重工作。CRISP 拒绝了这两者,证明了通过在沉重的思考开始之前进行剪枝,你可以同时实现快速与智能。

结果是经过精确测量且非常具体的。在名为 LLaVA-1.5 的流行模型上,CRISP 在仅使用 128 个标记而非通常 576 个标记的情况下,保留了 99.5% 的原始性能。在更新的模型 LLaVA-NeXT 上,它在仅使用 320 个标记的情况下保留了 96.9% 的性能。或许最令人印象深刻的是,这种加速不仅节省了准确性,还将获得答案的时间缩短了一半以上。作者指出,这种方法是一种实用的、即插即用的解决方案,可以让这些智能图像阅读计算机运行得更快、更便宜,尤其是在那些没有巨大功率的设备上。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →