← 最新论文
💻 computer science

UniPrune: Unified Progressive Visual Token Pruning with Information-Aware Budget Allocation for Efficient LLaVA-Style Vision Language Models

UniPrune 是一个统一的渐进式视觉标记剪枝框架,它通过将编码器阶段的语义重要性-多样性剪枝与 LLM 阶段的金字塔型丢弃进行协同结合,并辅以信息感知预算分配和跨阶段信息连续性机制,从而使 LLaVA 式视觉语言模型即使在极端的压缩比下也能实现卓越的效率和性能。

原作者: Jianhua Cui, Meizhou Ding, Ziru Niu, Wei Wang, Lifeng Han, Peng Zhao

发布于 2026-08-31
📖 1 分钟阅读☕ 轻松阅读

原作者: Jianhua Cui, Meizhou Ding, Ziru Niu, Wei Wang, Lifeng Han, Peng Zhao

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

现代能够看和说的智能人工智能系统正变得异常强大,但它们也带来了沉重的计算负担。这些视觉语言模型的工作原理是首先将图像转换为长序列的小型数字碎片,通常称为“标记”(tokens),这些碎片代表了图像的不同部分。一张标准的照片可能会被分解成数百个这样的碎片。随后,系统会将整个序列与文本一起进行处理,就像人类在看图表的同时阅读句子一样。问题在于,连接这些碎片所需的数学运算量会随着碎片数量的增加而呈指数级增长。如果一张图像生成了 576 个标记,计算机必须进行大量的计算工作来理解它们之间的相互关系,即便其中许多标记代表的是像白墙或一片天空这样无关紧要的背景细节。这种低效使得在标准硬件上运行这些强大的系统,或将其用于视频分析等实时任务变得十分困难。

研究人员长期以来一直试图通过在系统开始工作前移除不必要的碎片来解决这个问题。有些方法在最开始阶段就充当过滤器,仅根据图像本身的外观来丢弃标记。另一些方法则在系统开始同时处理文本和图像后才介入,移除那些对特定问题看似无关的碎片。然而,这两种方法都存在盲点:早期的过滤器往往会丢弃重要的细节,因为它们不知道用户在问什么;而后期的过滤器则在执行删除操作之前,就浪费了处理整张图像的能量。一项新研究引入了一种统一的方法,结合了这两种方法的优点,为这些智能系统创造了一条更高效的路径。

由崔建华(Jianhua Cui)和丁梅州(Meizhou Ding)领导的研究小组开发了一个名为 UniPrune 的框架,该框架将标记缩减视为一个两步走的旅程,而非单一事件。想象一下,你正在为旅行打包行李,但还不确定具体的天气。你既不会把所有东西都扔进去然后听天由命,也不会在已经装好整个包之后才决定保留哪些物品。相反,你可能会先将相似的物品归类并保留最具代表性的那些,然后一旦知道了目的地,再进行更精确的选择。这本质上就是 UniPrune 所做的:它首先利用视觉模式对图像数据进行广泛的清理,然后随着系统开始理解问题的语境,进行第二次更精准的清理。

第一步过程发生在图像被扫描之后、语言模型介入之前。系统根据相似性将视觉标记进行聚类,就像根据大致主题对一堆混合的照片进行分类一样。从每个组中,它保留最重要的标记并丢弃其余部分。这消除了明显的冗余,例如代表同一片蓝色天空的多个标记。然而,研究人员意识到,在这个阶段仅仅将标记数量减半是有风险的。如果系统过早地进行过度激进的裁剪,可能会丢失在稍后回答特定问题时至关重要的标记。为了解决这个问题,他们引入了一种动态预算策略。系统不再使用固定规则来决定第一阶段保留多少标记,而是测量图像的复杂程度。一个主体清晰的简单图像会获得更紧凑的预算,而一个复杂、繁忙的场景则被允许保留更多标记。这确保了系统既能保留足够的细节来处理难题,又不会在处理简单问题时浪费能量。

完成初步选择后,剩余的标记将被传递给大型语言模型,模型开始将其与文本一起处理。在这里,系统采用了类似于金字塔结构的第二种剪枝策略。随着数据在模型的更深层移动,系统会逐渐移除更多的标记。其逻辑在于,随着模型在问题的语境下更好地理解图像,哪些信息不再需要就会变得更加清晰。研究人员发现,分配这两个阶段工作的最有效方式不是平均分配标记,而是遵循特定的数学平衡。他们发现,第一阶段之后保留的理想标记数大约是起始数量与最终目标数量乘积的平方根。他们将这一经验法则称为“感知信息的预算”,它使系统能够在节省足够计算能力的同时,又不牺牲回答问题的准确性。

为了确保第一阶段不会意外删除第二阶段可能会用到的标记,研究人员增加了第三层智能。他们分析了视觉标记在图像编码器内部是如何相互作用的。他们发现,有些标记充当全局整合器,连接着整个图像的信息,而另一些则只是局部检测器。通过在第一次裁剪期间给予这些全局整合器额外的权重,系统确保了传递给语言模型的标记构成了一个高质量的基础。这种“跨阶段连续性”意味着第二阶段拥有一个更好的起点,使其能够对后续的移除决策做出更明智的选择。

该框架在两个主要视觉语言模型家族上的测试结果令人瞩目。当研究人员将系统推向极端极限,仅保留极小比例的原始标记(有时仅为 576 个中的 24 个)时,这种新方法显著优于现有技术。尝试一次性完成所有裁剪的单阶段方法在这些条件下准确率大幅下降。相比之下,两阶段的 UniPrune 方法保持了高性能,能够正确回答其他方法会错过的关于物体和场景的问题。例如,在一项标准的视觉理解测试中,新方法在仅使用一小部分计算能力的情况下,保留了完整未压缩模型 90% 以上的性能。

除了准确性之外,该研究还测量了在实际硬件上运行这些模型的实用效益。通过在过程早期减少标记数量,系统大幅降低了运行模型所需的峰值内存。对于在资源有限的设备上部署这些技术而言,这是一个关键因素。研究人员计算出,与运行没有任何剪枝的模型相比,该方法减少了一半以上的总计算工作量,且比那些等待到最后才剪枝的方法效率更高。由新的智能预算和评分机制带来的额外开销微乎其微,占总时间的比例不到 1%,这意味着效率提升几乎完全是纯粹的。

这项研究表明,高效人工智能的关键不仅在于如何“走捷径”,还在于理解在哪里以及何时进行裁剪。通过承认视觉冗余具有两种不同的形式——一种基于图像本身,另一种基于任务本身——研究人员创建了一个能够同时处理这两者的系统。研究结果表明,多阶段统一方法优于试图用一步解决问题的做法。这项工作为使强大的视觉语言模型更快、更易普及提供了一条清晰的路径,证明了只要策略得当,我们就可以在剥离冗余的同时,保留这些系统之所以智能的本质。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →