← 最新论文
💻 computer science

SepPrune:A Separator-based Pruning Framework for Efficient Multimodal Large Language Models

SepPrune 是一个无需训练、即插即用的框架,它通过使用模态分隔符标记作为统一查询,在保留 96.3% 原始准确度的同时,高效地减少了多模态大语言模型的计算成本,并剪枝了 80.2% 的视觉标记。

原作者: Yuchen Wang, Qihui Zhu, Yang Liu, Xiaoyan Sun, Siying Wu

发布于 2026-07-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Yuchen Wang, Qihui Zhu, Yang Liu, Xiaoyan Sun, Siying Wu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个超级聪明的机器人如何同时实现视觉与语言的结合。这就是多模态大语言模型(MLLMs)的世界——这些 AI 之星可以看着日落的照片写下一首诗,或者分析复杂的图表并回答相关问题。为了实现这一点,机器人不仅仅是在“看”图像,它还会将图片分解成数千个被称为“视觉标记”(vision tokens)的微小数字拼图碎片。你可以把这些标记看作是单个像素,但它们要聪明得多——它们承载了图像的所有细节。

然而,这里有一个难点。当你给机器人输入一张高分辨率照片或一段长视频时,它会生成如此之多的标记,以至于机器人会被淹没。这就像试图同时阅读一整个图书馆的书籍一样;这个过程变得缓慢、昂贵且低效。科学家们一直试图通过弄清楚哪些拼图碎片真正重要,哪些只是杂乱信息来解决这个问题。一些方法试图通过观察机器人如何关注文字来推测重要性,另一些则试图寻找重复的碎片。但这些方法往往陷入自身复杂性的泥潭,在试图加速机器人的同时反而让它变得更慢。核心问题仍然存在:我们如何在不丢失画面的情况下剔除杂乱信息?

SepPrune 登场了,它是一种为这些 AI 模型充当聪明编辑的新方法。这项工作的研究人员在观察这些模型的思考方式时,发现了一些迷人的现象。他们发现,在处理的早期阶段,模型会对特殊的“分隔符”(separator)标记投入大量的注意力——这些微小的标记位于图像数据和文本数据之间,充当着两个世界之间的桥梁。事实证明,这些分隔符正是理解图像的关键。

SepPrune 并没有尝试通过比较每一个视觉标记来计算其重要性(这既缓慢又混乱),而是将分隔符作为一个“主查询”(master query)。想象一下,分隔符就像一位站在博物馆入口处的导游。导游不再询问每一幅画作:“你重要吗?”,而是环视整个展厅并指着说:“你,你,还有你,你们是杰作;其他的可以稍后再看。”通过使用分隔符来快速为视觉标记评分,SepPrune 可以瞬间识别出图像中最具信息量的部分并丢弃其余部分。

结果令人印象深刻。在对 Qwen2.5-VL-7B 等强大模型进行测试时,SepPrune 成功丢弃了超过 80% 的视觉标记,同时仍保持了原模型 96.3% 的准确度。即使当剪枝程度被推向极端的 90.2% 时,模型仍保留了 87.2% 的性能。与许多在深度剪枝时难以维持如此高准确度的其他方法相比,这是一个巨大的飞跃。此外,由于该方法不需要在每个标记之间进行复杂的计算,它运行得更快,并且能与现有的加速技术无缝衔接。

研究人员还证明了他们特定的选择至关重要。他们展示了使用分隔符作为“向导”比使用文本的其他部分效果更好,并且在选择过程中忽略标记的“位置”(即它们在图像中的位置)可以防止模型意外地只保留图片的下半部分。简而言之,SepPrune 表明,通过倾听图像与文本之间的桥梁,我们可以让这些 AI 视觉专家变得更快、更高效,而不会让他们对真正重要的细节视而不见。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →