Decoupled Similarity for Task-Aware Token Pruning in Large Vision-Language Models
该论文提出了 DeSAP,一种用于大型视觉语言模型的创新令牌剪枝方法,它利用解耦相似性来捕捉细粒度的跨模态相关性,从而实现任务感知的剪枝,在显著降低计算成本的同时保持高性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图教一个超级聪明的机器人如何同时实现视觉与语言的结合。你给它一张照片并问一个问题,比如“那只猫在做什么?”为了理解这张图片,机器人会将其分解成数千个被称为“token(标记)”的小型拼图碎片。你可以把这些 token 想象成单个像素,但它们不仅仅代表颜色,每个 token 还携带了一点点意义。问题在于,对于一张高分辨率的照片,机器人可能需要处理数千个这样的 token 才能回答一个简单的问题。这就像是为了查明外面是否在下雨而不得不阅读整部百科全书一样;机器人会变得反应迟钝、速度变慢,并消耗大量的能量。这就是大型视觉语言模型(LVLMs)所处的领域,其目标是在不让这些庞大大脑变得“健忘”的前提下,让它们运行得更快、更便宜。科学家们提出的核心问题是:我们如何在机器人开始思考之前,就把那些无聊、无用的拼图碎片扔掉,从而让它只专注于重要的部分?
于是,一种名为 DeSAP(解耦相似性感知剪枝)的新方法出现了,它就像是这些机器人大脑的高效编辑器。研究人员发现,以往决定保留哪些拼图碎片的方法有点笨拙。有些方法只观察图片本身,保留那些“显眼”的部分,比如鲜艳的色彩或巨大的形状,但它们往往会错过用户询问的具体细节。另一些方法则等到机器人开始说话时才决定什么才是重要的,但到那时,机器人已经浪费了大量时间去处理那些无聊的内容。
DeSAP 通过在开始阶段同时做两件聪明的事情来解决这个问题。首先,它观察图片以寻找“显著性(salient)”部分——即那些自然脱颖而出的事物,比如绿地里的一颗红球。但它并未止步于此。它还在机器人开始完整的思考过程之前,就开始倾听问题。它使用一种被称为“解耦相似性(decoupled similarity)”的特殊技巧,将问题中的特定词汇与图片中的微小细节进行匹配。想象一下,你正在照片中寻找一个“皮包”。旧的方法可能会保留图像的整个下半部分(因为包通常在那里),或者保留整个背景(因为背景很“重要”)。然而,DeSAP 表现得像一名知道自己要找什么的侦探。它会忽略背景和人群,精准地锁定那个皮包,即使这个包很小或者处于奇特的角落。
论文指出,通过结合这两类线索——视觉上的“显眼程度”和来自问题的特定“任务引导”——机器人可以扔掉高达 88.9% 的拼图碎片(仅保留约 11%),并且在回答问题时的表现几乎与看到完整图片时一样出色。在对 LLaVA-1.5 等模型的测试中,这种方法不仅节省了时间,还提高了机器人的速度(将初始处理速度提升了 2.3 倍),并减少了 9 倍的计算量,同时保持了答案的准确性。研究人员认为,以往的方法之所以失败,是因为它们只依赖单一的信息源,这往往会导致偏差或遗漏细节。相比之下,DeSAP 使用了一种双源策略,让机器人专注于最重要的内容,证明了有时,看得更少反而能看得更清。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。