Adaptive Two-Stage Visual Token Pruning for Efficient Inference in Video-Language Models
本文提出了一种事后、无需训练的两阶段自适应 Token 修剪策略,该策略首先消除冗余帧,然后根据帧间相关性动态调整 Token 保留量,在实现 95% 计算量减少的同时,在 10% Token 保留率下将视频描述准确度提升了 7%。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在试图教一个超级聪明的机器人如何理解世界。你给了它一个摄像头和一个大脑,并要求它观察一段视频并描述发生了什么。这就是“视觉语言模型”(Vision-Language Models, VLMs)的世界。你可以把这些模型看作是一个团队:其中一部分是“眼睛”(视觉编码器),负责观察图像并将其分解成被称为“Token”(标记/词元)的微小拼图碎片;另一部分是“大脑”(大型语言模型),负责阅读这些 Token 并编写故事或回答问题。
问题在于,视频非常庞大。一张图像就可以被分解成数百个拼图碎片,而视频仅仅是许多图像的堆叠。如果你尝试将整个视频喂给机器人的大脑,它会感到不堪重负。这就像试图在一秒钟内读完一千页的书;机器人会变慢、会疲劳,并且无法在手机或监控摄像头等小型设备上工作。科学家们曾尝试通过丢弃一些拼图碎片来解决这个问题,但他们的大多数方法都像是在使用饼干切割器:无论视频是无聊的静止墙壁画面,还是动作激烈的赛车追逐,他们都会从每个视频中切掉同样数量的碎片。这篇文章提出了一个更好的问题:如果我们能更聪明地决定丢弃什么,在重复内容多时多切一点,在精彩时刻少切一点,情况会怎样?
智能视频切割器的故事
来自亚马逊的一个团队发现,目前加速视频 AI 的方法有点笨拙。它们对待每个视频的方式都一样,无论屏幕上正在发生什么,都会切掉固定数量的拼图碎片(Token)。但视频是特殊的,它们具有“时间冗余性”(temporal redundancy),这是一个高级说法,意思是指如果你有一个猫在睡觉的视频,第 10 帧看起来几乎和第 11 帧、第 12 帧一模一样。把机器人的脑力浪费在所有这些完全相同的帧上是非常愚蠢的。
为了解决这个问题,该团队发明了一种“两阶段自适应视觉 Token 修剪”(Two-Stage Adaptive Visual Token Pruning)策略。你可以把它想象成一个清理杂乱房间的两步走清洁小组。
第一阶段:帧过滤器(The Frame Filter)
首先,该方法观察整个视频并询问:“哪些帧实际上是全新的?”如果你有一个人走路的视频,前几帧可能是一样的。该算法就像一个精明的剪辑师,直接扔掉那些无聊、重复的帧。它只保留最精彩的时刻,就像制作一段精彩集锦。这就是“帧级”修剪。
第二阶段:Token 控制器(The Token Tamer)
现在,机器人拥有了一个更短的视频,但剩余的每一帧仍然由数千个微小的 Token 组成。在这里,奇迹发生了。该方法不再是切掉固定数量的 Token(比如“始终保留 50%”),而是根据视频的内容来决定要切掉多少。
想象一下,一帧中的 Token 就像一群正在交谈的人。如果每个人说的话都完全一样(高冗余度),你只需要听一个人的话就能理解整个群体。但如果每个人说的话都完全不同(高多样性),你就需要听每个人的话。本文的方法正是如此:它分析 Token 之间的“相关性”。它使用了一种叫做“特征值分解”(eigen-decomposition)的数学技巧来衡量 Token 有多少是在重复彼此。
如果视频是静态且重复的(比如一个人沿着斜坡滚球),数学模型会显示出“陡峭衰减”(steep decay),这意味着 Token 非常相似。系统随后会说:“好吧,我们可以扔掉很多这些东西!”并只保留极小的一部分。但如果视频是混乱且动态的(比如伴随大量相机运动的赛车追逐),数学模型会显示出“缓慢衰减”(slow decay),这意味着 Token 都是独特的。系统会说:“等等,我们需要保留几乎所有的这些东西!”因此只会切掉很少的部分。
结果:速度提升,却不失精准
该团队在包括 LLaVA-Video、InternVL3 和 Qwen2.5VL 在内的几种流行 AI 模型上进行了测试。他们将这种智能的自适应方法与其他的“无需重新训练”(training-free)方法进行了对比。
结果令人印象深刻。通过使用这种两阶段方法,他们可以大幅减少计算机需要进行的数学运算——最高可达 95%——同时仍保持 AI 的聪明程度。事实上,在一次视频描述基准测试(AI 描述它所见内容)中,当他们仅保留 10% 的 Token 时,他们的方法实际上将准确率提高了 7%。
为了让你理解其差距:如果你有一个视频通常需要超级计算机处理一小时,使用这种方法可以让它在几分钟内运行完毕,而且机器人甚至可能理解得更好,因为它专注于重要的部分,而不是迷失在噪音之中。
为什么这很重要
论文明确反对以往方法中使用的“一刀切”做法。他们表明,使用固定比例(例如始终保留 30% 的数据)是次优的,因为不同的视频需要不同量的数据。他们的这种方法是“事后处理”(post-hoc)的,这意味着它可以在不重新训练现有模型的情况下直接使用,使其成为当前技术的“即插即用”升级版。
作者发现,这种自适应策略在不同的模型规模和视频类型中都能保持一致的效果。他们甚至测试了不同的测量“衰减”的数学方法,并发现指数曲线最符合数据,这证实了他们测量冗余性的方式是最准确的。
简而言之,这篇论文表明,我们不需要构建更大、更慢的大脑来理解视频。相反,我们只需要更聪明地决定喂给它们什么。通过扮演一个知道何时剪掉无聊部分、何时保留精彩部分的精明编辑,我们可以让视频 AI 足够快,能够在日常设备上运行,同时又不会失去清晰观察世界的能力。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。