TOPS: First-Principles Visual Token Pruning via Constructing Token Optimal Preservation Sets for Efficient MLLM Inference
本文介绍了 TOPS,一种无需训练且与模型无关的视觉 Token 修剪方法,它通过基于任务相关性、信息覆盖度和语义多样性来构建最优保留集,从而在保持甚至提升性能的同时,显著提高多模态大语言模型(MLLM)的推理效率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你有一个巨大的图书库(视觉标记/visual tokens),一个超级聪明的机器人(多模态大语言模型)需要阅读这些书来回答问题。问题在于,这个图书馆实在太庞大了,导致机器人感到应接不暇,阅读速度极慢,并且仅仅是翻页就会耗尽所有的能量。
长期以来,人们一直试图通过告诉机器人“跳过那些无聊的页面!”来提供帮助。但旧的方法有点笨拙:
- “注意力”(Attention)方法:就像一个只看那些字体最大、最粗黑页面的机器人。它经常会因为某些细节是用小字写的就忽略掉重要的细节,或者因为它看起来很相似就对着同一个段落反复阅读五遍。
- “多样性”(Diversity)方法:就像一个试图挑选看起来各不相同的页面的机器人。它可能会选出一页关于猫的页面和一页关于车的页面,但它可能会在不经意间扔掉了那页真正能回答用户特定问题的页面。
TOPS 登场:聪明的图书管理员
这篇论文介绍了一种名为 TOPS(Token Optimal Preservation Sets,标记最优保留集)的新方法。TOPS 不再只是靠猜测来决定保留哪些页面,而是像一位遵循第一性原理、高度组织化的图书管理员,在决定哪些内容留在书架上之前,会提出三个具体的问题:
- “这个页面与问题相关吗?”(任务相关性/Task Relevance)
- 类比: 如果用户问“汽车是什么颜色的?”,图书管理员立刻就知道要保留有汽车的那一页,并扔掉关于天空的那一页。
- “这个页面涵盖了新内容吗?”(信息覆盖度/Information Coverage)
- 类比: 如果我们已经有一页描述了汽车的红色车漆,我们就不需要第二页也说同样的话。我们需要的是能告诉我们一些新东西的页面,比如汽车的车牌号。
- “这个页面与我们已选中的其他页面相比是否独特?”(语义多样性/Semantic Diversity)
- 类比: 我们不想要一叠五页都说“汽车是红色的”页面。我们想要一页说“红色”,一页说“快速”,再一页说“陈旧”。这确保了我们在不重复的情况下获得完整的图景。
在现实生活中是如何运作的
论文表明,TOPS 不需要经过专门训练(它是“无需训练”的/training-free)。它可以被插入到不同的机器人大脑(如 LLaVA、Qwen 或 InternVL)中,并立即投入使用。
- “两阶段”清理法: 想象机器人正在阅读一段长视频。
- 第一阶段: TOPS 进行快速扫描,在机器人开始深度思考之前,就把明显的垃圾信息(如空白帧或模糊镜头)扔掉。
- 第二阶段: 在机器人阅读的过程中,TOPS 会密切关注对话。如果机器人开始谈论某个特定的细节,TOPS 会确保最相关的视觉页面仍然存在,从而针对该特定问题对选择进行精细化调整,达到完美效果。
结果:少即是多
论文声称,通过使用这种聪明的“三问法”,TOPS 可以扔掉高达 90% 的视觉页面(标记/tokens),而机器人的回答水平依然能与阅读了所有内容时一样出色。
- 神奇的数据: 在一个特定模型(LLaVA-NeXT)上,TOPS 移除了 77.8% 的视觉数据,但实际上甚至略微提升了机器人的性能(达到 100.6%)。
- 为什么? 论文指出,通过迫使机器人忽略“废话”和冗余页面,它实际上阻止了机器人产生困惑或编造事实(幻觉)。这就像清理杂乱的桌面;有时,拥有更少的资料反而能帮你更快地找到正确的东西,并让你思考得更清晰。
总结
TOPS 是一种让 AI 模型更快、更聪明的新方法,它扮演着一个更严格、更聪明的编辑角色。它不再仅仅是挑选那些“最响亮”或“最不同”的视觉线索,而是构建了一套完美的、紧凑的线索集,这些线索既相关于问题,又覆盖了所有必要的信息,且彼此不重复。其结果是,机器人思考得更快,占用内存更少,并且能给出更好的答案。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。