← 最新论文
🤖 AI

TOPS: First-Principles Visual Token Pruning via Constructing Token Optimal Preservation Sets for Efficient MLLM Inference

本文介绍了 TOPS,一种无需训练且与模型无关的视觉 Token 修剪方法,它通过基于任务相关性、信息覆盖度和语义多样性来构建最优保留集,从而在保持甚至提升性能的同时,显著提高多模态大语言模型(MLLM)的推理效率。

原作者: Tinghao Wang, Yichen Guo, Rui Huang, Zheng Lu, Qizhe Zhang, Chenxi Li, Yuan Zhang, Jiajun Cao, Zhirong Shen, Yaosong Du, Guangyan Gan, Wenya Wang, Lin William Cong, Shanghang Zhang

发布于 2026-06-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Tinghao Wang, Yichen Guo, Rui Huang, Zheng Lu, Qizhe Zhang, Chenxi Li, Yuan Zhang, Jiajun Cao, Zhirong Shen, Yaosong Du, Guangyan Gan, Wenya Wang, Lin William Cong, Shanghang Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一个巨大的图书库(视觉标记/visual tokens),一个超级聪明的机器人(多模态大语言模型)需要阅读这些书来回答问题。问题在于,这个图书馆实在太庞大了,导致机器人感到应接不暇,阅读速度极慢,并且仅仅是翻页就会耗尽所有的能量。

长期以来,人们一直试图通过告诉机器人“跳过那些无聊的页面!”来提供帮助。但旧的方法有点笨拙:

  • “注意力”(Attention)方法:就像一个只看那些字体最大、最粗黑页面的机器人。它经常会因为某些细节是用小字写的就忽略掉重要的细节,或者因为它看起来很相似就对着同一个段落反复阅读五遍。
  • “多样性”(Diversity)方法:就像一个试图挑选看起来各不相同的页面的机器人。它可能会选出一页关于猫的页面和一页关于车的页面,但它可能会在不经意间扔掉了那页真正能回答用户特定问题的页面。

TOPS 登场:聪明的图书管理员

这篇论文介绍了一种名为 TOPS(Token Optimal Preservation Sets,标记最优保留集)的新方法。TOPS 不再只是靠猜测来决定保留哪些页面,而是像一位遵循第一性原理、高度组织化的图书管理员,在决定哪些内容留在书架上之前,会提出三个具体的问题:

  1. “这个页面与问题相关吗?”(任务相关性/Task Relevance)
    • 类比: 如果用户问“汽车是什么颜色的?”,图书管理员立刻就知道要保留有汽车的那一页,并扔掉关于天空的那一页。
  2. “这个页面涵盖了新内容吗?”(信息覆盖度/Information Coverage)
    • 类比: 如果我们已经有一页描述了汽车的红色车漆,我们就不需要第二页也说同样的话。我们需要的是能告诉我们一些新东西的页面,比如汽车的车牌号。
  3. “这个页面与我们已选中的其他页面相比是否独特?”(语义多样性/Semantic Diversity)
    • 类比: 我们不想要一叠五页都说“汽车是红色的”页面。我们想要一页说“红色”,一页说“快速”,再一页说“陈旧”。这确保了我们在不重复的情况下获得完整的图景。

在现实生活中是如何运作的

论文表明,TOPS 不需要经过专门训练(它是“无需训练”的/training-free)。它可以被插入到不同的机器人大脑(如 LLaVA、Qwen 或 InternVL)中,并立即投入使用。

  • “两阶段”清理法: 想象机器人正在阅读一段长视频。
    • 第一阶段: TOPS 进行快速扫描,在机器人开始深度思考之前,就把明显的垃圾信息(如空白帧或模糊镜头)扔掉。
    • 第二阶段: 在机器人阅读的过程中,TOPS 会密切关注对话。如果机器人开始谈论某个特定的细节,TOPS 会确保最相关的视觉页面仍然存在,从而针对该特定问题对选择进行精细化调整,达到完美效果。

结果:少即是多

论文声称,通过使用这种聪明的“三问法”,TOPS 可以扔掉高达 90% 的视觉页面(标记/tokens),而机器人的回答水平依然能与阅读了所有内容时一样出色。

  • 神奇的数据: 在一个特定模型(LLaVA-NeXT)上,TOPS 移除了 77.8% 的视觉数据,但实际上甚至略微提升了机器人的性能(达到 100.6%)。
  • 为什么? 论文指出,通过迫使机器人忽略“废话”和冗余页面,它实际上阻止了机器人产生困惑或编造事实(幻觉)。这就像清理杂乱的桌面;有时,拥有更少的资料反而能帮你更快地找到正确的东西,并让你思考得更清晰。

总结

TOPS 是一种让 AI 模型更快、更聪明的新方法,它扮演着一个更严格、更聪明的编辑角色。它不再仅仅是挑选那些“最响亮”或“最不同”的视觉线索,而是构建了一套完美的、紧凑的线索集,这些线索既相关于问题,又覆盖了所有必要的信息,且彼此不重复。其结果是,机器人思考得更快,占用内存更少,并且能给出更好的答案。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →