OccamToken: Efficient VLM Inference with Training-Free and Budget-Adaptive Token Pruning
OccamToken 是一种无需训练且能自适应预算的框架,它通过将脆弱的绝对令牌排名替换为基于寄存器锚定的相对证据测试,从而提升视觉 - 语言模型的推理效率,在实现极端令牌压缩(例如将 2,880 个令牌减少至约 40 个)的同时保留超过 93% 的原始准确率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是关于 OccamToken 论文的解释,将其拆解为简单概念并辅以日常类比。
核心难题:厨房里的噪音太多
想象你是一位厨师(AI),正试图根据顾客的订单(文本问题)和一大堆食材(图像)来烹饪一道菜。
在现代 AI 中,当你展示一张图像时,计算机会将其分解为成千上万个微小的部分,称为“令牌”(tokens)。如果你有一张高分辨率的照片,那就相当于拥有一堆 2,880 份食材。厨师在开始烹饪前,必须查看每一个食材。即使其中大部分食材只是背景噪音(比如柜台上的灰尘或一片模糊的天空),这也需要耗费巨大的时间和能量(计算能力)。
旧方法:“前 10 名”规则
过去,为了节省时间,人们试图扔掉“最不重要”的食材。他们使用类似这样的规则:“保留前 100 个最有趣的食材,扔掉其余的。”
这篇论文认为,由于以下两个原因,这条规则行不通:
- “尖叫婴儿”效应:有时,一个无聊的食材(比如一面空墙)会因为计算机的计算方式而意外获得极高的“重要性评分”。这种巨大的噪音淹没了那些安静但重要的食材(比如照片中的微小细节),导致计算机误以为那些无聊的东西实际上是最重要的。
- “一刀切”问题:固定的规则(比如“保留 100 个”)并不适用于每一张图片。
- 如果你在一张森林的照片中问:“有猫吗?”,你只需要检查几个位置。保留 100 个位置是浪费。
- 如果你在一张毛衣的照片中问:“织物的纹理是什么?”,你可能需要查看更多的位置。如果只保留 100 个,可能会让你错过答案。
新方案:OccamToken
作者们创造了一种名为 OccamToken 的新方法。他们不再问:“哪 100 个是前 100 名?”,而是问:“这个食材是否比我们的‘参考罐’更有用?”
以下是其逐步工作原理:
1. “参考罐”(注册令牌)
想象你在柜台上有一个特殊的罐子,里面装着“厨房里所有东西”的通用、平均样本。它不知道具体的猫或毛衣;它只持有房间的“背景氛围”。
- 为何有帮助:在旧系统中,“尖叫婴儿”(无聊的噪音)会窃取所有的注意力。但在新系统中,“参考罐”会吸收这些噪音。它充当了无用、响亮信号的海绵。
- 结果:现在,计算机可以清楚地看到哪些食材实际上是特殊的,因为噪音已经被抑制了。
2. 第一阶段:“图像清理”(冗余剪枝)
在厨师阅读顾客订单之前,厨房工作人员会进行一次快速清扫。
- 他们将每个食材与参考罐进行比较。
- 如果某个食材看起来就像罐子里的通用背景,它就会被扔掉。
- 类比:如果照片是一条繁忙的街道,工作人员会扔掉那 2,000 个仅仅是“天空”或“模糊路面”的令牌,因为参考罐已经知道那是什么样子的。他们保留那些看起来与罐子不同的令牌(汽车、行人)。
- 优势:这对每张图片都是自动进行的。简单的照片会被大量清理;复杂的照片清理得较少。
3. 第二阶段:“顾客订单”检查(相关性剪枝)
现在,厨师阅读具体的问题:“左边的男人站着吗?”
- 厨师查看剩余的食材。
- 他们再次将它们与参考罐进行比较,但这次他们问的是:“这个食材是否比通用背景更能帮助回答具体问题?”
- 类比:如果问题是关于那个男人的,厨师会保留显示那个男人和他站立的地面的令牌。如果问题是关于角落里的猫,厨师会保留那些令牌,而扔掉那个男人。
- 优势:保留的食材数量会根据问题而变化。简单的问题可能只需要 10 个令牌;困难的问题可能需要 50 个。
结果:工作量更少,味道不变
这篇论文在几个 AI 模型(如 LLaVA 和 Qwen)上测试了这种方法。
- 主张:他们成功扔掉了 98.6% 的食材(从 2,880 个令牌减少到约 40 个),并且仍然在 93% 的情况下得到了正确的答案。
- 类比:这就像意识到你不需要尝遍锅里每一粒米就能知道它是否咸了。你只需要尝对的那几勺。
- 无需训练:最好的一点是,他们不需要重新教导厨师如何烹饪。他们只是改变了厨师选择食材的规则。它可以“开箱即用”。
总结
OccamToken 是一个智能过滤器,阻止 AI 浪费时间查看无聊的背景噪音。它不使用僵化的“保留前 100 名”规则,而是利用“参考罐”来找出对于所提出的具体问题而言,什么是真正新颖且有用的。这使得 AI 运行得更快、成本更低,而不会使其变得“更笨”。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。