CLIP Tricks You: Training-free Token Pruning for Efficient Pixel Grounding in Large VIsion-Language Models
本文介绍了 LiteLVLM,这是一种无需训练、由文本引导的令牌剪枝方法,通过逆转 CLIP 的视觉 - 文本相似度排序来高效保留用于大视觉语言模型像素定位的指代区域,在显著加速并降低内存占用的同时,性能优于现有方法。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你拥有一个非常智能的机器人助手(大型视觉语言模型),它可以查看图片并回答关于图片的问题。但存在一个问题:为了“看见”图片,机器人会将图像分解为成千上万个微小的拼图块,称为令牌(tokens)。
当你向机器人提出一个简单的问题,例如“球在哪里?”,它仍然必须处理所有那些成千上万个拼图块,包括那些显示天空、草地或背景的部分。这就像要求图书管理员为了找到关于猫的一句特定话语,而阅读图书馆里的每一本书。这种方式既缓慢、昂贵,又浪费大量能源。
这篇论文介绍了一种名为LiteLVLM的新技巧来解决这个问题。以下是其工作原理的简明解释:
问题所在:“聪明”的机器人被误导了
以往的方法试图通过丢弃“无聊”的拼图块来加速处理。它们认为:“让我们保留那些最像你所输入文字的拼图块。”
- 旧方法:如果你问“找到球”,机器人会寻找与单词“球”完全匹配的图像拼图块,并保留这些块。
- 意外发现:作者发现,对于需要精确指出某物位置(像素级定位)的任务,这种逻辑恰恰是反的!
- 类比:想象你在拥挤的房间里寻找一位戴着红帽子的人。基于 CLIP 系统的“智能”机器人在听到“红帽子”时,实际上会将注意力集中在人群和背景上,因为这些是房间里最常见的事物。而那个真正戴着红帽子的人如此独特,以至于机器人的内部系统认为:“这看起来不像我所知道的‘红帽子’的通用概念”,并试图忽略它。
- 结果:旧方法丢弃了它们真正需要的拼图块(戴帽子的人),却保留了背景噪音。
解决方案:"LiteLVLM"(逆向心理技巧)
作者意识到,为了找到特定的物体,他们实际上应该保留那些看起来最不像文本描述的拼图块,并丢弃那些看起来最像的。
- “逆向”过滤器:LiteLVLM 不是保留与单词“球”匹配的拼图块,而是保留那些与单词“球”匹配度较差的拼图块。
- 为什么? 因为球的独特、具体细节(其确切形状、纹理和位置)往往如此具体,以至于它们看起来不像通用的“文本概念”中的球。通过保留这些“不匹配”的拼图块,机器人实际上保留了物体最重要的细节。
- “上下文”安全网:如果只保留“不匹配”的拼图块,你可能会丢失背景(例如球所在的草地)。因此,LiteLVLM 还会抓取一些额外的拼图块,帮助机器人理解整个场景,以确保它不会感到困惑。
- 无需训练:最棒的是,这是一个“无需训练”的技巧。你不需要教机器人任何新东西。你只需在机器人开始思考之前,改变保留哪些拼图块的规则。这就像在不重建工厂的情况下,更改传送带上的指令。
结果:更快、更轻量、更智能
通过使用这种“逆向心理”方法,LiteLVLM 取得了惊人的成果:
- 速度:运行速度快 22%。
- 内存:使用的内存减少 2.3 倍。
- 准确性:即使丢弃了约三分之二的图像拼图块,它仍能**正确回答 90%**的问题。
一句话总结
可以将旧方法想象成一名保安,他因为认为“红衬衫”是可疑关键词而拦住所有穿红衬衫的人。但真正的窃贼穿的却是蓝衬衫!保安因此错过了窃贼。
LiteLVLM 则是那位新保安,他说:“实际上,让我们拦住所有除了穿红衬衫的人之外的人,因为窃贼很可能就藏在穿红衬衫的人群中,大摇大摆地混在其中。”通过翻转逻辑,机器人能够更快、更省力地找到你要求的确切内容。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。