How Many Visual Tokens Do Multimodal Language Models Need? Scaling Visual Token Pruning with F^3A
本文介绍了 F^3A,一种无需训练的视觉令牌剪枝路由器,它通过将剪枝视为任务条件证据搜索来动态分配固定令牌预算,从而在不需额外训练且不破坏原始解码流程的情况下降低多模态模型的推理成本。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是用简单语言和创意类比对这篇论文的解读。
核心问题:我们实际上需要图片的多少部分?
想象你正在解一道谜题,有人递给你一张巨大且高分辨率的照片来帮你找到答案。这张照片细节丰富,包含数百万个微小的像素。
在人工智能的世界里,这些“像素”被称为视觉令牌(visual tokens)。当前的人工智能模型(多模态大语言模型)就像才华横溢的侦探,想要查看照片中的每一个像素,以确保不会遗漏任何线索。但查看数百万个像素既耗时又消耗大量电池电量(计算资源)。
研究人员提出了一个简单的问题:如果我们的时间和能量有限,为了得到正确答案,我们实际上需要保留多少像素?
当前方法的问题:“一次性”猜测
目前,大多数人工智能系统试图通过“一次性”规则来减少像素数量。它们只看一次照片,然后说:“哦,这部分很亮,所以很重要”,或者“这部分很模糊,所以把它扔掉”。
作者认为,这就像试图通过只查看干草堆的最顶层来寻找一根特定的针。如果针藏在深处或者是暗淡的颜色,简单的“亮度”检查就会漏掉它。他们称之为静态排序(static ranking)。这种方法不关心具体问题是什么,只是基于通用规则进行猜测。
解决方案:F3A(果蝇觅食策略)
这篇论文介绍了一种名为F3A(果蝇觅食算法,Fruit-Fly-Foraging Algorithm)的新方法。要理解它,可以想象一只正在寻找腐烂水果的果蝇。
气味(气味场): 果蝇不仅仅是看水果,它还会嗅闻空气。它会绘制一张“地图”,显示气味最浓烈的地方。
- 在人工智能中: 人工智能不是只看图像,而是先阅读问题。它根据问题所问的内容创建一张“气味地图”。如果问题是“帽子的颜色是什么?”,人工智能就知道要“嗅闻”帽子,而不仅仅是寻找亮斑。
三步狩猎: 果蝇不会随机降落,它使用一种聪明的策略:
- 第一步:粗略搜索(大网): 果蝇飞得高高的,寻找气味浓烈的大致区域。它此时不会挑选单片叶子,而是挑选整根树枝。
- 在人工智能中: 系统查看图像的大块区域,以找到与问题相关的大致区域。
- 第二步:视觉锁定(变焦): 一旦找到有希望的树枝,它就降落并仔细查看,以确认水果确实存在,而不仅仅是一片闻起来像水果的叶子。它避免挑选紧挨着的两片叶子(减少冗余)。
- 在人工智能中: 系统放大这些特定区域,挑选确切的最佳令牌,确保不会重复挑选相同的内容。
- 第三步:救援跳跃(安全网): 有时水果藏在果蝇错过的奇怪角落。果蝇有一条规则:“如果我还没找到足够的水果,我就跳到随机位置以防万一。”
- 在人工智能中: 如果系统意识到它漏掉了一个微小但至关重要的细节(比如微小的文字标签或小物体),它就会“救援”这些令牌,以免它们丢失。
- 第一步:粗略搜索(大网): 果蝇飞得高高的,寻找气味浓烈的大致区域。它此时不会挑选单片叶子,而是挑选整根树枝。
为何重要:结果
研究人员在各种不同的人工智能模型上测试了这种“果蝇”策略,从小型模型(20 亿参数)到巨型模型(2350 亿参数)不等。
- “固定预算”测试: 他们告诉人工智能:“你只能看图片的 20%。”
- 结果: 果蝇人工智能(F3A)与查看整张图片相比,93.86% 的情况下给出了正确答案。其他方法(如“一次性”猜测者)的正确率低得多。
- “固定目标”测试: 他们告诉人工智能:“你必须答对 97% 的问题,但使用的像素要尽可能少。”
- 结果: 果蝇人工智能只需要 39.9% 的像素就能达到该目标。而次优方法需要 50.1% 的像素。
核心结论
该论文声称,如何分配注意力比模型的大小更重要。
F3A 不再基于通用规则盲目地削减图像,而是将图像视为一张藏宝图。它利用问题来引导一个聪明的三步搜索(气味、锁定、救援),以找到所需的确切线索。这使得人工智能能够更快、使用更少的内存,同时不丧失其理解世界的能力。
简而言之: 不要仅仅因为图片看起来“冗余”就扔掉一半。利用问题来搜寻你需要的具体证据,就像果蝇寻找水果一样。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。