When Do Fewer Visual Tokens Accelerate Multimodal Inference? A Break-Even Study Across Decision Locations and Hardware
本文通过一个可复现的盈亏平衡分析表明,减少视觉标记并不一定会加速多模态推理,并揭示了在 A100 等 GPU 上,由于避免了预处理和编码开销,尽管实现下游标记减少的幅度较小,但预视觉路由(pre-vision routing)的表现仍优于后视觉剪枝(post-vision pruning)。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图解决一个谜题,但在你甚至能看到碎片之前,你必须先给整张桌子拍一张照片。在人工智能领域,特别是那些能够看图识字的“多模态”模型中,计算机做的也是类似的事情。它获取一张图像,将其转化为一长串数字“标记”(就像微小的拼图碎片),然后将这个列表输入给一个类脑语言模型来回答问题。照片越大、越详细,标记就越多,计算机需要做的工作也就越多。
长期以来,人们有一个简单的假设:如果你能在计算机开始思考之前扔掉一些这些拼图碎片,它完成工作的速度就会更快。这就像是在想,如果只给厨师一半的食材,他们就能缩短一半的烹饪时间。但这篇论文提出了一个棘手的问题:事实真的如此吗?有时候,决定要扔掉哪些碎片本身所花费的时间,或者决策发生得太晚,会导致计算机最终的工作量反而和直接看完整张图片时一样多,甚至更多。作者们想要找出那个“扔掉碎片实际上能节省时间”的精确时刻,以及什么时候它只会制造交通拥堵。
哈尔滨工业大学的研究人员决定通过一项非常严谨的“盈亏平衡”研究来测试这个想法。他们不仅仅是在猜测,而是精确到了毫秒级进行测量。他们观察了两种主要的提速方式:一种是在计算机已经处理完照片之后再决定保留什么(后视觉阶段),另一种是在相机按下快门之前就做出决定(前视觉阶段)。
以下是他们的发现,这有点像剧情反转。他们测试了一种“智能”方法,试图在图像处理完成后预测哪些标记值得保留。尽管这种方法成功扔掉了大量数据(在答对的例子中平均仅保留了约24%的标记),但在他们的初步测试中,它并没有让计算机变得更快。这就像是雇佣了一位超级快速的剪辑师来剪辑电影,但剪辑师在剪辑之前花了太多时间观看整部电影,导致最终成片的总时长比直接观看原片还要长。
然而,当你观察“前视觉”方法时,故事发生了变化。这就像是在拿起相机之前,就决定拍一张更小的照片。研究人员发现了一个基于图像大小的简单规则,该规则可以跳过拍摄高分辨率照片并对其进行完整处理的繁重工作。在他们的测试硬件上,这个简单的规则确实节省了时间。
但最令人惊讶的部分在于:在他们的一台高性能计算机(A100)上,一种扔掉更多标记的方法,竟然比一种扔掉较少标记的方法节省的时间更少。为什么呢?因为那种扔掉更多标记的方法做得太晚了。它已经支付了处理完整高分辨率图像的“税款”。当它开始剔除内容时,昂贵的工作已经完成了。而采用“前视觉”规则的方法则完全避开了这项昂贵的工作。这就像是尝试“反向烘焙一个蛋糕”(太晚了,你已经用了烤箱),与“决定干脆不买面粉”之间的区别(省去了整个去商店的过程)。
论文得出结论:你不能仅仅通过计算节省了多少标记,就假设你节省了时间。你必须观察你是在“何时”做出决定的。如果你决定得太晚,你就已经浪费了能量。提高速度的“稳妥”方式并不总是关于做一个最聪明的标记守护者;有时,关于在重型机械启动之前做一个快速、简单的决定。研究人员谨慎地表示,这并不是解决所有情况的万能药,但它证明了在速度竞赛中,时机就是一切,而且有时最简单的规则才是赢家。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。