Not All Visual Tokens Are Equally Safe to Remove:Consequence-Sensitive Visual Token Compression
本文介绍了一种针对视觉语言模型的后果敏感型视觉标记压缩方法,该方法根据误差的潜在代价动态分配计算资源,与传统的基于内容或均匀分配策略相比,显著降低了高风险错误及整体加权误差率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一位繁忙餐厅的主厨,但你有一个严格的规矩:无论你烹饪的是什么菜肴,你只能使用固定数量的食材。通常情况下,厨师们试图通过均匀分配这些食材,让每一道菜的“平均”味道都尽可能好。但如果一道菜只是简单的薯条,而另一道菜却是救命的药物呢?如果你把薯条做砸了,那只是让人恼火;但如果你把药做错了,那就是一场灾难。大多数处理图像并回答问题的计算机程序(被称为视觉语言模型)就像那位传统的厨师。它们试图通过忽略图像中“无聊”的部分来节省计算能力,并假设它们犯下的每一个错误所消耗的能量都是一样的。但在现实世界中,一个错误不仅仅是一个错误,它还标着价格。这篇论文提出了一个简单且具有革命性的问题:如果我们不再试图让“平均”水平的每一餐都完美,而是将我们有限的食材集中在那些出错代价最高的菜肴上,会怎样呢?
由 Jingbo Wen 和 Liang He 领导的研究团队提出了处理这类计算机模型的一种新方法,称为“后果敏感型视觉标记压缩”(consequence-sensitive visual token compression)。为了理解他们的窍门,请不要把图像看作一张单一的照片,而要把它看作是由成千上万个被称为“标记”(tokens)的小瓷砖组成的马赛克。当计算机观察一张照片时,它会处理所有这些瓷砖。为了节省时间和金钱,现有的方法试图丢弃那些看起来不太重要的瓷砖,比如汽车照片中的蓝天。它们通过观察图像本身来决定保留哪些部分。作者认为这就像是“看书看封面”——有时看似“无聊”的背景瓷砖对于针对该图像提出的特定问题来说,实际上是至关重要的。
作者建议,不要只看图片,而是先看“问题”或“任务”。他们意识到,有些问题是“高风险”的(例如:“这张发票的总额是多少?”),而有些则是“低风险”的(例如:“背景是什么颜色?”)。他们的方法分为两步。首先,他们在离线阶段运行一个“校准”阶段,测试模型以确定它需要多少个瓷砖(标记)才能答对高风险问题与低风险问题。然后,当真实用户提出问题时,系统会检查答错该问题的“后果”。如果问题是高风险的,系统会为该图像分配大量的瓷砖预算,确保计算机能看到每一个细节。如果问题是低风险的,它获得的预算就会少得多,从而为重要的任务节省资源。
团队在一个复杂的设置上测试了这一方法,即针对完全相同的图像提出高风险和低风险的问题。这至关重要,因为它证明了改进并非源于图像的不同,而纯粹源于计算机如何决定如何分配其能量。他们发现,通过转移预算,他们可以在不增加总计算量的前提下,将昂贵的高风险错误减少一半以上(从 0.300 降至 0.133)。事实上,由于他们在处理简单问题上花费了更少的时间,整个系统实际上运行速度提高了约 21%。
论文还发现了一个“临界点”。当犯错的成本对每个问题都一样时,最好的策略仍然是平等对待每一个人。但一旦犯错的成本开始发生变化(例如,如果一份医疗报告的错误比一份天气报告的错误严重 5 倍),系统就应该开始将资源大量向危险的问题倾斜。研究人员展示了这种方法在不同类型的文档、图表甚至不同的计算机模型上都是有效的。他们得出结论:我们不应仅仅衡量一个模型的“平均准确率”;我们应该衡量它在多大程度上能有效防止现实世界中那些特定的、代价高昂的错误。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。