Evading Visual Aphasia: Contrastive Adaptive Semantic Token Pruning for Vision-Language Models
本文介绍了 COAST,这是一种无需训练、基于对比的自适应语义令牌剪枝框架,它通过依据上下文分散度和对比路由动态保留关键视觉令牌来防止“视觉失语症”,在各类视觉 - 语言模型中实现了显著的推理加速,同时保持了接近原始的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是用通俗易懂的语言和日常类比对论文《规避视觉失语症》的解释。
核心问题:“视觉失语症”故障
想象一下,你聘请了一位非常聪明的侦探(即人工智能),让他根据一张照片和一个具体问题来破解谜团。
大多数当前的人工智能模型就像那些过于急于讨好的侦探。当他们查看照片时,会立即聚焦于最大、最亮、最显眼的事物(例如沙漠中的一头巨型骆驼)。如果你问他们关于背景中微小细节的棘手问题(例如咖啡馆上的一个小招牌),他们往往会完全忽略背景,因为乍看之下它并没有引起他们的注意。
这篇论文将这种失败模式称为"视觉失语症"。这就像侦探突然失去了“看见”视觉证据的能力。他们仍然理解你的话语,但无法再将其与图片联系起来。因此,他们不是根据照片中实际存在的内容,而是根据故事中通常会发生的情况(语言先验)来进行猜测。
- 结果:你问:“这家咖啡馆叫什么名字?”人工智能看到一头骆驼,便自信地回答:“骆驼咖啡馆”,尽管招牌上清楚地写着“每日研磨(Daily Grind)”。
为什么会发生这种情况?
论文指出,当前的人工智能模型在早期就犯了一个错误。他们试图通过在一开始就丢弃图像中“无聊”的部分来加快速度。他们使用了一条简单的规则:“如果图像的某一部分此刻没有引起太多注意,就将其删除。”
但研究人员发现,这条规则是有缺陷的。图像中的一些部分起初看起来无聊,但后来却变得至关重要。
- 类比:想象你在读一本侦探小说。第一章中,一个角色随口提到了一扇“红门”。这似乎无关紧要。但在第十章,那扇红门却是破案的关键。如果你在第一章为了节省时间而删除了关于红门的句子,到了第十章你就会迷失方向。
- 现实:在人工智能中,“低注意力”标记(即那些无聊的部分)往往会在人工智能试图理清复杂关系(例如“骆驼后面是什么?”)时,转变为“高注意力”标记。如果过早地切断它们,人工智能就会失去正确回答问题所需的上下文。
解决方案:COAST(聪明的导游)
作者创建了一种名为COAST(对比自适应语义标记剪枝)的新方法。COAST 不像只是剪掉“无聊”部分,它更像是一位聪明的导游,确切知道该保留什么。
COAST 不仅仅依据单一分数来决定保留什么,而是采用两步策略:
“锚点”(主要景点):
首先,它识别出图像中直接回答问题的特定部分(即“锚点”)。如果你问的是关于一顶帽子的问题,它就会保留帽子。这就是“语义证据”。“上下文”(周围环境):
这是神奇的部分。COAST 意识到,有时你需要背景来理解前景。它有意识地保留图像中一些“低注意力”的部分,这些部分充当地图或参考框架。- 类比:如果你在人群中寻找一个特定的人,你不仅仅要看那个人,还需要看到站在他们旁边的人,才能知道他们是谁。COAST 会保留“站在人旁边的人”,即使他们不是主要焦点。
它如何决定保留什么(“熵”表)
COAST 拥有一个名为注意力熵的特殊仪表。你可以将其视为一个“困惑度计”。
- 低困惑(专注): 如果人工智能非常确定它在看什么(例如“那是一只猫”),COAST 就会主要保留猫,并丢弃其余部分。
- 高困惑(分散): 如果人工智能正在观察一个包含许多物体和关系的复杂场景,“困惑度计”的读数就会上升。COAST 看到这种情况后会说:“好吧,这很棘手。我需要保留更多的背景上下文,以帮助人工智能弄清楚。”
它会根据问题的难度,动态调整保留多少“主要主体”与“背景上下文”。
结果:更快更聪明
该论文在七个不同的基准测试(类似于人工智能的期末考试)中测试了 COAST。
- 速度:它将人工智能需要处理的图像片段(标记)数量减少了近78%。这使得人工智能的运行速度提高了2.15 倍。
- 准确性:尽管删除了如此多的数据,人工智能仍保留了其原始智能的98.6%。
- 胜利:与其他导致“视觉失语症”(产生错误答案的幻觉)的方法不同,COAST 让人工智能保持了现实根基。它通过保留背景中的小招牌,解决了“骆驼咖啡馆”问题,使人工智能能够正确读出“每日研磨”。
总结
- 旧方法:“删除当前不是主要焦点的一切。” -> 结果:人工智能感到困惑并产生幻觉。
- COAST 方法:“保留主要焦点,但也保留足够的背景上下文以帮助我们理解关系,特别是当场景复杂时。” -> 结果:人工智能更快,但仍能看到全貌并给出正确答案。
论文得出结论,通过将图像压缩视为一个智能路由问题(决定保留什么,而不仅仅是削减多少),我们可以在不使人工智能“失明”的情况下使其速度更快。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。