Do All Visual Tokens Matter Equally? Object-Evidence Preserving Token Merging for Vision-Language Retrieval
该论文提出了 SaMer,一种面向对象的标记合并框架,它通过在训练过程中保留关键的对象级证据,显著压缩了用于视觉-语言检索的图像侧标记,从而在无需在推理阶段需要地面真值边界框的情况下,降低了存储成本并提升了检索性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你拥有一个海量的照片库,你想找到那张显示“一只戴着帽子的猫”的照片。在过去,计算机通过观察整张照片并给出一个单一的“氛围分”。但这就像仅仅通过闻味道来评价一整个披萨;你可能会错过你最渴望的那块意式腊肠。
现代人工智能试图变得更聪明。它将每张照片分解成数百个微小的拼图碎片(称为“token”或“标记”),并将每个碎片的细节分别保存起来。当你提出问题时,计算机通过检查每一个拼图碎片是否与你的文字匹配来寻找最佳匹配。这对于寻找特定细节非常有效,但也是一场存储噩梦。想象一下,如果你手机里的每张照片都要携带 1,000 个微小的拼图碎片,那该有多麻烦。这不仅占用大量空间,还会让搜索过程变得极其缓慢。
因此,研究人员提出了一个问题:所有这些视觉 token 都同样重要吗?
根据这篇论文的说法,答案是一个响亮的“不”。但棘手之处在于,如果你只是扔掉“无聊”的碎片,或者将看起来相似的碎片揉捏在一起,你可能会不小心把一个“猫”的碎片和“狗”的碎片粘在一起,因为它们都有毛发。如果这样做,你的计算机就无法再找到你要求的特定“猫”了。这就像把一块红色的乐高积木和一块蓝色的乐高积木混合在一起变成了紫色;现在你无法再搭建一座红色的城堡了。
解决方案:SaMer(语义感知合并)
作者提出了一种名为 SaMer 的新方法。你可以把 SaMer 想象成一位超级聪明的图书管理员,他在你提问之前就先组织好了这些拼图碎片。
- 训练技巧: 在计算机学习的过程中,SaMer 使用了一份秘密备忘录(物体标签)来观察实际物体所在的位置。它利用这一点来教导系统:“嘿,即使它们看起来很像,也不要把猫的耳朵和狗的尾巴粘在一起!”它强制系统即使在压缩信息时,也要保持不同物体的独立性。
- 神奇的合并: SaMer 并没有简单地删除 93% 的拼图碎片,而是将它们温柔地融合成了 64 个具有超强代表性的“质心”(centroids)。这些质心并非随机的平均值,而是经过精心设计的摘要,能够完整保留原始物体的身份特征。
- 结果: 当你寻找“一只猫”时,系统仍然可以直接指向“猫”的摘要,而忽略掉旁边的“狗”的摘要,即便这两个摘要紧挨在一起。
数据(证据)
论文并不只是凭感觉猜测,他们使用了真实数据进行了测试。以下是他们的发现:
- 巨大的空间节省: 通过仅使用 64 个 token 而不是原始的数千个,他们将 ColPali 系统的存储需求降低了 16.09 倍。这就像是将一个 263.7 GB 的图书馆缩小到了仅 16.4 GB。
- 速度提升: 由于需要比较的碎片变少了,搜索速度也变得更快了。在一个数据集上,速度(每秒查询数)提升了 4.3 倍;在另一个数据集上,速度几乎提升了 9.1 倍。
- 更高的准确度: 令人惊讶的是,缩小库的大小反而让它在寻找正确照片方面表现得更好。在 Flickr30K 数据集上,成功率(R@1)从 77.0 上升到了 82.4。在 MSCOCO 上,它从 47.4 升至 51.6。
他们排除了什么
作者非常谨慎地指出哪些做法是无效的。他们展示了仅仅丢弃碎片(剪枝)或者仅仅基于颜色相似度进行特征聚合(仅特征池化)会导致计算机丢失对特定物体的追踪能力。如果你只是在不知道它们属于不同物体的情况下,将相似的图块混合在一起,你就会失去随后区分它们的能力。SaMer 表明,关键不在于减少 token 的数量,而在于保留未来问题所需要的“证据”。
他们有多确定?
作者在 Flickr30K、MSCOCO、ImageCoCode 和 DocVQA 等真实世界的数据集上进行了测量。他们发现 SaMer 始终优于其他压缩方法。他们还测量了系统指向文本中提到的图像特定部分的程度(定位能力)。SaMer 显示它比其他方法更好地保留了“短语级证据”,其 “BoxMass” 分数(衡量相关性是否保持在正确物体内的指标)从 41.3 跳升至 54.2。
核心结论
这篇论文表明,对于人工智能高效搜索图像而言,我们不需要删除信息,而是需要更好地组织信息。通过以尊重物体边界的方式合并 token,SaMer 证明了你可以将庞大的图像数据库缩小 16 倍,却不会丢失细节,并且实际上能比以前找得更准。这是速度、存储和准确性的全面胜利。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。