ClustViT: Clustering-based Token Merging for Semantic Segmentation
ClustViT 通过引入一个可训练的聚类模块,该模块在伪聚类的引导下合并相似令牌,以及一个恢复精细细节的再生器模块,从而解决了视觉 Transformer 在语义分割中的二次方复杂度问题,在保持精度不变的同时实现了显著的 computational 效率提升和更快的推理速度。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图在电话里向朋友描述一幅复杂的画作。这幅画有一大片单调的蓝色天空、几棵轮廓分明的树,以及一只微小却细节丰富的鸟。
标准的“视觉 Transformer"(即本文旨在改进的 AI 模型)试图以同等的细节描述画作的每一平方英寸。它在描述空旷的蓝天上花费的时间和脑力,与描述那只小鸟时完全一样。这非常精准,但同时也缓慢且耗费大量能量——就像为了走到邮箱取信,却背着一装满沉重石头的背包一样。
本文的作者,ClustViT,问道:“如果我们已经知道哪些部分是相同的,为什么还要描述每一个像素呢?”
以下是他们解决方案的简单步骤分解:
1. 问题:过多的噪声
当前的“语义分割”AI 模型(即一种对图像中每个像素进行“标记”的 fancy 说法)在识别物体方面表现出色。但它们速度缓慢,因为它们将图像的每个部分视为同等重要。如果你是一个试图穿过田野的机器人,你并不需要单独分析每一片草叶;你只需要知道“这是草地”即可。
2. 解决方案:“分组”策略
作者们创建了一个名为ClustViT的新系统。把它想象成一个智能编辑器,它查看图像后说道:“好吧,这 100 个像素都只是‘天空’,所以让我们把它们归为一组,当作一个单一的信息块来处理。”
他们利用 AI 大脑中的两个特殊工具来实现这一点:
聚类模块(分组工具):
想象你有一堆混合的乐高积木。与其查看每一块积木,不如快速将它们分类到桶中:“红色类”、“蓝色类”和“特殊件”。
在 AI 中,该模块查看图像,并利用一张“作弊表”(从真实标签中学习而来)来寻找属于同一语义类别(如“水”或“草地”)的像素。它将所有相似的像素合并为一个代表性标记(token)。- 结果: AI 现在只需将 100 个像素当作 1 个来处理。这使得数学运算快得多。
再生模块(细节恢复器):
这里是棘手之处:如果你只是合并像素,就会丢失绘制最终图像所需的精细细节。
因此,在 AI 完成快速分组处理后,再生器便会介入。它利用那个单一的“分组”信息块说道:“好吧,我知道这代表天空,所以我会将其扩展回去,填满原始空间。”- 结果: AI 获得了分组的速度,但最终输出看起来仍然拥有所有原始的精细细节。
3. “作弊表”(伪聚类)
AI 如何知道哪些像素需要分组?它使用了一种巧妙的训练技巧。在训练期间,AI 会看到“正确答案”(即图像的完美地图)。它利用这张地图创建一个“伪聚类”指南。它学会了:“哦,我看到所有这些像素都被标记为‘水’,所以我应该将它们合并。”它学会基于含义而非随机相似性来进行分组。
4. 结果:更快、更轻、依然智能
作者在三种不同类型的图像上测试了该方法:
- ADE20K: 室内和室外场景的混合(非常复杂)。
- SUIM: 水下场景(主要是水,有一些物体)。
- RumexWeeds: 农田(主要是草/杂草)。
发生了什么?
- 速度: 新模型比标准模型快达1.64 倍。
- 效率: 它使用的计算能力(能量)减少了高达2.18 倍。
- 准确性: 它保持了与缓慢、庞大的模型几乎相同的准确性。
最佳平衡点:
论文指出,这在“机器人”场景中效果最佳,即存在大量背景的情况(例如机器人观察田野或水下)。在这些情况下,AI 可以将巨大的“背景”块合并为单个标记,从而节省大量能量。在非常混乱、复杂的图像中,节省的幅度较小,但该模型仍然运作良好。
总结
ClustViT 就像一位聪明的助手,它意识到在描述一个房间时,你不需要列出地板上的每一粒灰尘。你可以说“地板”(将灰尘分组),然后只放大查看重要的家具。这使得描述生成速度快得多,但听众仍然能清晰地看到房间的全貌。
这使得机器人能够以更快的速度和更少的电池电量“看见”并理解它们的世界,同时不会失去发现重要细节的能力。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。