Vision Transformers Need Better Token Interaction
本文指出“语义扩散”是视觉 Transformer 在长期训练过程中导致补丁表征退化的原因,并提出用 entmax-1.5 替代 softmax 注意力机制以实现选择性令牌交互,从而在保留全局上下文的同时显著提升密集预测性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是用通俗语言和创意类比对这篇论文的解释。
问题:过度分享的“学生”
想象一下,视觉 Transformer(ViT)就像一个坐满了学生(称为Token)的教室。每个学生观察照片的一小块区域(一个Patch)。
- 目标:老师希望全班完成两件事:
- 识别整张图片(例如:“这是一只狗”)。
- 为狗的每一个部分画出完美的轮廓(例如:“这个像素是耳朵,这个是尾巴”)。这被称为稠密预测。
问题所在:
随着班级学习的时间越来越长,他们在识别狗方面变得非常擅长。然而,他们画轮廓的能力却变得混乱。学生们开始“过度分享”。
论文将这种现象称为语义扩散。这就像后排的一个学生知道答案是“狗”,于是开始向所有人喊出这个事实,甚至包括那些正在看草地或天空的学生。
- 结果:那些看着草地的学生开始想:“哦,既然听到了全局信息,那我肯定也是狗的一部分!”
- 后果:“轮廓”变得模糊。模型认为背景是物体的一部分,导致其在分割(绘制边界)等任务上表现不佳。
旧方案与新思路
之前的研究人员试图通过以下方式解决这个问题:
- 增加“记笔记的人”:给班级分配特殊的学生(Register Tokens),专门用来承载额外的噪声,以免其他人感到困惑。
- 严格规则:告诉学生,“只和坐在你旁边的人说话”(局部窗口)。
作者的洞察:
作者认为,我们不应该禁止全球对话或增加额外的学生。背景确实具有有用的上下文。问题不在于他们与所有人交谈,而在于他们平等地与所有人交谈,即使这毫无意义。
解决方案:“选择性对话”(稀疏注意力)
与其强迫学生只向邻居耳语,作者建议改变投票系统。
- 旧系统(Softmax):想象一种投票方式,每个学生都能获得微小的、非零的注意力。即使一个学生正在看云朵,他仍然能获得全班 0.1% 的注意力。这使得“噪声”得以保留。
- 新系统(Entmax-1.5):这是一种更聪明的投票系统。如果一个学生正在看云朵,系统会说:“你获得**0%**的注意力。你被忽略了。”
- 它并没有阻止学生看到整个房间(全局连接得以保留)。
- 它只是确保如果某种连接没有用处,它就会被完全切断(权重为零)。
这就像一个过滤器。与其让少量的“狗”信息泄露到“草地”区域,不如让过滤器将其完全阻断。草地保持为草地,狗保持为狗。
尝试后的结果
研究人员在 ImageNet 上训练的标准模型(DINOv1)上测试了这种方法。他们仅仅将“投票系统”(Softmax)替换为“选择性过滤器”(Entmax-1.5),没有添加任何新部件或额外的训练数据。
结果:
- 全局识别(“是什么”):模型在仅仅说出“这是一只狗”方面变得稍微更好。(准确率从 69.50% 提升至 70.06%)。
- 稠密预测(“在哪里”):模型在绘制轮廓方面变得好得多。
- 在VOC数据集(物体边界的标准测试)上,分数显著跃升(从 42.80 提升至 48.78)。
- 在ADE20K和Cityscapes等其他复杂地图上也得到了提升。
- 视觉效果:当他们查看计算机对图像的“心理地图”时,新模型具有更清晰、更锐利的边界。背景不再渗入物体中。
核心结论
该论文声称,视觉 Transformer 在绘制边界时变得混乱,是因为它们让全局信息传播得太自由,就像谣言在人与人之间传递时逐渐失真一样。
通过切换到稀疏注意力机制(Entmax-1.5),模型学会了变得具有选择性。它既顾全大局,又阻止“噪声”扩散到不属于它们的区域。这使得模型在识别物体和精确定位物体方面都表现得更好,而且完全不需要更复杂的架构。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。