← 最新论文
💻 computer science

What-Where Transformer: A Slot-Centric Visual Backbone for Concurrent Representation and Localization

What-Where Transformer(WWT)引入了一种新颖的基于槽位的视觉 Transformer 架构,该架构将物体外观与空间位置显式解耦为并行的令牌流与注意力图流,从而通过涌现的定位能力实现卓越的零样本物体发现与弱监督分割,且无需额外的后处理。

原作者: Ryota Yoshihashi, Masahiro Kada, Satoshi Ikehata, Rei Kawakami, Ikuro Sato

发布于 2026-05-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Ryota Yoshihashi, Masahiro Kada, Satoshi Ikehata, Rei Kawakami, Ikuro Sato

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正看着一条繁忙的街道。你的大脑会瞬间完成两件事:它识别出是什么东西(一辆红色的公交车、一只狗、一个人),以及它们在画面中的位置在哪里。

长期以来,计算机视觉模型(如著名的"Vision Transformer"或 ViT)在回答“这是什么?”方面表现出色,但在“它确切在哪里?”这个问题上却显得力不从心。它们倾向于将这两个概念混为一谈,导致在不借助额外且复杂的步骤的情况下,很难精确定位特定物体。

本文介绍了一种名为What-Where Transformer (WWT) 的新模型。你可以将其视为计算机观察图像的一种更智能的方式,其设计初衷就是让“是什么”和“在哪里”保持分离却又协同工作。

以下是其工作原理,使用简单的类比来说明:

1. 旧方法:“瑞士军刀”式令牌

在传统模型(如 ViT)中,图像被切割成称为“补丁(patches)”的小方块。每个补丁变成一个“令牌(token)”(即一张数字便条)。这些令牌相互交谈,以拼凑出整幅画面。

  • 问题所在:这就像给拥挤房间里每个人都发一张便条,上面同时写着他们的名字位置。当他们试图分享信息时,名字和位置就会混杂在一起。如果你稍后只想找到“位置”部分,就会变得混乱不堪,需要大量额外的工作来理清头绪。

2. 新方法:“什么 - 哪里”团队

WWT 模型通过将一个团队拆分为两个并行工作的专业小组来改变游戏规则:

  • “是什么”团队(Slots):它们就像侦探。它们携带物体的身份特征(例如,“这是一只狗”)。它们不在乎确切的坐标,只想知道它们看到的是什么
  • “在哪里”团队(Masks):它们就像聚光灯操作员。它们携带位置信息(例如,“狗在左上角”)。它们不在乎名字,只想知道应该把光照向哪里

3. 它们如何交流:“相互注意力”之舞

在旧模型中,每张便条都会与其他所有便条交谈。而在 WWT 中,侦探和聚光灯操作员以一种特定的舞蹈方式相互交谈:

  • 侦探聚光灯:“嘿,你在看哪里?我会告诉你我在那里看到了什么。”
  • 聚光灯侦探:“嘿,你看到了什么?我会告诉你该把光指向哪里。”
  • 随着图像的处理,它们反复进行这种交流。这确保了“是什么”保持清晰,“在哪里”保持精确。

4. 神奇的结果:“涌现”式发现

本文最令人兴奋的部分是,当模型仅被训练用于识别物体(例如说“这是一只狗”),而没有被教导如何绘制边界框时,会发生什么。

  • 惊喜:尽管只要求模型说出“狗”,但“聚光灯操作员”(即掩码)自然地学会了围绕狗绘制完美的轮廓。
  • 类比:这就像聘请一位厨师来制作蛋糕。你只告诉了他们食谱(即“是什么”),但由于他们的厨房布局方式,他们意外地也学会了如何完美地切分蛋糕(即“在哪里”),而从未被要求这样做。
  • 重要性:通常,为了找到物体,你需要第二个复杂的机器(解码器)来解读结果。WWT 则自动完成这一过程。你可以查看“聚光灯”图,它字面上向你展示了物体所在的位置。

5. 他们的测试

研究人员在庞大的图像数据集(ImageNet)上测试了该模型,发现:

  • 准确性:它在识别物体方面与现有最佳模型一样出色。
  • 定位能力:即使没有额外训练,它在展示物体位置方面也表现得更出色。
  • 多功能性:由于“在哪里”的信息是内置的,他们可以轻松地将此模型用于诸如给汽车画框或将人物从背景中抠出等任务,只需在模型上添加一个微小且简单的“头”(即一个小附加组件)即可。

总结

What-Where Transformer 是一种新型的人工智能视觉系统,它不再将“物体是什么”与“它在哪里”混为一谈。通过将这两者视为两个独立但协作的团队,该模型能够自然地学会在图像中指出物体,而只需学习命名它们即可。这是一种更简单、更高效的方式,用于教导计算机观察世界,使其更容易应用于寻找丢失物品、驾驶汽车或分析医学图像等任务(尽管本文侧重于通用物体发现,而非特定的医学应用)。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →