Screening Is Effective for Visual Recognition
本文介绍了 VisionScreen,一种新颖的视觉模型,它通过基于查询-键(query-key)相似度独立评估并排除无关图像块,将筛选机制从语言建模适配到视觉识别,从而在图像分类基准测试中超越了传统的视觉 Transformer。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在试图教一个机器人识别照片中的猫。在人工智能的世界里,这是一项名为“计算机视觉”的工作。长期以来,实现这一目标的最佳方法是使用一种特殊的“大脑”,叫做视觉 Transformer(Vision Transformer,简称 ViT)。你可以把 ViT 想象成一位超级有序的图书管理员,他将一张照片切成数百个微小的正方形拼图块(即图像块),然后通过让每一个碎片都与其他所有碎片进行交流,试图拼凑出完整的故事。这位管理员使用一种叫做“自注意力”(self-attention)的规则来决定哪些碎片是重要的。这就像一个教室,每个学生都举起手,而老师(图书管理员)必须决定谁有权发言。老师使用一种叫做“softmax”的系统来分配发言时间。问题在于,这个系统会强迫老师给每个人一些时间,即使是那些正在闲聊天气或盯着窗外发呆的学生。在一张猫的照片中,这些“闲聊”的碎片可能是背景里的草地或模糊的墙壁。因为老师无法说“不”,这些碎片会被混入最终的故事中,有时会让机器人对它到底在看什么产生困惑。
这就是名为“筛选”(Screening)的新想法出现的地方。最初,筛选是为阅读文本而发明的,它就像是一个严格的夜店保镖。与其在所有人之间分配聚光灯,不如由保镖根据特定的规则检查每个人的身份证(相关性)。如果你达不到标准,你就根本进不去。你会得到一个硬性的“拒绝”。这篇题为《筛选在视觉识别中是有效的》(Screening Is Effective for Visual Recognition)的论文,作者是来自名城大学的下村真也(Shunya Shimomura)和堀田和浩(Kazuhiro Hotta),他们提出了一个大问题:我们能否将这种“保镖式”的筛选机制用于图片,而不只是文字?他们提出了一种新的模型,名为 VisionScreen。VisionScreen 不再让每个拼图块都在课堂上竞争注意力,而是让每个块独立决定其邻居是否真的相关。如果一片背景草块对猫并不重要,VisionScreen 可以明确地将其踢出对话。作者认为,通过这样做,机器人可以纯粹专注于猫,忽略噪音,从而在不需要更庞大、更复杂的大脑的情况下,更好地识别事物。
新模型:VisionScreen
作者构建 VisionScreen 是为了解决标准 ViT 的“课堂竞争”问题。在普通的 ViT 中,如果一片猫耳朵的图像块正在与一片背景进行交流,那么背景块仍然可能会获得一点点注意力,仅仅是因为耳朵块正在与“某人”交谈。这是一个相对的游戏;只有当你比其他嘈杂的碎片更好时,你才能获得关注。VisionScreen 改变了规则,将其变成了一个绝对的游戏。它会问:“这个块相关吗?”如果答案是“否”,则相关性得分就是零,该块会被完全忽略。
为了让这套机制适用于图片,团队进行了一些创造性的工程设计。图片是二维网格(类似于棋盘),而原始的筛选机制是为一维文本行(类似于句子)设计的。作者将该机制扩展到了处理这种二维空间。他们引入了一个“空间软掩码”(spatial softmask),它就像是每个拼图块周围一个灵活且隐形的泡泡。在这个泡泡内部,该碎片可以与其邻居交流。这个泡泡的大小并不是固定的;模型会学习针对特定任务需要多大的泡泡。模型中的某些部分可能需要一个小泡泡来观察精细细节(如胡须),而另一些部分可能需要一个巨大的泡泡来观察整只猫的身体。
他们的发现
团队在两个著名的图像数据集上测试了 VisionScreen:ImageNet-1k(包含 120 万张图像的海量集合)和 CIFAR-100(包含 6 万张属于 100 个不同类别的较小数据集)。他们将自己的新模型与一个标准的、微型的视觉 Transformer 版本(ViT-Tiny/16)进行了对比。
结果非常理想。在 ImageNet-1k 上,Vision-Screen 实现了 72.5% 的 Top-1 准确率,而标准的 ViT-Tiny/16 仅达到了 68.1%。这带来了 4.4 个百分点 的提升。在较小的 CIFAR-100 数据集上,VisionScreen 得分为 52.4%,击败了标准模型的 50.3%。有趣的是,VisionScreen 在实现这些目标时使用的参数量略少(约 540 万 个,而 ViT 为 570 万 个)。这表明,该模型之所以变得更好,不仅仅是因为它变得更大,而是因为它在关注什么方面变得更聪明了。
看见差异
为了理解 为什么 VisionScreen 效果更好,作者查看了模型的内部运作。当观察一张鱼(具体为 Tench 鱼)的照片时,标准的 ViT 似乎受到了干扰。它会对背景中的钓鱼竿和卷线器产生注意力,将这些细节混入它对鱼的认知中。这就像图书管理员被背景噪音搞糊涂了。
相比之下,VisionScreen 则专注得多。它明确地拒绝了钓具和背景水域,几乎将注意力全部集中在鱼本身。可视化结果显示,Vision-Screen 并没有将注意力稀释在整个图像上。相反,它在鱼的相关部分之间建立了清晰、紧密的连接。这表明,通过使用绝对相关性(保镖)而非相对竞争(课堂投票),模型学会了忽略“伪相关”(spurious correlations)——即猫与某种特定草地之间,或鱼与钓鱼竿之间那些偶然产生的联系。
细节说明
作者谨慎地指出,虽然这些结果很强,但它们是基于特定的实验。他们在这些数据集上从头开始训练模型,并发现 VisionScreen 不仅获得了更高的分数,而且在训练过程中表现出更低的“验证损失”(一种衡量误差的指标),这表明学习过程更加稳定。他们还测试了一种“门控”(gating)机制(一种开启或关闭特征的开关),并发现移除该机制会导致准确率下降 0.7 个百分点,这表明该开关有助于微调模型的焦点。
然而,论文并未声称这是计算机视觉的终极解决方案。作者认为,这种方法是当前标准的一种强大替代方案,提供了一种构建更高效、更不易受干扰的模型的方法。他们总结道,筛选机制在视觉识别中是有效的,它为未来的发展提供了一条新路径:让模型学会对无关信息说“不”,就像一个优秀的读者在图书馆里忽略噪音以专注于故事一样。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。