← 最新论文
💻 computer science

Unifying Convolution and Attention via Convolutional Nearest Neighbors

本文介绍了卷积最近邻(Convolutional Nearest Neighbors, ConvNN),这是一个统一的框架,它将卷积和自注意力机制展示为单一 kk-最近邻聚合过程的特例,从而桥接了这两类主流的计算机视觉架构,并在 ImageNet-1K 上实现了最先进的性能提升。

原作者: Mingi Kang, Jeová Farias Sales Rocha Neto

发布于 2026-07-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Mingi Kang, Jeová Farias Sales Rocha Neto

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在试图理解一幅复杂的画作。为了做到这一点,你有两种主要的观察方式:

  1. “局部邻居”法(卷积): 你站在画布的一个特定位置非常近的地方,只观察你手指周围那一小块颜料。你忽略其他一切。这就是传统的**卷积神经网络(CNN)**的工作方式。它们擅长捕捉纹理和边缘,因为它们专注于紧邻的局部空间。
  2. “全局相似性”法(注意力): 你退后一步,观察整幅画作。你会问:“即使在画作的另一端,还有哪些部分看起来和我正在观察的这个点很像?”然后,你会将这些相似的部分融合在一起。这就是**视觉 Transformer(ViT)**的工作方式。它们擅长理解大局,因为它们可以连接遥远且相似的特征。

长期以来,计算机科学家认为这两种方法是完全不同的工具,无法轻易融合。

核心理念: “ConvNN” 工具

这篇论文介绍了一种全新的、通用的工具,叫做卷积最近邻(Convolutional Nearest Neighbors,简称 ConvNN)。作者认为,上述两种方法其实并不是截然不同的,它们只是同一光谱上的两个端点。

把 ConvNN 想象成一个智能像素搜索引擎

  • 工作原理: 当计算机观察一个特定像素(“查询”)时,它会搜索其“邻居”以收集信息。
  • 转折点: 计算机可以根据你设定的规则来决定如何寻找这些邻居:
    • 规则 A(空间邻近性): “寻找在物理位置上离我最近的邻居。”(这会让该工具变成标准的卷积)。
    • 规则 B(特征相似性): “寻找在外观上最像我的邻居,无论它们离我有多远。”(这会让该工具变成标准的自注意力机制)。

论文从数学上证明了,如果你调整这个单一工具的设置,你可以让它表现得完全像标准的卷积或标准的注意力机制。它们被统一到了一个单一的框架之中。

他们是如何测试的

研究人员不仅做了数学推导,还构建了实际的模型来观察这个想法是否真的能让计算机看得更好。他们在 ImageNet 上进行了测试,这是一个拥有 128 万张图像的海量数据库,常用于训练 AI。

1. 在“局部”模型上进行测试(ResNet-50):
他们采用了标准的图像识别模型 ResNet-50,并添加了一个“混合分支”。想象一个平时只看周围邻里的工人(卷积),现在多了一个侧翼搭档,这个搭档可以去寻找全城范围内看起来相似的物体(ConvNN)。

  • 结果: 这个混合团队的表现显著优于单独工作的工人。他们的准确率提升了 3.0%
  • 教训: 你不必在“观察局部”或“观察全局”之间做选择;将两者结合起来才是制胜策略。

2. 在“全局”模型上进行测试(Vision Transformer):
他们采用了 Transformer 模型(ViT-Base),并将其标准的“全局搜索”替换为他们的新型 ConvNN 工具。

  • 结果: 新工具击败了原始的 Transformer,提升了 0.7%
  • 关键发现: 标准的 Transformer 对所有“匹配项”一视同仁。而新的 ConvNN 工具学会了给不同的匹配项赋予不同的权重。这就像一位图书管理员,他不仅仅是抓取前 10 本相似的书,而是学会了在这些书中优先挑选出最相关的那些。这使得该模型在处理大量相似项目时表现尤为出色。

为什么这很重要(用简单的话来说)

  • 它是一个统一的理论: 它表明卷积和注意力只是同一台机器上的不同设置。
  • 它具有灵活性: 你可以设计一个处于中间位置的系统,融合空间接近度和特征相似性。
  • 它很高效: 作者创建了一个专门的、快速的版本(使用一种称为“Triton kernel”的技术),它使用的计算机内存更少,运行速度更快,使其在现实世界中具有实用性。

关于训练的说明

论文还注意到一个有趣的现象,即模型在学习过程中的表现。在训练初期,新工具比标准方法起步得更慢。然而,当训练接近尾声(即计算机进行微调阶段)时,新工具会赶上并最终超越其他方法。看起来,这个新工具需要一种“低速且缓慢”的学习节奏来搞清楚如何为它的邻居分配权重,而标准方法则更为僵化,虽然学习得快,但提升的空间较早就停止了。

总结: 该论文引入了一个单一且灵活的框架,弥合了局部图像处理与全局图像处理之间的鸿沟。通过将两者都视为“寻找最近邻”的变体,他们创造了一个在数学上严谨、运行更快且比目前这两类领域的领先者都更准确的工具。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →