← 最新论文
💻 computer science

Rethinking Attention Locality in Spiking Transformers

本文介绍了一种具有边界连续性路径的空间连续局部注意力机制(Spatially Contiguous Local Attention with Boundary Continuity Pathway, SCLA-BCP),这是一种通过结合非重叠局部注意力与轻量级跨边界路径以及分层部署策略,来解决脉冲 Transformer 中缺乏空间局部性问题的创新方法,在保持极低开销的同时,在各种视觉任务中实现了显著的性能提升。

原作者: Zeqi Zheng, Zizheng Zhu, Yuping Yan, Wenxuan Pan, Zhaofei Yu, Yaochu Jin

发布于 2026-08-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Zeqi Zheng, Zizheng Zhu, Yuping Yan, Wenxuan Pan, Zhaofei Yu, Yaochu Jin

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个这样的世界:计算机不再仅仅是像无尽计算器那样进行数字运算,而是更像我们的大脑一样进行思考。这就是脉冲神经网络(Spiking Neural Networks, SNNs)的领域——这是一种模仿生物神经元仅在必要时才发出微小电火花(即“脉冲”)的机制的人工智能。这些网络并非一直在不停地运转,而是由事件驱动的,这意味着它们在没有发生有趣的事情时会保持静默,这使得它们具有极高的能效。最近,科学家们尝试将这种高效的“脉冲”风格与强大的“Transformer”架构相结合——后者是帮助计算机理解语言和识别图像的“聪明”结构。目标是什么?是创造一种超高效的人工智能,它可以在不消耗大量电力的前提下观察并理解世界。然而,这里有一个问题:当这些脉冲 Transformer 试图关注图像的不同部分时,它们有时难以关注到紧挨在一起的事物,就像邻居忽略了紧挨着自己的房子一样。

这篇题为《重新思考脉冲 Transformer 中的注意力局部性》(Rethinking Attention Locality in Spiking Transformers)的论文,深入探讨了这一特定问题。作者们是来自浙江大学、西湖大学和北京大学的研究团队,他们注意到,虽然以往试图修复这种“邻里”问题的尝试让 AI 变得更聪明,但并没有真正解决根源问题。他们发现,某些方法只是在进行局部数学运算,而并未真正观察附近的像素;另一些方法则试图将同样的修复方案强加于网络的每一个部分,而这并不总是奏效。为了解决这个问题,他们发明了一个名为 SCLA-BCP 的新系统。可以把它想象成赋予了 AI 一种更好的组织“邻里守望”的方式:它将图像划分为整齐的小块,让邻居们可以轻松交流,同时还增加了一个特殊的“边界桥梁”(boundary bridge),让信息能够在这些区块之间流动,确保没有任何信息被遗漏。他们的实验表明,这种新方法有助于 AI 更好地观察、更准确地识别物体,并且这一切都是在消耗极少额外能量的情况下完成的。

问题所在:“局部”并不等于“近邻”

要理解作者们的发现,我们首先需要了解这些脉冲 Transformer 通常是如何工作的。在标准的 Transformer 中,AI 会观察一张图像,并试图弄清楚不同部分之间的关系。它会问:“这个像素关心那个像素吗?”在普通的计算机大脑中,这是通过一种称为“Softmax”的特殊数学技巧完成的,它能帮助 AI 决定哪些像素最重要。但在脉冲 Transformer 中,为了保持“脉冲式”的高效,他们去掉了 Softmax。副作用是什么?AI 最终会对所有像素几乎一视同同,就像一个不知道该和谁坐在一起的学生,最后只能对着教室里的每个人发呆。

为了修复这一点,之前的研究人员尝试强制 AI 关注局部区域。他们主要通过两种方式实现:

  1. “分组”法 (LSSA): 他们尝试根据某种模式将像素分组,比如把每隔一个像素归为一组。正如作者所发现的问题,这就像是根据鞋码把房间里的人分组。即使你们在同一个组里,你们可能也站在房间的两端。数学上说你们是“局部的”,但在物理空间上,你们相距甚远。作者称之为“计算空间局部性差异”。计算机认为它在看邻居,但实际上它在看陌生人。
  2. “统一”法 (LRF-SSA): 其他研究人员尝试为 AI 大脑的每一个层都添加一个“局部视野”,假设网络的每个部分都需要同一种类型的帮助。作者测试了这一点,发现这并不总是有效。就像幼儿和青少年需要不同的规则一样,AI 网络的不同层需要不同程度的“局部”关注。将同样的修复方案应用于所有层,有时反而会让情况变糟,或者根本没有任何改变。

解决方案:SCLA-BCP

作者意识到,要真正解决问题,他们需要两样东西:一种确保 AI 确实在观察物理上相邻像素的方法,以及一种让这些像素能够跨越边界与邻居交流的方法。于是他们提出了 SCLA-BCP

SCLA(空间连续局部注意力):
想象你有一张巨大的披萨。与其根据某种模式切成奇怪且分散的薄片,不如将其切成整齐、不重叠的正方形方块。SCLA 强制 AI 只观察其自身正方形方块内的像素。这确保了当 AI 询问“谁是我的邻居?”时,它是在与物理位置紧挨着的像素对话。这解决了“鞋码”问题,保证了小组是一个真正的、连续的邻里。

BCP(边界连续路径):
但出现了一个新问题:如果把披萨切成独立的方块,一个方块边缘的腊肠就无法与下一个方块边缘的奶酪进行交流。信息被困住了。为了解决这个问题,作者增加了 BCP。可以把它想象成一条沿着方块边缘运行的特殊“桥梁”或“快递服务”。它使用一个简单、轻量级的工具(卷积)对整个图像进行快速观察(而不进行切割),并将该信息传回主系统。这使得 AI 能够理解方块边界之间正在发生什么,确保整幅图像保持连贯。

如何部署

作者还意识到,不能只是把这个新系统强行套用到 AI 的每一个部分。他们发现,对于某些类型的 AI 架构(“类 ViT 型”),如果只在网络的前半部分使用它,效果最好;而对于其他类型(“多阶段型”),在最初两个阶段使用效果最好。这就像知道在教孩子跑步之前需要先教他们走路;你不会给婴儿穿上跑步鞋。通过仔细选择将 SCLA-BCP 应用在哪里,他们在不浪费能量的前提下获得了最佳结果。

结果:更好地观察世界

团队在七个不同的数据集上测试了他们的新方法,涵盖了从简单的图像识别(如识别猫和狗)到复杂的任务(如寻找城市中的汽车或分离场景中的物体)。结果令人印象深刻:

  • 更高的准确度: 在 COCO 2017 数据集(用于寻找物体)上,他们的方法将物体检测的准确度提高了高达 9.50%。在 ADE20K 数据集(用于理解场景)上,他们将分离图像不同部分的能力提高了高达 3.42%
  • 高效性: 他们在仅增加极少量系统“权重”的情况下实现了这些显著提升。例如,在某些模型上,他们仅增加了约 0.02 到 0.48 百万个参数(AI 的微小构建模块)以及极少的额外能量(约 0.09 到 0.93 毫焦耳)。
  • 概念验证: 当他们观察 AI 是如何“思考”时(使用一个称为平均注意力距离,即 MAD 的指标),他们看到他们的方法确实让 AI 更加关注较近的邻居,而之前的各种方法有时却无法做到这一点。可视化结果显示,他们的 AI 能更清晰地聚焦于实际物体(如黑猩猩)并忽略背景噪声,而旧的方法有时会被干扰。

这意味着什么

论文表明,仅仅试图让 AI 变得“局部化”是不够的;你必须确保“局部”部分确实与图像的物理布局相匹配。作者展示了通过结合严格的“邻里规则”(SCLA)与“边界桥梁”(BCP),并聪明地选择应用这些规则的位置,我们可以构建出不仅更高效,而且能更好地观察世界的脉冲 Transformer。这提醒我们,在人工智能领域,有时看清大局最好的方法是先组织好你的邻里,然后再搭建几座桥梁将它们连接起来。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →