← 最新论文
💻 computer science

Linear-Time Global Visual Modeling without Explicit Attention

本文提出了一种新颖的视角,将注意力机制重构为具有动态预测参数的多层感知机,证明这种动态参数化能够有效替代显式注意力,从而以线性计算复杂度实现达到 Transformer 水平的全局视觉建模。

原作者: Ruize He, Dongchen Han, Gao Huang

发布于 2026-05-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Ruize He, Dongchen Han, Gao Huang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图理解一群围坐成圈的人讲述的一个长篇故事。

旧方法(Transformer/注意力机制):
传统上,为了理解整个故事,群体的“领导者”必须向每个人询问:“你的句子与他人的句子有何关联?”

  • 人物 A 询问人物 B、C、D 和 E。
  • 人物 B 询问人物 A、C、D 和 E。
  • 依此类推。

如果有 10 个人,那就是 100 个问题。如果有 1,000 个人,那就是 1,000,000 个问题!这就是论文中所谓的二次方复杂度。它在理解整个故事(全局建模)方面效果极佳,但随着群体规模扩大,其速度会变得极其缓慢且成本高昂。

新想法(WeightFormer):
这篇论文的作者,Ruize He、Dongchen Han 和 Gao Huang,提出了一个疯狂的问题:我们真的需要问完所有这些问题才能理解故事吗?

他们意识到,旧方法的“魔力”并不真正在于问题本身。相反,他们发现该过程在数学上类似于一个智能的、可变形的机器(多层感知机,或 MLP)。

以下是他们的新视角:

  1. 旧观点:我们计算一张巨大的连接图(注意力权重),然后利用它来混合信息。
  2. 新观点:这张“地图”实际上只是一组指令,是机器根据刚刚听到的故事即时生成的。

类比:定制西装
将旧方法想象成裁缝逐一测量人群中的每个人,以查看他们如何相互契合。这很精确,但耗时极长。

新方法(WeightFormer)则像是一位魔法裁缝

  • 裁缝不再测量每个人,而是花一瞬间扫视整个人群
  • 基于这一瞥,裁缝瞬间设计出一套定制西装(一组动态参数),完美契合特定的人群。
  • 随后,人群穿过这套定制西装。因为这套西装是专门为他们设计的,所以它无需测量每一对人,就能自动理解他们之间的相互关系。

他们做了什么:
研究人员构建了一种新型计算机视觉模型,称为WeightFormer

  • 与其进行缓慢的“询问每个人”步骤,他们的模型采用快速的“扫视人群并设计西装”步骤。
  • 他们根据输入图像动态生成“西装”(神经网络层的权重)。
  • 这使得模型能够像旧 Transformer 一样很好地理解整张图像(全局建模),但具有线性复杂度

“线性复杂度”的含义:

  • 旧方法:如果你将图像尺寸加倍,工作量将变为四倍(慢 4 倍)。
  • 新方法:如果你将图像尺寸加倍,工作量仅增加一倍(慢 2 倍)。

结果:
他们在标准图像任务上测试了这一点(例如在 ImageNet 数据集中识别猫和狗)。

  • 速度:WeightFormer 速度快得多,且占用更少的计算机内存,尤其是在高分辨率图像方面。
  • 准确性:其表现与著名的 Transformer 模型(如 DeiT)和卷积网络(如 ConvNeXt)相当,甚至更好。
  • 通用性:它不仅适用于图像分类,在目标检测、物体分割甚至生成新图像方面也表现良好。

核心结论:
这篇论文证明,你不需要依赖沉重且缓慢的“显式注意力”机制来理解大局。你可以通过让网络根据输入动态创建自己的规则,来实现同样强大的理解能力。这是一种构建智能 AI 的更高效方式,使其能够处理海量数据而不会陷入困境。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →