← 最新论文
🤖 AI

SEMA: a Scalable and Efficient Mamba like Attention via Token Localization and Averaging

本文介绍了 SEMA,这是一种可扩展且高效的注意力机制,它结合了用于防止权重分散的标记定位(token localization)与用于捕捉全局上下文的算术平均法,从而在图像分类任务中超越了现有的线性注意力模型和视觉 Mamba 模型。

原作者: Nhat Thanh Tran, Fanghui Xue, Shuai Zhang, Jiancheng Lyu, Yunling Zheng, Yingyong Qi, Jack Xin

发布于 2026-07-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Nhat Thanh Tran, Fanghui Xue, Shuai Zhang, Jiancheng Lyu, Yunling Zheng, Yingyong Qi, Jack Xin

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一个机器人识别照片中的猫。为了做到这一点,机器人使用了一种叫做“注意力”(attention)的特殊工具,它就像一束聚光灯。这束聚光灯会扫描整个图像,决定哪些像素是重要的(比如猫的耳朵),哪些只是背景噪声(比如模糊的树木)。问题在于,随着照片变得越来越大,聚光灯必须检查每一个像素与所有其他像素之间的关系。如果照片很小,这很快;但如果照片巨大,机器人就会不堪重负,在还没来得及说出“猫”这个词之前,就因为花费太多时间建立连接而耗尽了电池。

科学家们曾尝试通过让聚光灯变成“线性”来解决这个问题,即让它以一种更简单、更快速的直线方式进行检查。但这里有一个陷阱:这些快速的聚光灯往往会失去焦点。随着图像变大,它们开始把每一个像素都视为同样重要,就像一盏亮度被调得极低的电筒,只是在整个房间里均匀地散发着微光。机器人不再能看到猫,而是看到了一团灰色的模糊影象。这篇由加州大学欧文分校和高通人工智能研究中心的研究人员撰写的论文,正是针对这一问题展开研究的。他们想要构建一个既能处理巨型图像,又能保持细节清晰的聚光灯。

由 Nhat Thanh Tran 及其同事领导的研究团队发现了一个解释为什么这些快速聚光灯会失效的数学真理:当像素(或称“标记/tokens”)的数量趋向于无穷大时,注意力机制会自然地扩散并变得毫无用处。他们将这种现象称为“弥散”(dispersion)现象。这就像是在体育场里试图听清一声耳语;如果你试图同时倾听所有人,最终只会听到一片噪音。论文证明了,无论你如何调整这些快速注意力工具的数学公式,只要图像变得足够大,它们最终都会失去焦点。

为了解决这个问题,该团队发明了一种名为 SEMA(可扩展且高效的类 Mamba 注意力机制)的新方法。他们并没有与数学规律对抗,而是决定顺应它。他们意识到,虽然聚光灯应该聚焦于特定细节,但它也需要一种理解“大局”而不至于迷失的方法。因此,他们设计了一个由两部分组成的系统。首先,他们使用了标记局部化(Token Localization),这就像是给聚光灯开了一个小窗口进行观察。它一次只关注一小片邻近的像素,确保自己既不会被压垮,也不会被分心。这保持了焦点的锐利。

但通过小窗口观察也有缺点:如果机器人只看一只爪子,它可能会错过整只猫。为了解决这个问题,SEMA 添加了第二步:平均化(Averaging)。这就像是对整个房间进行一次快速、模糊的快照,并将其与细节视图相结合。研究人员在数学上证明了,当图像变得巨大时,捕捉图像“全局”感的最佳方式就是简单地将所有内容进行平均。通过将锐利的局部窗口视图与这种简单的全局平均相结合,SEMA 兼顾了两者的优点。

论文显示,这种方法效果极佳。当他们在 ImageNet-1K 等标准图像数据集上测试 SEMA 时,它的表现优于包括近期出现的“Mamba”模型在内的其他流行模型,尤其是在处理超大图像时。例如,当图像尺寸增加到 1024x1024 像素时,其他模型表现挣扎,准确率大幅下降,而 SEMA 不仅保持强劲,甚至还有所提升。研究人员还发现,SEMA 比竞争对手更快,处理大图像所需的时间更短。

论文中最有趣的部分之一是他们如何处理“弥散”问题。他们没有试图强行让注意力保持锐利(这会破坏数学逻辑),而是接受了对于巨型图像而言,注意力应当扩散的事实。他们利用这种扩散特性,通过使用简单的平均值来代表全局信息。这有点像意识到,如果你有一百万个朋友,你无法记住每一个人的每一个细节,但你可以记住这个群体的整体氛围。SEM 会记住即时邻域的细节和整个群体的整体氛围,从而让它无论照片有多大,都能完美地识别出那只猫。

作者在各种任务中测试了他们的想法,从识别物体到寻找图像中的特定部分(分割)。在每种情况下,SEMA 都展示了它能在不“发疯”的情况下扩展到更大的图像。他们甚至表明,随着图像变大,“平均化”部分变得越来越重要,这证明了他们的理论:这个简单的步骤对于处理海量数据至关重要。虽然论文的重点是计算机视觉,但团队表示,这个想法可以帮助解决涉及长序列数据的其他问题,例如分析巨大的医学扫描图像。

简而言之,SEMA 是一个聪明的技巧,它承认当聚光灯变得过宽而不再有用时,应切换到另一种策略:仔细观察附近的细节,并对剩余部分进行快速、简单的平均。这是一种可扩展、高效且符合数学逻辑的方法,能帮助计算机即使在世界变得非常宏大时,依然能清晰地观察世界。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →