想象一下,你正在试图理解一幅复杂的画面,比如一幅描绘繁忙城市街道的画作。你拥有一个非常快速且高效的“大脑”(称为视觉状态空间模型或视觉 SSM),它擅长按直线顺序、一次处理一个片段地处理信息。
然而,这里存在一个问题:这幅画是二维的(具有高度和宽度),但你的“大脑”只理解一维的列表(就像句子一样)。为了让画面适配,你必须将其展平为一条由微小方块(token)组成的长线,就像卷起地毯一样。
旧方法:“割草”问题
传统上,为了将画面转化为线性序列,研究人员使用固定的扫描模式。
- 光栅扫描:想象一台割草机在草坪上来回移动。它从左到右移动,然后向下移动一格,再从右到左移动,如此循环。
- 问题所在:在图像中,两个相邻的方块在“割过”的序列中可能相距甚远。如果你正在观察猫的耳朵和鼻子,固定的扫描器可能会在列表中将它们分隔在“几英里”之外。“大脑”必须等待很长时间才能将它们关联起来,或者可能因为仅仅遵循僵化的路径而完全错过这种关联。
一些较新的方法试图通过变形路径来解决这个问题。想象割草机驾驶员变聪明了,说道:“嘿,那块草地看起来像朵花,所以我先跳过去把它割了。”这被称为坐标偏移扫描。这更好一些,但它仍然主要关乎几何(移动到新的坐标),而非语义(理解那块区域实际上是什么)。
新想法:GraphScan(“智能邻里”方法)
这篇论文的作者提出了一个简单的问题:“如果在将图像喂给‘大脑’之前,让方块根据它们看起来像什么(而不仅仅是它们在哪里)与邻居交流,会怎样?”
他们引入了GraphScan。以下是其工作原理的简单类比:
- 邻里会议:不再是简单地移动割草机,想象图像中的每个方块都举行一次微小的邻里会议。
- 语义聊天:每个方块观察其紧邻的方块。但它们不只是说“你在我的左边”,而是问:“我们看起来相似吗?我们是否属于同一个物体?”
- 如果一个方块属于“狗的毛发”,即使几何结构很棘手,它也会与附近其他“毛发”方块建立强连接。
- 如果一个方块属于“天空”,它就会与其他“天空”方块连接。
- 信息传递:该方块从这次聊天中收集最佳信息,将其混合,并更新它对自己是什么的“看法”。
- 交接:现在,每个方块都对其局部邻里有了更好、更明智的理解,它被传递给快速“大脑”(视觉 SSM),以便在长序列中进行处理。
为什么这很重要
论文声称,这一简单的改变使 AI 的“视觉”能力大大增强。
- 它不是替代:他们没有用一个缓慢、复杂的图机器来替换快速“大脑”。他们只是在“大脑”开始工作之前添加了一个“准备步骤”。
- 它是局部且智能的:它不会一次性查看整幅图像(这很慢)。它只查看一个小的、有界的邻域(例如 3x3 或 5x5 网格),但它根据内容(语义)而非仅仅是网格位置来决定听谁的。
- 结果:当他们在标准任务上测试这种新的"GraphScan-Mamba"时:
- 图像识别(ImageNet):它获得了比先前模型更高的分数。
- 目标检测(COCO 检测):它更准确地找到了汽车、人物和动物。
- 场景分割(ADE20K):它在描绘物体的确切形状方面做得更好。
结论
论文总结道,我们不应仅仅将图像扫描视为一个几何谜题(我如何将这些图块排列成一行?)。相反,我们应该将其视为一个语义路由问题(在它们被组织起来之前,我如何让这些图块分享关于它们是什么的信息?)。
通过让图像图块与邻居“聊天”以建立更好的局部理解,视觉 SSM 获得了一个更清晰、更有意义的列表进行处理,从而带来更智能、更准确的计算机视觉。
技术摘要:面向视觉状态空间模型的 GraphScan
1. 问题陈述
视觉状态空间模型(SSMs),特别是基于 Mamba 架构的模型,能够以线性复杂度提供高效的长程建模能力。然而,其性能关键取决于如何将二维视觉特征图序列化为一维令牌(token)序列进行处理。
现有的视觉 SSM 扫描算子通常分为两类:
- 固定几何遍历:预定义的路径(如光栅扫描、双向扫描、分形扫描)将二维晶格序列化为一个一维序列。这些方法使模型暴露于固定的顺序中,而这些顺序可能与语义内容不一致。
- 动态坐标基扫描:预测偏移量或采样位置并通过插值(例如双线性插值)重新路由令牌的方法。虽然具有适应性,但这些方法主要基于几何结构调整“在哪里”采样,而非在混合全局信息之前,显式地建模“哪些”局部图块应基于语义相关性交换信息。
作者指出了一个差距:当前的机制仅调整路径或采样坐标,但并未在令牌进入选择性状态空间混合器之前,显式地对局部语义邻域进行建模以作为预处理。提出的核心问题是:基于图的寻路能否通过在传播全局信息之前建立语义连接,帮助视觉 SSM“看得更好”。
2. 方法:GraphScan
本文提出了GraphScan,这是一种图诱导的动态扫描算子,设计用于置于选择性 SSM 之前。与用图神经网络(GNN)替换 SSM 的方法不同,GraphScan 充当一个轻量级的、输入自适应的预处理模块,通过注入局部语义上下文来丰富令牌。
核心机制
对于特征图中的每个令牌 xi:
- 局部图构建:在令牌的晶格坐标周围定义一个空间有界的局部候选集 Sr(i),具有固定半径 r。
- 特征条件亲和度:GraphScan 不采用几何插值,而是基于特征相似性和相对位置偏置,计算查询令牌与其邻居之间的类注意力亲和度。
- 计算查询(Query)、键(Key)和值(Value)投影:qi,kj,vj。
- 使用点积和一个可学习的相对位置偏置 brel(gj−gi) 计算亲和度分数 sij。
- Softmax 归一化产生权重 αij。
- 单步消息传递:输出令牌 xi′ 通过聚合语义邻域中的值特征并添加残差连接生成:
xi′=xi+j∈Sr(i)∑αijvjWo
这将孤立的图块表示替换为邻近视觉证据的语义混合。
集成到骨干网络
GraphScan 被集成到一个分层视觉 Mamba 骨干网络(GraphScan-Mamba)中,作为SSM 前的路由层。
- 架构:骨干网络遵循标准的四阶段设计,包含重叠的卷积茎(stems)和逐阶段的下采样。
- 位置:在每个模块内,数据流为:深度卷积(固定局部)→ GraphScan(学习到的局部) → 选择性 SSM(全局)。
- 适应性:图半径 r 随阶段深度增加(例如,早期阶段 r=1,后期阶段 r=3),允许感受野从局部扩展到有效全局,同时保持线性扩展。
理论意义
作者将 GraphScan 分析为一种稀疏的、输入自适应的预处理模块。通过在 SSM 之前将令牌序列 X 修改为 X′,GraphScan 从两个方面影响 SSM:
- 值注入:它改变了写入循环状态的值。
- 参数调制:由于 Mamba 风格的 SSM 从当前令牌生成循环参数(Δ,B,C),改变令牌也会改变控制状态传播和读出的选择性参数。
这创建了一个“局部 - 全局核”,其中源图块通过局部语义亲和度 αij 和全局选择性传播因子 Kt,i′ 影响输出。
3. 主要贡献
- GraphScan 算子:一种新颖的扫描机制,将扫描视为“学习到的局部语义路由”,而非几何序列化或坐标选择。它在保持令牌数量和线性扩展的同时,引入了语义感知能力。
- GraphScan-Mamba 骨干网络:GraphScan 的分层实现,在不改变核心 SSM 循环逻辑的情况下,在多项任务中实现了视觉 SSM 领域的最先进(SOTA)性能。
- 正交性:该方法被证明与循环侧的改进(如 SSD、非因果公式)正交,为视觉 SSM 提供了互补的设计杠杆。
- 可解释性:该方法在令牌晶格上诱导了可解释的位移场,可视化了模型如何基于语义内容而非固定几何结构来路由信息。
4. 实验结果
作者在三个标准基准上评估了 GraphScan-Mamba,在相当的参数和 FLOP 预算下,与卷积网络、Transformer 以及现有的视觉 SSM(如 VMamba、DAMamba、Spatial-Mamba)进行了比较。
- ImageNet-1K 分类:
- GraphScan-Mamba-B 实现了 86.5% 的 top-1 准确率,比最强的视觉 SSM 基线(Spatial-Mamba-B 为 85.3%)高出 1.2%,比 VMamba-B 高出 2.6%。
- 在相似规模下,它也超越了强大的卷积网络和 Transformer 骨干网络(如 ConvNeXt-B、Swin-B)。
- COCO 目标检测与实例分割(Mask R-CNN):
- 在 1x 训练计划下,GraphScan-Mamba-B 达到 51.9 的边界框 mAP 和 46.0 的掩码 mAP,领先所有视觉 SSM 基线。
- 增益有效地迁移到密集预测任务,表明学习到的令牌对检测尺度的空间结构具有鲁棒性。
- ADE20K 语义分割(UperNet):
- GraphScan-Mamba-B 实现了 53.2% 的 mIoU(单尺度),比最佳视觉 SSM 基线(DAMamba-B 为 51.9%)高出 1.3%。
- 多尺度结果显示了一致的改进(53.6% 对比 52.3%)。
消融研究:
- 位置:SSM 前的放置至关重要;将 GraphScan 移至 SSM 后会导致准确率下降 0.7%。
- 半径调度:增长的半径调度 (1,1,2,3) 在计算量和准确率之间提供了最佳的帕累托前沿。
- 相对位置偏置:包含可学习的相对位置偏置提供了稳定但微小的增益。
5. 意义与主张
本文得出结论:图确实有助于视觉 SSM 看得更好。这项工作的意义在于转变了视觉 SSM 的设计范式:
- 从几何到语义:扫描不应仅仅被视为几何序列化(选择路径或坐标),而应被视为全局状态空间建模之前的学习到的局部语义路由。
- 输入侧补充:GraphScan 提供了一种输入侧解决方案,补充了循环侧的进展。它确保进入选择性混合器的令牌已经具有局部基础且具备语义感知能力,从而在不改变 SSM 内部动态的情况下改善了全局序列的预处理条件。
- 通用性:该方法与特定的 SSM 核心(如 Mamba-1/S6)正交,表明其可应用于未来的 SSM 变体。
作者谦逊地主张,虽然 GraphScan 提高了性能和可解释性,但在没有进一步假设的情况下,它并不能在形式控制理论意义上保证泛化性,但它为更丰富的局部语义输入提供了一种结构机制。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。