Vision Non-Causal Trapezoidal Mamba: Eliminating Directional Scanning in Vision SSMs with Second-Order Dynamics
本文介绍了视觉非因果梯形 Mamba (VNCT),这是一种二阶非因果状态空间模型,它通过消除方向性标记扫描来实现具有方向鲁棒性的表示,并在保持低推理延迟的同时,在各种视觉任务中取得了卓越的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在试图理解一个由数千个微小的图像碎片(即 token)组成的巨大且复杂的拼图。长期以来,计算机视觉模型表现得像是一条非常严格的单行道。它们必须按照特定的顺序观察这些碎片:从左到右,从上到下,或者遵循某种固定的路径。这被称为定向扫描(directional scanning)。这就像读一本书,你不能向前看,也不能翻回后页;你必须读完一行中的每一个词,才能移动到下一行。
这篇论文介绍了一种名为 Vision Non-Causal Trapezoidal Mamba (VNCT) 的新模型。其核心发现是,这种严格的“单行道”规则对于实现良好的视觉效果其实并非必要。事实上,取消这个规则会让模型变得更快、更聪明。
旧方法 vs. 新方法
想象一下,旧的模型(如许多 Vision Transformer 或早期的“Mamba”模型)就像是一组侦探,他们必须排成单列纵队走过一个博物馆房间。他们只能看到面前的一幅画,然后是下一幅,依此类推。如果他们因为专注于右侧而忽略了左侧的细节,他们可能要绕一圈回来才能重新捕捉到它,这会浪费额外的时间。这会产生一种偏差;模型会变得“习惯于”朝特定的方向观察。
VNCT 废除了这条规则。它不再让大家排队行走,而是让每一块图像碎片在一次处理中同时与所有其他碎片进行交流。这就像打开了一个巨大的、瞬间照亮的聚光灯,同时照亮了整个博物馆房间。每一位侦探都能瞬间看到所有的画作,无需等待轮到自己。论文表明,这种“全方位同步”的方法消除了因排队行走而产生的奇怪偏差。
核心秘诀:二阶动力学(Second-Order Dynamics)
但它是如何如此快速地与所有人沟通而不产生混乱呢?作者使用了一个巧妙的数学技巧,称为二阶动力学(具体来说是“梯形”动力学)。
想象一下你在尝试猜测房间的温度。
- 一阶(旧方法): 你检查一次温度计,并根据那一次单一的读数进行猜测。
- 二阶(VNCT 的方式): 你不仅检查温度计,还会观察就在前一瞬间温度变化的快慢。你会取“现在”和“刚才”的平均值。
这种“梯形”方法(通过对步骤的起点和终点取平均值)赋予了模型对图像更丰富、更细致的理解。论文指出,这种额外的细节层有助于模型比以往使用简单单步方法的模型更好地理解形状和边界。
论文驳斥了什么
论文明确反对了认为视觉模型需要定向扫描才能正常工作的观点。许多之前的模型试图通过增加更复杂的路径(例如走之字形或螺旋线)来解决“单行道”问题,但作者表明,你根本不需要去修复路径——你只需要直接移除路径。他们否定了顺序扫描对于高性能视觉的必要性。
结果:更快、更强、更鲁棒
作者在多个大型挑战赛上对模型进行了测试,结果非常明确:
- 速度: 因为它不需要等待队伍排好,所以 VNCT 更快。在处理单张图像时,“Micro”版本进行预测仅需 5.25 毫秒,“Tiny”版本为 7.31 毫秒。这比之前的非因果模型 (VSSD) 更快,后者分别需要 5.80 ms 和 8.01 ms。
- 准确率: 它在标准测试中获得了更高的分数。在 ImageNet-1K 测试中,“Tiny”版本的准确率达到了 84.2%,击败了之前表现最好的非因果模型 (VSSD-Tiny),后者的得分为 83.7%。
- 旋转与翻转: 最酷的发现之一是关于“方向鲁棒性”。如果将图像颠倒或旋转,旧模型会变得有些困惑,准确率会下降。VNCT 则对此表现得非常淡定。当图像被旋转或翻转时,平均准确率下降仅为 0.3%,而 VSSD 为 0.9%,定向扫描模型则为 1.6%。这表明该模型是将物体作为一个整体来观察,而不仅仅是一个像素序列。
- 边界: 在绘制物体轮廓(例如区分汽车与道路)时,VNCT 的表现更锐利。与 VSSD 相比,它在 Cityscapes 数据集上的“Boundary IoU”(衡量边缘匹配程度的分数)提升了高达 3.7 个点。
总结
论文不仅建议这可能有效,还通过分类、目标检测和分割任务进行了测量。作者得出结论:定向扫描的“单行道”是试图将序列模型强加于图像时的产物,而一种二阶、非因果的方法是一种更简单、更高效且更鲁棒的构建视觉 AI 的方式。他们不仅仅是微调了旧系统,而是彻底更换了交通规则,而现在的车行驶得更快,也开得更直。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。