Spatial-Aware Reduction Framework: Towards Efficient and Faithful Visual State Space Models
本文介绍了 STORM,一种无需训练且具备空间感知能力的 Token 缩减框架,该框架通过实施局部约束以在压缩过程中保持网格拓扑结构和邻域相干性,解决了结构增强型 Mamba 模型出现的性能崩溃问题。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
核心问题:打破拼图
想象一下,你有一个巨大的、错综复杂的拼图,代表着一张图片。在人工智能的世界里,这个拼图是由成千上万个被称为“Token(标记)”的小碎片组成的。
最近,一种名为 Mamba 的新型 AI 模型变得非常流行,因为它在处理长序列这些拼图碎片时速度极快。它的工作方式就像一名侦探,在阅读故事时逐字逐句地阅读,并随着进度记住上下文。
然而,出现了一个重大问题:如何通过扔掉那些“无聊”的拼图碎片来让这个 AI 变得更快?
在旧的 AI 模型(如 Transformer)中,你可以直接挑选出最重要的碎片并扔掉其余部分。但当研究人员尝试将这种方法应用于 M la 时,AI 的大脑完全崩溃了。它的准确率从 80% 骤降到了接近 0%。
为什么会这样?
论文解释说,Mamba 就像一条传送带。它按照严格且特定的顺序(从左到右,从上到下)读取拼图碎片。如果你随机抓取传送带上的碎片并打乱它们,故事就变得毫无意义。AI 会感到困惑,因为它预期看到的下一个“邻居”碎片突然消失了,或者被来自房间另一端的碎片取代了。
现有的方法是“空间无关”的,这意味着它们并不关心这些碎片位于哪里,只关心它们看起来有多“重要”。这破坏了 Mamba 赖以生存的 2D 结构。
解决方案:STORM(空间感知 Token 缩减框架)
作者提出了一个名为 STORM 的新框架。可以将 STORM 想象成一位非常严谨的图书管理员,她知道如何在缩小图书馆规模的同时,又不丢失故事的内容。
STORM 不会随机挑选书籍丢弃,而是遵循两条严格的规则:
行列规则(结构化缩减):
想象拼图是一个网格。STORM 不会同时观察整个网格,而是一次看一行,然后一次看一列。- 类比: 如果你有一个电子表格,你不会删除随机的单元格。你会决定:“在第 1 行中,我保留每 5 个单元格中的 2 个,”然后接着说:“在第 2 行中,我也保留每 5 个单元格中的 2 个。”这确保了剩余的碎片仍然构成一个完美的、更小的网格。AI 的“传送带”永远不会发生堵塞,因为顺序得到了保留。
邻里规则(局部窗口化):
即使保持了网格形状,你也可能会不小心删掉左上角的碎片,并用右下角的碎片来替换它。这依然会造成混乱!- 类比: STORM 在一组碎片周围放置了一个小“窗口”或框架。它规定:“你只能在这个特定的窗口内部进行交换或移除碎片。”这确保了代表“猫耳朵”的碎片始终留在“猫脸”旁边,而不会被换成背景中的“树枝”。
结果:神奇的恢复
论文在几种 AI 模型(VMamba、PlainMamba)上测试了 STORM,并发现了惊人的结果:
- “之前”的灾难: 当使用旧方法(如 ToMe)时,AI 的准确率下降了超过 50%。这就像是在读一本书中有一半的词都被替换成了乱码。
- “之后”的奇迹: 使用 STORM 后,准确率仅下降了 1% 到 3%。仿佛 AI 几乎没有察觉到拼图变小了。
- 速度: 由于 STORM 可以并行处理行和列(就像拥有许多工人而不是一个工人),它实际上比旧方法更快,同时还能保持 AI 的聪明才智。
为什么这很重要(根据论文观点)
论文声称,结构比单纯的“重要性”更重要。
- 旧方法: “保留最重要的碎片,哪怕这会破坏图片。”(结果:AI 崩溃)。
- STORM 方法: “将碎片保留在它们应有的邻里和网格顺序中,即使这需要我们执行得非常严格。”(结果:一个更小、更快、但依然聪明的 AI)。
作者强调,STORM 是一个**“即插即用”**的工具。你不需要重新训练 AI 或教它任何新知识;你只需将 STORM 连接到现有系统,它就能立即解决破坏 AI 空间逻辑的问题。
简而言之: STORM 通过提醒 AI,在图片中,一个碎片位于哪里与它本身是什么同样重要,从而挽救了局面。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。