SAM-MI: A Mask-Injected Framework for Enhancing Open-Vocabulary Semantic Segmentation with SAM
本文提出了 SAM-MI,一种新型的掩码注入框架,该框架通过采用文本引导的稀疏提示、浅层掩码聚合以及解耦掩码注入,有效地解决了 SAM 的过度分割和标签集成挑战,同时显著提升了准确率和推理速度,从而增强了开放词汇语义分割能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图教一个机器人仅仅通过看图片和阅读单词列表来理解世界。你希望它能指出它所看到的每一个“狗”、“树”或“比萨”,即使它从未见过那种特定类型的狗。这就是开放词汇语义分割(Open-Vocabulary Semantic Segmentation)的挑战。这就像是给机器人一本字典和一个摄像头,并要求它为它看到的一切绘制一张地图,并正确标注每一个部分。为了实现这一目标,科学家们一直在使用两种强大的工具。第一个是视觉语言模型(VLM),它像是一个超级聪明的图书管理员,知道单词如何与图像联系起来,但不擅长绘制精确的轮廓。第二个是 SAM(Segment Anything Model,分割一切模型),这是一个在十亿张不同图像上训练过的机器人艺术家,它可以围绕你指点的几乎任何物体绘制出完美的轮廓,但除非你告诉它,否则它不知道这些东西叫什么。
问题在于,当你试图让这两个工具协同工作时,它们经常会互相绊倒。艺术家(SAM)变得过于兴奋,会在每一片叶子或阴影周围都画出细碎且不必要的轮廓;而图书管理员(VLM)则试图强行给一个混乱的图形贴上标签,即使那个图形本身是错误的。这就像是在拼凑一个拼图,而拼图块的形状一直在变化,而且包装盒上的图案与你手里的碎片并不匹配。这篇论文 SAM-MI 介绍了一种新的方法,让这两者能够作为一个团队高效协作,而不会产生混乱。
问题所在:过度热情的艺术家与僵化的图书管理员
研究人员注意到,以往将 SAM 与图书管理员结合的尝试存在两个重大缺陷。首先,SAM 倾向于过度分割(over-segment)。如果你要求它寻找一只“猫”,它可能会为猫的胡须、尾巴以及它投下的阴影分别画出独立的轮廓,并将它们全部视为独立的物体。这会产生一堆杂乱、令人困惑的小碎片。其次,旧的方法使用了**“硬组合(hard combination)”**。它们会采用 SAM 生成的一个固定轮廓,并强行贴上标签,无论这个轮廓有多糟糕。如果 SAM 在一朵云周围画了一个圈,而图书管理员说那是“猫”,系统就会直接接受它。这是一种僵化的、“不容商量”的方法,忽略了错误。
解决方案:一个拥有新工作流的智能团队
作者提出了一个名为 SAM-MI(掩码注入,Mask-Injected)的新框架。他们没有让艺术家和图书管理员进行直线式的协作,而是创建了一个灵活的工作流,让艺术家的绘画作为有用的提示,而不是最终的指令。他们通过三个巧妙的技巧来实现这一点:
1. 智能侦察员(文本引导的稀疏点提示器)
在过去,为了让 SAM 在一张图片中画出所有东西,你必须在图像各处点击成千上万个点,就像撒盐一样。这既缓慢又耗费计算资源。SAM-MI 引入了一个名为 TSPP 的“智能侦察员”。这个侦察员不再到处乱点,而是观察图片和你想要寻找的词(如“狗”),并计算出最准确的点位。它学会了只在最有可能发现物体的地点放置点位。
- 结果: 与传统的密集网格(需要 1,024 个点)相比,这个侦察员平均只需点击约 41 个点。这使得过程快了 1.6 倍,并将点击次数减少了 96%,同时依然能同样出色地找到物体。
2. 过滤器(浅层掩码聚合)
即便使用了更少的点,SAM 仍可能有些“放不下手”,画出太多细碎、破碎的部分。**浅层掩码聚合(SMAgg)**就像是一个过滤器或筛子。它观察 SAM 创建的那堆杂乱的小轮廓,并询问:“这些碎片属于同一个物体吗?”如果几个小块看起来都属于同一只“狗”,SMAgg 就会把它们重新粘合为一个干净的形状。它在图书管理员看到这些内容之前,就剔除了噪声和“非感兴趣”的区域(如随机的阴影)。
3. 温和的引导者(解耦掩码注入)
这是最重要的改变。与其使用那种“坏轮廓导致坏标签”的“硬组合”,SAM-MI 使用了解耦掩码注入(DMI)。你可以把图书管理员的地图想象成一张模糊的草图,而艺术家的轮廓被用作锐化这张草图的“指南”,但如果指南看起来不对,图书管理员被允许忽略它。
- 低频注入(Low-Frequency Injection): 这部分利用轮廓来帮助图书管理员理解大局和物体的总体形状(即“全局上下文”)。
- 高频注入(High-Frequency Injection): 这部分利用轮廓来锐化边缘和细节(即“局部细节”)。
通过将两者分离,系统可以在不被强制接受错误轮廓的前提下,修复图书管理员那张模糊的地图。如果艺术家在云朵周围画了一个圈,但图书管理员知道那是“椅子”,系统可以修正地图,而不是仅仅接受这个错误。
研究发现
团队在多个不同的数据集上测试了 SAM-MI,其中包括一个庞大的图像集合 MESS(涵盖了从城市街道到医学扫描及农业场景的所有内容)。
- 性能: 在 MESS 基准测试中,SAM-MI 比之前的最优方法 Grounded-SAM 的准确度(以 mIoU 衡量)提升了 16.7%。
- 速度: 它也比 Grounded-SAM 快了 1.6 倍。
- 通用性: 它在 ADE20K 和 PASCAL-Context 等标准数据集上也表现出色,分别比其他未使用 SAM 的顶尖方法提升了 4.2% 和 3.5%。
局限性与未来
作者谨慎地指出,他们的系统并非完美。他们发现了两个主要面临挑战的领域:
- 微小或狭窄的物体: 如果一个物体极其微小(如椅腿)或非常细长(如风扇叶片),“智能侦察员”可能会错过它,因为它只放置了极少数的点。系统同时也承认,即使找到了这些物体,图书管理员(CLIP)在识别微小物体方面也表现一般。
- 混乱的背景: 在极其拥挤的场景中(例如摆满重叠家具的房间或树木交错的森林),系统有时会感到困惑并混淆物体。
研究人员还指出,目前的测试存在一些缺陷,比如数据集中存在标签缺失或类别错误的情况,这使得很难确定这项技术的真实极限。他们建议未来的工作应专注于完善这些基准测试,并尝试将这种“掩码注入”的思想应用于其他任务,例如寻找特定的物体实例或创建完整的全景地图。
简而言之,SAM-MI 表明,通过将强大的“分割一切”模型视为一个有用的向导而非僵化的老板,我们可以构建出理解和绘制视觉世界的能力更强、速度更快、错误更少的机器人。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。