CLIP-Guided SAM: Parameter-Efficient Semantic Conditioning for Promptable Segmentation
本文介绍了 CLIP 引导的 SAM,这是一个参数高效的框架,通过轻量级适配器将 CLIP 衍生的特征直接注入其图像编码器,从而增强原本语义盲的 Segment Anything Model,使其在交互式和纯文本模式下均能实现鲁棒的特定概念分割,同时保持模型原有的可提示接口。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你有一位名为 SAM(Segment Anything Model,分割一切模型)的超级智能机器人艺术家。SAM 在某一件事上令人惊叹:看着一张图片,并为你所指的任何事物勾勒出完美的轮廓。如果你点击一只狗,它就勾勒出一只狗;如果你点击一辆车,它就勾勒出一辆车。
但这里有个陷阱:SAM 对“含义”视而不见。它不知道什么是狗或车。它只知道“你点在这里,所以我在这里画个形状”。如果你希望它在照片中找出所有的狗,而无需你逐一点击每一只,SAM 就会束手无策。它需要人类去点击每一只狗。
现在,想象你有第二位机器人 CLIP,它是一位语言专家。CLIP 能够看着一张图片和一个单词(比如“狗”),并理解它们属于彼此。但 CLIP 不擅长绘制精确的轮廓;它更像是一团模糊的“狗性”云团。
旧方法:中间人
以前,如果你想同时使用这两位机器人,你必须让它们按顺序工作。你会问 CLIP:“找出狗”,CLIP 会尝试猜测它们的位置,并向 SAM 发送一条粗略的便条说:“嘿,点这里。”然后 SAM 就会勾勒出轮廓。
问题出在哪?这就像在玩“传话”游戏。信息变得模糊不清。CLIP 的粗略猜测并不完美,而 SAM 在绘制时并没有真正理解“狗”的概念;它只是遵循了一条糟糕的指令。
新方法:CLIP 引导的 SAM
这篇论文的作者构建了一个新系统,将两位机器人的大脑直接连接起来。
他们不再让 CLIP 仅仅向 SAM 发送便条,而是将 CLIP 的“理解”直接注入到 SAM 的大脑中,使其在工作时就能获得这种理解。这就像给 SAM 戴上了一副智能眼镜,让它看到的不仅仅是形状,还有形状背后的含义。
他们的方法如下:
- 语义适配器:他们在 SAM 的大脑内部构建了微小、轻量级的桥梁(称为适配器)。
- 注入:他们将 CLIP 的“文本”(单词“狗”)、“视觉”(狗长什么样)和“相似度”(图像的这部分有多像狗)直接输入这些桥梁。
- 结果:现在,当 SAM 看着一张图片时,它看到的不仅仅是形状;它看到的是被含义着色的形状。它知道:“这个形状是狗,因为我的大脑当前正调谐到‘狗’。”
两种使用方式
论文展示了该系统在两种模式下的运作:
- 交互模式(手动):你是老板。你点击一只狗,同时也输入“狗”。系统利用你的点击来实现精确度,并利用你的文本确保它找到所有的狗,而不仅仅是你点击的那一只。
- 半自动模式(仅文本):你只需输入“狗”。系统利用其新的“智能眼镜”自行找出狗并勾勒轮廓,无需你进行任何点击。
为何这很重要(论文的声明)
作者在测试中应用了该系统处理一些非常棘手的任务,例如寻找伪装物体(完美隐藏在背景中的动物),以及仅在拥有极少量标注示例(就像用几张闪卡教学生,而不是整本图书馆)的情况下寻找物体。
他们发现:
- 它更智能:通过让两个模型共同学习(协同适应),该系统在寻找物体方面比单独训练它们时要出色得多。
- 它更高效:他们不需要重新训练 SAM 那庞大的整个大脑。他们只微调了微小的“智能眼镜”(适配器),并让 CLIP 也进行少量学习。这意味着它运行速度快,且不需要超级计算机。
- 它胜过竞争对手:在他们的测试中,这种方法在寻找物体方面的准确度超过了其他尝试组合这些机器人的方法,甚至在使用远少资源的情况下,接近了更大、更昂贵的模型(如 SAM 3)的表现。
核心启示
论文中最重要的发现是,你不能只是冻结其中一个机器人并指望它能正常工作。如果你让 CLIP 在 SAM 学习的同时进行学习,它们就能更好地理解彼此。如果你事先冻结 CLIP,团队的表现实际上会更差。这就像跳舞:舞伴需要一起学习舞步,而不是一方在另一方加入之前独自练习。
简而言之,他们找到了如何赋予一个寻找形状的机器人以理解单词的“大脑”,使其成为在图片中寻找特定事物的更强大工具,即使在没有大量数据来教导它的情况下也是如此。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。