Weakly Supervised Segmentation as Semantic-Based Regularization
本文提出了一种神经符号方法,将可微模糊逻辑与 Segment Anything 模型(SAM)相融合,以将弱标注和领域先验统一为连续逻辑约束,从而生成高质量伪标签,实现超越全监督基线的最先进弱监督分割性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在试图教导一位才华横溢但略显固执的艺术家(我们称他为“SAM”)如何绘制物体的完美图像。
问题所在:
通常,要教导一位艺术家,你需要向他展示成千上万张图片,其中每一张的每个像素都由人类专家完美地着色。这就像雇佣一支画家团队,逐像素地为涂色书填色。这种方式极其昂贵、缓慢且枯燥。
因此,研究人员尝试利用“弱”提示来教导艺术家。他们不再提供完整的涂色书,而只是给艺术家提供:
- 一个边界框(围绕物体绘制的矩形)。
- 几条涂鸦(在物体上随意画出的线条)。
- 或者仅仅是一个标签(一张写着“这是一只猫”的便签)。
问题在于这些提示很模糊。如果你只是给猫画一个框,艺术家可能会把整个框都画成猫,包括背景,或者漏掉猫的尾巴。艺术家会对边缘感到困惑。
旧方法:
最近,人们开始使用“基础模型”(就像我们的艺术家 SAM 一样),它已经看过数十亿张图片。人们心想:“如果我们只给 SAM 看这个框,他应该能猜出其余部分!”但 SAM 很固执。它是在通用照片上训练的,而不是在医学扫描或特定的怪异物体上训练的。如果你让它仅根据一个框来猜测,它经常会出现错误,因为它不理解你新世界的具体规则。此外,当面对多个提示(例如一个框和一条涂鸦)时,它也不知道如何同时听取这些提示而不感到困惑。
新解决方案:“逻辑教练”
本文介绍了一种利用神经符号学习来训练艺术家的新方法。这就像雇佣一位严格的“逻辑教练”站在艺术家身旁,在他作画时进行指导。
教练不为艺术家作画。相反,教练用规则(逻辑)说话,艺术家必须遵循这些规则。这些规则是用一种艺术家能够理解并从中学习的特殊“模糊”语言编写的。
以下是教练的规则如何运作:
- 涂鸦规则:“如果我在某个位置画了涂鸦,那个位置必须是猫。”
- 边界框规则:“在这个框内必须有一只猫,而且猫应该填满框的大部分,而不仅仅是一个像素。”
- 平滑度规则:“如果你的邻居像素是猫,你也应该是猫。不要在‘猫’的中间画一个单独的‘背景’像素。”
- 形状规则(针对医学图像):“在这张特定的医学图像中,物体是圆形的。如果你画了框的角落,那就是错的,因为圆形物体不会触及角落。”
两阶段过程:
第一阶段:训练营。
艺术家(SAM)尝试绘制图像。逻辑教练在一旁观察并指出:“嘿,你在这里违反了平滑度规则!”或者“你在那里忽略了涂鸦!”艺术家调整他的画作以满足这些规则。他反复这样做,直到产生一个“伪标签”——即对完美图像外观的高质量猜测。第二阶段:期末考试。
现在,既然艺术家已经生成了这些高质量的“猜测”,我们就将它们视为完美的人类绘制图像。我们选取一位全新的、更简单的艺术家(一个标准的分割模型),并利用这些“猜测”作为教科书来教导他。这位新艺术家学会了完美地作画,不再需要任何人类提示或指令。
结果:
研究人员在两个方面测试了这种方法:
- 普通照片(Pascal VOC):他们使用了边界框和涂鸦。他们的方法生成的“猜测”如此出色,以至于最终的艺术家的表现优于那些使用完整且昂贵的人工标签进行训练的艺术家。
- 医学眼部扫描(REFUGE2):他们使用边界框和点来定位视盘和视杯。尽管原始医学艺术家(MedSAM)在没有训练的情况下对此表现糟糕,但逻辑教练帮助他学习了眼睛的规则。最终结果几乎等同于他们花费数月时间手动绘制每个像素所达到的效果。
总结:
与其仅仅指望一个聪明的 AI 能从少量提示中猜出答案,不如让这篇论文教导 AI 一套逻辑规则(例如“猫是平滑的”或“圆形物体没有棱角”)。通过迫使 AI 在学习过程中遵循这些规则,它创建了更好的训练数据,从而产生了一个极其准确的最终模型,即使我们开始时只有廉价且不完善的提示。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。