← 最新论文
⚡ electrical engineering

FARCLUSS: Fuzzy Adaptive Rebalancing and Contrastive Uncertainty Learning for Semi-Supervised Semantic Segmentation

本文介绍了 FARCLUSS,这是一个整体性的半监督语义分割框架,它通过模糊伪标签、不确定性感知动态加权、自适应类别重平衡以及对比正则化,将预测不确定性转化为学习资产,从而有效地解决伪标签低效、类别不平衡和模糊区域等挑战。

原作者: Ebenezer Tarubinga, Jenifer Kalafatovich, Seong-Whan Lee

发布于 2026-08-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Ebenezer Tarubinga, Jenifer Kalafatovich, Seong-Whan Lee

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

技术摘要:FARCLUSS

问题陈述

半监督语义分割(SSSS)旨在通过利用少量有标签图像与大量无标签数据,实现与全监督模型相当的性能。然而,现有方法面临三个持久的局限性:

  1. 伪标签利用效率低下: 当前的方法通常依赖严格的置信度阈值来生成硬伪标签(hard pseudo-labels)。这丢弃了“不确定”区域(例如物体边界或遮挡区域),在这些区域预测概率具有歧义性,从而丧失了宝贵的监督信号并加剧了确认偏差(confirmation bias)。
  2. 类别不平衡: 在长尾数据集中,伪标签往往向主导类别(如道路、天空)倾斜,导致少数类(如交通标志、电线杆)代表性不足且优化效果差。
  3. 计算效率低: 采用对比学习来提高特征判别性的方法,由于涉及大量的像素对比较或双网络架构,往往会产生高昂的计算成本,限制了其可扩展性。

方法论

作者提出了 FARCLUSK(Fuzzy Adaptive Rebalancing and Contrastive Uncertainty Learning,模糊自适应重平衡与对比不确定性学习),这是一个基于标准教师-学生架构构建的统一框架。该方法集成了四个核心组件来解决上述挑战:

1. 模糊伪标签(Fuzzy Pseudo-Labeling)

FARCLUSS 不再丢弃未达到高置信度阈值的像素,而是保留每个像素的前 KK 个最大类别概率。

  • 机制: 对于教师模型生成的概率图,选取前 KK 个类别。通过归一化这些概率来计算软模糊标签分布。
  • 益处: 这保留了歧义区域(如“人行道”与“道路”之间的边界)中的软类别分布和类间关系,将不确定性从一种负担转化为建设性的学习信号。

2. 不确定性感知动态加权(Uncertainty-Aware Dynamic Weighting)

为了减轻由不确定预测引入的噪声,该框架在训练期间调节每个像素的影响力。

  • 机制: 根据教师预测的归一化熵(HH)为像素分配权重。权重定义为 W=1HW = 1 - H
  • 益处: 高不确定性(高熵)的像素获得较低的权重,而置信度高的预测则被放大。这起到了软课程学习的作用,在不完全丢弃的情况下降低了噪声区域的权重。

3. 自适应类别重平衡(Adaptive Class Rebalancing)

为了对抗伪标签中向多数类倾斜的偏差,该框架会对每个 Batch 的损失函数进行动态调整。

  • 机制: 根据当前 Batch 中伪标签像素的频率计算类别权重(wcw_c)。作者使用了一种基于中位数的归一化器:wc=median(F)/(Fc+ϵ)w_c = \text{median}(F) / (F_c + \epsilon),其中 FcF_c 是类别 cc 的频率。
  • 益处: 这种稳健的统计方法确保了少数类能够获得充分的优化关注,同时避免了由反频率加权引起的波动或由均值加权引起的膨胀。

4. 轻量化对比正则化(Lightweight Contrastive Regularization)

为了在不增加成对比较开销的情况下增强特征判别性,该方法采用了基于原型的对比损失。

  • 机制: 类别特定的原型(质心)被计算为具有高置信度模糊伪标签的像素平均嵌入。该损失惩罚像素嵌入与其对应类别原型之间的余弦距离。
  • 益处: 这以 O(Nd)O(N \cdot d) 的复杂度促进了类内紧凑性和类间分离,避免了像 ReCo 那样具有 O(N2d)O(N^2 \cdot d) 复杂度的成对比较方法。

核心贡献

论文将其贡献总结如下:

  • 模糊伪标签: 从前 KK 个概率构建软标签分布,将歧义性保留为学习信号。
  • 不确定性感知动态加权: 使用归一化熵来调节像素级伪标签的影响,减少来自歧义区域的噪声。
  • 自适应重平衡: 根据每 Batch 的伪标签频率动态缩放损失,以在无需人工启发式规则的情况下改善少数类的学习。
  • 轻量化对比正则化: 利用基于原型的对比学习来避免昂贵的成对操作,同时提升特征的紧凑性。

实验结果

研究人员在 Pascal VOC(经典版与混合版)和 Cityscapes 数据集上使用 ResNet-50 和 ResNet-101 骨干网络进行了广泛实验。

  • 性能: 在各种有标签数据比例(1/16 到 1/2)下,FARCLUSS 一致地优于现有的先进方法(包括 UniMatch、CorrMatch 和 PS-MT)。
    • Pascal VOC Classic 上,它实现了卓越的 mIoU 分数,在大多数划分中超过 UniMatch 0.4–1.2 mIoU。
    • Cityscapes 上,它取得了顶尖结果(例如,在 1/2 比例下使用 ResNet-101 时达到 81.0 mIoU),尤其是在代表性不足的类别和边界区域表现出显著增益。
  • 效率: 该方法通过单网络设计实现了这些结果,避免了 CorrMatch 的对应匹配开销或 CPS 的双网络复杂性。其数据效率与 UniMatch 和 CW-BASS 等近期方法相当。
  • 消融实验:
    • 去除模糊标签导致性能下降最大(Pascal 上下降了 6.2 mIoU),证实了其在保留信息丰富监督方面的作用。
    • 基于中位数的类别重平衡优于反频率、均值和调和平均策略。
    • Top-KK 模糊标签(K=2K=2)被证明优于固定阈值过滤,因为它保留了 100% 的像素,同时将标签分布约束在合理的类别范围内。
    • 基于原型的对比损失以显著更低的内存使用量和训练时间,达到了与成对方法(ReCo, U2PL)相当的准确度。

重要性与主张

论文声称 FARCLUSS 是一个整体性的解决方案,它将不确定性从一种负担转化为一种学习资产。通过在一个统一的框架内系统地解决伪标签噪声、类别不平衡和计算开销问题,该方法实现了更具信息量且更均衡的学习。

作者强调,其方法对于以下方面具有重要意义:

  1. 歧义区域: 模糊标签和熵加权允许模型从通常被阈值法丢弃的边界区域中学习。
  2. 少数类: 自适应重平衡机制专门针对语义分割数据集中固有的长尾分布问题。
  3. 可扩展性: 轻量化的对比正则化和单网络设计确保了该方法可以在不牺牲准确性的情况下高效地扩展到大型数据集。

研究结论认为,FARCLUSS 为半监督语义分割场景下的不确定性引导、资源高效型学习树立了新的方向。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →