想象一下,你正在尝试教一个机器人根据你给出的句子在照片中寻找特定物体,比如“戴着红色项圈的狗”或“左边的披萨片”。这项任务被称为指代表达分割。机器人需要围绕那个确切的物体绘制完美的轮廓。
通常,要如此出色地训练机器人,你需要成千上万张照片,并且需要人类 painstakingly(费力地)手工绘制这些轮廓。这既昂贵又缓慢。半监督学习是一个捷径:你给机器人提供几张带有完美轮廓的照片(标注数据)和一大堆没有轮廓的照片(未标注数据),希望机器人能自己找出其余部分。
问题在于?当机器人试图猜测未标注照片的轮廓时,它经常感到困惑。它可能会围绕整只狗画一个圈,而不是只画项圈,或者它可能会被一个外观相似的物体分散注意力。如果你只是告诉机器人:“好吧,相信你自己的猜测”,它往往会从自己的错误中学习,从而形成错误的循环。
本文介绍了一个名为**学习标注(L2L)**的新框架。把它想象成一个智能的、自我纠正的辅导系统。其工作原理如下,分为三个简单的部分:
1. “超级观察者”(MLLM)
首先,系统引入了一位“超级观察者”——一个庞大的预训练人工智能(称为多模态大语言模型或 MLLM),它非常擅长理解语言和图像,但并不完美。
- 类比:想象你正在拥挤的体育场里寻找特定的人。你向一位超级聪明的朋友(MLLM)求助。你的朋友说:“我认为是那个戴蓝帽子的人。”但你的朋友有时会出错,或者可能看错了人。
- 论文主张:系统利用这位“超级观察者”来获取物体可能位置的“草稿”。它并不盲目信任这份草稿;它只是将其作为一个起始提示。
2. “校准站”(SPM)
现在,系统拥有两种观点:超级观察者的草稿和机器人自己的猜测。有时它们意见一致;有时它们分歧巨大。
- 类比:想象你和你朋友都在看一张地图。你的朋友说:“向左转”,但你说:“向右转”。如果你只是选择其中一个,你可能会迷路。相反,这个系统充当了一个校准站。它观察你们每个人有多自信。如果你的朋友有 95% 的把握,而你只有 25% 的把握,它会倾向于你的朋友。但如果你有 98% 的把握,而你的朋友只有 40% 的把握,它会信任你。
- 论文主张:系统将这两种观点混合在一起,根据每个来源的确定性程度进行加权。这创造了一个比单独任何一个都更可靠的“校准”指南。
3. “智能过滤器”(RPLE)
这是最独特的部分。通常,计算机使用固定规则来决定哪些猜测足够好,可以用于训练(例如:“只信任那些有 80% 把握的猜测”)。
- 类比:想象一位严厉的老师说:“只有当你答对 80% 时,我才会接受你的作业。”这很糟糕,因为有时一道难题即使只得了 60% 的分数,也值得付出 100% 的努力;而有时一道简单的题目可能只是侥幸。
- 论文主张:L2L 不使用固定规则,而是使用一个强化学习代理(就像一个通过试错来学习的电子游戏角色)。该代理充当智能过滤器。它观察训练过程并问道:“这个猜测现在有用吗?”
- 如果机器人在处理一张困难的照片时感到吃力,过滤器可能会说:“让我们稍微宽容一点,利用这个猜测来帮助机器人学习。”
- 如果机器人很有信心,但猜测充满噪声,过滤器会说:“不,忽略这个。”
- 过滤器学会动态调整自己的“严格程度”,奖励机器人取得的良好进展,并惩罚其从不良数据中学习。
结果:一个自我进化的循环
整个系统在一个循环中运行:
- 机器人做出猜测。
- 超级观察者提供提示。
- 校准站将它们融合。
- 智能过滤器决定该融合结果中的哪些部分足够可信,可以用来教导机器人。
- 机器人从过滤后的数据中学习,变得更好,循环重复。
论文发现:
作者在三个标准数据集(RefCOCO、RefCOCO+ 和 RefCOCOg)上测试了该方法,使用的标注数据非常少(少至总图像的 0.1%)。
- 主张:他们的方法(L2L)始终优于现有方法。即使几乎没有标注数据,其表现也优于“零样本”方法(完全没有任何训练示例就尝试执行任务模型)。
- 结论:通过将训练数据的选择视为一种“学习决策”而非固定规则,并利用超级观察者来指导过程,该系统能够更准确、更可靠地学习自我标注。
简而言之,论文主张,通过教计算机如何选择自己的训练示例——利用一个智能、自适应的过滤器和一个有帮助(但不完美)的人工智能助手——我们可以用更少的人力投入构建更好的视觉系统。
技术摘要:学习标注(L2L)
问题陈述
半监督指代表达分割(SS-RES)旨在利用少量标注的图像 - 文本对和大量未标注数据池,实现精确的像素级语言 grounding。尽管现有的半监督分割方法依赖于伪标注和一致性正则化,但由于指代歧义、遮挡以及长程上下文推理的需求,直接将这些范式应用于 SS-RES 极具挑战性。这些因素往往导致边界不确定性和伪掩码的不稳定。
现有方法通常使用固定的置信度阈值来过滤伪标注。然而,这种启发式方法十分脆弱:过严的阈值会丢弃具有信息量的样本,而过松的阈值则会引入噪声监督,污染训练过程。此外,近期工作利用多模态大语言模型(MLLM)和基础模型(例如 SAM)生成外部先验。然而,这些先验并不总是可靠的;MLLM 可能会产生幻觉或遭受 grounding 漂移,而分割模型可能会过度分割或受到干扰。关键在于,MLLM 先验的置信度与分割模型自身预测之间往往存在显著的、依赖于样本的分歧,这使得固定阈值策略失效。
方法论
作者提出了学习标注(L2L),这是一个强化自进化框架,将伪标注构建重构为可学习的决策过程。该框架在一个闭环中运行,其中多模态先验、伪标注选择和分割网络协同进化。该架构包含三个核心组件:
1. 基于 MLLM 的语义 - 空间先验(SPM)
为了初始化软分割提议,L2L 利用参数冻结的 MLLM 提取未标注图像 - 文本对的语义 grounding 线索。这些线索促使 SAM2 生成密集的软分割提议(Pi†),同时保留不确定性。
- 不确定性感知校准:认识到外部先验与模型预测(Piw)可能存在冲突,SPM 在逻辑空间中使用像素自适应权重 λ(u) 将它们融合。该权重基于以下因素计算:
- 像素级确定性:基于边距的分数 C(p),随着预测远离歧义(0.5)而增加。
- 样本级一致性:全局一致性分数 W,衡量弱预测与外部先验之间的一致性。
- 融合:校准后的先验 P~i† 通过对数空间中的外部先验和模型预测进行加权生成。这确保了当模型不确定时更多地依赖外部先验,而当模型自信或全局一致性较低时抑制先验。
2. 自进化分割模块(SESM)
SESM 将校准后的先验集成到分层分割网络中。它不采用静态融合,而是采用阶段自适应门控机制来注入语义和结构指导。
- 双重指导:该模块结合了来自文本编码器的语义场(S)和源自像素级先验的结构场(Gj)。
- 动态门控:统一的条件信号 Mj 通过可学习的阶段门控因子(αj,βj)合成,以平衡高层语义消歧和底层结构细化。
- 阶段依赖交互:对于浅层阶段,结构场通过严格的局部投影应用,以保持空间对应关系。对于深层阶段,通过交叉注意力启用全局关系推理。
- 自进化:随着模型弱预测的改善,结构指导被迭代更新,逐步减少噪声并提高可靠性。
3. 强化伪标注探索(RPLE)
为了解决固定阈值的次优性,RPLE 将伪标注接受形式化为强化学习(RL)决策过程。
- 状态表示:状态 st 包括融合预测的统计特征(均值、标准差)、前景/背景/忽略像素的比例以及样本级一致性分数。
- 策略搜索器:Actor 网络(πϕ)为每个样本输出自适应的前景和背景置信度阈值(τfg,τbg)。
- Critic 与奖励:Critic 网络(Qϕ)评估所选的伪标注。奖励定义为指令增益(ΔΦt),包含三个组成部分:
- 可分离性增益(ΔM):衡量前景与背景之间的对比边界。
- 一致性增益(ΔK):衡量模型预测与校准先验之间的一致性。
- 覆盖增益(ΔC):衡量所选像素的比例。
- 施加稳定性惩罚以防止阈值发生剧烈变化。
- 优化:策略通过确定性策略梯度进行优化,以最大化期望累积质量分数,在整个训练过程中动态平衡精度和覆盖范围。
主要贡献
- 学习标注框架:作者引入了 L2L,将伪标注构建从静态阈值过程转变为可学习的、样本自适应的决策过程,从而在稀疏标注下实现更可靠的像素级监督挖掘。
- MLLM 驱动的先验与校准:该工作引入了 MLLM 驱动的语义 - 空间先验以初始化软分割,并提出了一种强化选择机制,通过融合多模态先验与模型预测,自适应地识别高效用监督。
- 实证验证:在 RefCOCO、RefCOCO+ 和 RefCOCOg 上的大量实验表明,在各种标签预算(0.1% 至 10%)下,该方法相较于现有的半监督方法和基线方法均取得了持续的提升。
实验结果
- 性能:L2L 在所有数据集和标签预算下均取得了最先进的结果。值得注意的是,在极低标签 regime(0.1% 标注数据)下,L2L 的表现优于零样本对应方法和现有的半监督基线(如 RESMatch、SemiRES)。
- 消融研究:
- 单独移除 SPM、SESM 或 RPLE 均会导致性能下降,证实了不确定性感知融合、分层指导和自适应阈值的必要性。
- SESM 中的加权策略(动态门控)优于固定权重融合,验证了动态平衡语义和结构线索的需求。
- RPLE 显著优于静态阈值,后者被证明对阈值值的选择高度敏感。
- 鲁棒性:该方法对基础模型选择的变化(例如 SAM 与 SAM2,不同的 MLLM 骨干网络)具有鲁棒性,即使 MLLM 先验被非 MLLM 教师(例如 CARIS、CGFormer)取代,仍然有效。
- 效率:L2L 引入的可训练参数适中(约 9.3M),且 RL 组件轻量级,由于基础模型保持冻结,推理时间成本可忽略不计。
意义与主张
本文声称 L2L 为在极低标注成本下构建数据高效的指代分割系统提供了稳健的解决方案。通过将伪标注视为强化自进化过程,该框架有效缓解了固定阈值启发式的脆弱性和外部先验的不可靠性。作者断言,他们的方法实现了分割模型与伪标注的联合优化,逐步提升标签可靠性。该工作被视为迈向可泛化的 SS-RES 系统的一步,这些系统能够利用 MLLM 的推理能力,同时不受其潜在幻觉或 grounding 漂移的阻碍。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。