← 最新论文
💻 computer science

Learning to Label: A Reinforced Self-Evolving Framework for Semi-supervised Referring Expression Segmentation

本文提出了学习标注(L2L),这是一个强化自进化框架,它利用多模态大语言模型获取语义空间先验,并将伪标签选择构建为自适应决策过程,以在标注有限的情况下提升半监督指代表达分割的性能。

原作者: Runlong Cao, Ying Zang, Chuanwei Zhou, Tianrun Chen, Tong Zhang, Zhen Cui, Chunyan Xu

发布于 2026-05-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Runlong Cao, Ying Zang, Chuanwei Zhou, Tianrun Chen, Tong Zhang, Zhen Cui, Chunyan Xu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试教一个机器人根据你给出的句子在照片中寻找特定物体,比如“戴着红色项圈的狗”或“左边的披萨片”。这项任务被称为指代表达分割。机器人需要围绕那个确切的物体绘制完美的轮廓。

通常,要如此出色地训练机器人,你需要成千上万张照片,并且需要人类 painstakingly(费力地)手工绘制这些轮廓。这既昂贵又缓慢。半监督学习是一个捷径:你给机器人提供几张带有完美轮廓的照片(标注数据)和一大堆没有轮廓的照片(未标注数据),希望机器人能自己找出其余部分。

问题在于?当机器人试图猜测未标注照片的轮廓时,它经常感到困惑。它可能会围绕整只狗画一个圈,而不是只画项圈,或者它可能会被一个外观相似的物体分散注意力。如果你只是告诉机器人:“好吧,相信你自己的猜测”,它往往会从自己的错误中学习,从而形成错误的循环。

本文介绍了一个名为**学习标注(L2L)**的新框架。把它想象成一个智能的、自我纠正的辅导系统。其工作原理如下,分为三个简单的部分:

1. “超级观察者”(MLLM)

首先,系统引入了一位“超级观察者”——一个庞大的预训练人工智能(称为多模态大语言模型或 MLLM),它非常擅长理解语言和图像,但并不完美。

  • 类比:想象你正在拥挤的体育场里寻找特定的人。你向一位超级聪明的朋友(MLLM)求助。你的朋友说:“我认为是那个戴蓝帽子的人。”但你的朋友有时会出错,或者可能看错了人。
  • 论文主张:系统利用这位“超级观察者”来获取物体可能位置的“草稿”。它并不盲目信任这份草稿;它只是将其作为一个起始提示。

2. “校准站”(SPM)

现在,系统拥有两种观点:超级观察者的草稿和机器人自己的猜测。有时它们意见一致;有时它们分歧巨大。

  • 类比:想象你和你朋友都在看一张地图。你的朋友说:“向左转”,但你说:“向右转”。如果你只是选择其中一个,你可能会迷路。相反,这个系统充当了一个校准站。它观察你们每个人有多自信。如果你的朋友有 95% 的把握,而你只有 25% 的把握,它会倾向于你的朋友。但如果你有 98% 的把握,而你的朋友只有 40% 的把握,它会信任你。
  • 论文主张:系统将这两种观点混合在一起,根据每个来源的确定性程度进行加权。这创造了一个比单独任何一个都更可靠的“校准”指南。

3. “智能过滤器”(RPLE)

这是最独特的部分。通常,计算机使用固定规则来决定哪些猜测足够好,可以用于训练(例如:“只信任那些有 80% 把握的猜测”)。

  • 类比:想象一位严厉的老师说:“只有当你答对 80% 时,我才会接受你的作业。”这很糟糕,因为有时一道难题即使只得了 60% 的分数,也值得付出 100% 的努力;而有时一道简单的题目可能只是侥幸。
  • 论文主张:L2L 不使用固定规则,而是使用一个强化学习代理(就像一个通过试错来学习的电子游戏角色)。该代理充当智能过滤器。它观察训练过程并问道:“这个猜测现在有用吗?”
    • 如果机器人在处理一张困难的照片时感到吃力,过滤器可能会说:“让我们稍微宽容一点,利用这个猜测来帮助机器人学习。”
    • 如果机器人很有信心,但猜测充满噪声,过滤器会说:“不,忽略这个。”
    • 过滤器学会动态调整自己的“严格程度”,奖励机器人取得的良好进展,并惩罚其从不良数据中学习。

结果:一个自我进化的循环

整个系统在一个循环中运行:

  1. 机器人做出猜测。
  2. 超级观察者提供提示。
  3. 校准站将它们融合。
  4. 智能过滤器决定该融合结果中的哪些部分足够可信,可以用来教导机器人。
  5. 机器人从过滤后的数据中学习,变得更好,循环重复。

论文发现:
作者在三个标准数据集(RefCOCO、RefCOCO+ 和 RefCOCOg)上测试了该方法,使用的标注数据非常少(少至总图像的 0.1%)。

  • 主张:他们的方法(L2L)始终优于现有方法。即使几乎没有标注数据,其表现也优于“零样本”方法(完全没有任何训练示例就尝试执行任务模型)。
  • 结论:通过将训练数据的选择视为一种“学习决策”而非固定规则,并利用超级观察者来指导过程,该系统能够更准确、更可靠地学习自我标注。

简而言之,论文主张,通过教计算机如何选择自己的训练示例——利用一个智能、自适应的过滤器和一个有帮助(但不完美)的人工智能助手——我们可以用更少的人力投入构建更好的视觉系统。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →