← 最新论文
🤖 machine learning

Label-Efficient Dataset Pruning via Semi-Supervised Pseudo-Labeling

本文提出了 SemiPrune,这是一种标签高效的数据集剪枝框架,它利用少量标记子集上的半监督伪标签,使监督式剪枝方法能够应用于未标记数据,从而在不依赖可能存在不匹配问题的预训练特征的情况下,通过更准确地捕捉目标分布来实现最先进的性能。

原作者: Yeseul Cho, Baekrok Shin, Changmin Kang, Chulhee Yun

发布于 2026-05-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Yeseul Cho, Baekrok Shin, Changmin Kang, Chulhee Yun

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试教一名学生(一个 AI 模型)识别不同类型的动物。你拥有一个包含 100 万张照片的庞大图书馆,但阅读每一张照片都需要耗费漫长时间且成本高昂。你想要挑选出 10,000 张“最佳”照片,使这名学生能够像学习整个图书馆一样有效地掌握知识。这个过程被称为数据集剪枝

问题在于:要确定哪些照片是“最佳”的,通常需要先让人类为每一张照片进行标注(例如,“这是一只猫”,“这是一只狗”)。但雇佣人类去标注一百万张照片的成本太高了。

旧方法(以及它们为何行不通)

此前,研究人员尝试了两种主要技巧来避免标注所有数据:

  1. “专家的直觉”(无标签方法): 他们使用一个已经在另一组照片(如通用互联网图像)上训练过的超级智能 AI,来猜测哪些照片是重要的。
    • 缺陷: 想象一下,让一位只懂做意大利菜的厨师去评判一家泰国餐厅的菜单。由于食材和风味完全不同,他们可能会感到困惑。同样,如果你的数据很特殊(如医学扫描图像、损坏的图像或稀有动物),“预训练专家”就会出错。
  2. “小样本猜测”(少标签方法): 他们标注了一小部分照片,并试图基于这个小群体来猜测其余照片的重要性。
    • 缺陷: 这就像试图通过看一杯水来理解整个海洋。这种猜测往往会忽略大局。

新解决方案:"SemiPrune"

作者提出了一种名为SemiPrune的新方法。可以将其视为一种聪明的两步辅导策略,利用极少量的人类帮助来教会 AI 如何自我教学。

第一步:“自我教学”阶段(半监督学习)
与其让人类标注整个图书馆,不如给 AI 一小部分随机抽取的已标注照片(例如 10%)。

  • AI 观察这 10% 的照片并学习规则。
  • 然后,它查看剩余 90% 的未标注照片。基于从这 10% 中学到的内容,它对其余部分做出自己的“有根据的猜测”(称为伪标签)。
  • 神奇之处: 因为 AI 是直接从你的特定照片(即使只有几张)中学习的,所以它的猜测比旧方法中通用的“预训练专家”更能理解你特定的数据“风味”。这就像 AI 现在成了你特定菜单的本地专家,而不是一个通用的厨师。

第二步:“课程”阶段(剪枝)
现在,AI 已经用自己的猜测标注了整个图书馆,它就像一位严格的老师。它利用这些“伪标注”的照片训练一个新模型,并观察该模型的学习过程。

  • 它会问:“哪些照片让模型感到吃力?哪些照片它瞬间就掌握了?”
  • 它保留那些难度适中的照片——既不太容易,也不太难——从而创建出完美的、精简的学习指南(即核心集)。

为何这很重要(结果)

该论文在三种旧方法通常失效的棘手场景中测试了这种方法:

  1. 领域不匹配(“特色店铺”): 当数据与 AI 通常所见的内容非常不同(如特定食物图像或自然场景)时。
    • 结果: SemiPrune 表现要好得多,因为它适应了特定数据,而旧的“预训练专家”则感到困惑。
  2. 图像损坏(“模糊照片”): 当照片受损、充满噪声或失真时。
    • 结果: 旧方法被噪声绊倒了。SemiPrune 学会了忽略噪声,专注于图像的实际含义。
  3. 长尾分布(“稀有动物”): 当你有成千上万张常见猫的照片,却只有几张稀有老虎的照片时。
    • 结果: 旧方法倾向于忽略稀有老虎。SemiPrune 在少量已标注样本的引导下,确保稀有样本仍被识别并保留在学习指南中。

结论

SemiPrune 是一种在不花费巨资雇佣人类标注的情况下,将庞大数据集缩减至可管理规模的方法。它通过利用极少量的人类标注来教会 AI 如何为其余数据自行标注,然后利用这些自标注数据来挑选最重要的样本,从而实现这一目标。

其核心思想是:“不要雇佣一支标注大军。雇佣一位聪明的老师,让他们教 AI 几个例子,然后让 AI 自己去解决其余部分。”论文表明,这种方法比基于旧数据猜测或仅随机挑选样本的效果更好。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →