← 最新论文
🤖 machine learning

A Data-Centric Framework for Detecting and Correcting Corrupted Labels

该论文引入了 Relabeler,这是一个端到端的以数据为中心的框架,它利用局部和全局数据关系来检测并修正噪声标签,在标签修正精度和下游任务性能方面显著优于现有最先进的方法。

原作者: Ha-Linh Nguyen, Hong-Anh Nguyen, Minh-Duc La, Thu-Trang Nguyen, Son Nguyen, Hieu Dinh Vo

发布于 2026-06-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Ha-Linh Nguyen, Hong-Anh Nguyen, Minh-Duc La, Thu-Trang Nguyen, Son Nguyen, Hieu Dinh Vo

原始论文根据 CC0 1.0(http://creativecommons.org/publicdomain/zero/1.0/)发布到公有领域。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一个机器人识别不同种类的水果。你给它看了成千上万张图片,但有人粗心地在许多图片上贴错了标签。你把一张苹果的照片标成了“香蕉”,把一张香蕉的照片标成了“苹果”。如果你用这些混乱的指令来教机器人,它就会学到错误的东西,并在尝试识别现实世界中的水果时失败。

这篇论文介绍了一个名为 Relabeler 的智能系统,它就像一个超级组织有序、观察力极其敏锐的图书管理员。它的工作是找出那些错误的标签,弄清楚正确的标签应该是什么,并在机器人开始学习之前将其修复。

以下是 Relabeler 的工作原理,分为简单的步骤:

1. 问题所在:“嘈杂”的图书馆

在现实世界中,数据并不完美。无论是照片、文本还是计算机代码,标签(我们给事物起的名称)往往包含错误。这些错误被称为“噪声”。如果你试图从一个嘈杂的图书馆中学习,你最终会得到一个困惑的学生。

2. 第一步:寻找可疑的书籍(检测)

Relabeler 不仅仅是靠猜;它使用两种不同的方式来发现错误的标签:

  • “局部邻域”检查: 想象一下你正在观察一群站在一起的人。如果 10 个人中有 9 个穿着红衣服,而有一个人穿着一件鲜绿色的衣服,却正好站在红衣人群的正中间,那个人看起来就很可疑。Relabeler 通过观察数据中相似的项目(邻居)来执行此操作。如果一个项目看起来与其邻居完全一致,但标签却不同,它就会将其标记为“可疑”。
  • “大局观”检查: 有时候,一个穿绿衣服的人可能确实属于红衣组(也许他只是在穿戏服)。为了避免误报,Relabeler 会退后一步,观察整个图书馆。它在已经验证过的“干净”书籍上训练一个智能模型。然后,它会询问这个模型:“这个可疑项目符合大局吗?”如果模型说:“是的,它实际上属于这里,”那么该项目就会被保留。如果模型说:“不,它显然格格不入,”那么它就会留在“可疑”名单上。

3. 第二步:修复错误的标签(修正)

一旦 Relabeler 有了一份可疑项目的清单,它并不仅仅是把它们扔掉。相反,它试图修复这些标签。这是这篇论文最独特的部分。

这就像是一个侦探在破解谜题。侦探有两个线索:

  1. 视觉线索: 这个物体实际看起来是什么样的?(例如:“这看起来像个苹果。”)
  2. 错误模式: 人们通常是如何犯错的?(例如:“在这个图书馆里,人们经常把苹果和梨搞混,因为它们看起来很像。”)

Relabeler 使用一种称为**贝叶斯推断(Bayesian Inference)*的数学方法将这两个线索结合起来。它会问道:“鉴于这看起来像个苹果,并且考虑到人们在这个数据集中经常把苹果误认为梨,那么最可能的正确标签是什么?”*

它计算概率并选出最佳答案。它不只是在瞎猜;它是基于数据最初是如何出错的,进行了一次有理有据的修复。

4. 结果:一个更干净的图书馆

作者在五种不同类型的“图书馆”(数据集)上测试了 Relabeler,包括汽车、新闻文章和计算机代码的图像。他们将其与其他顶尖方法进行了对比。

  • 更高的准确度: Relabeler 在修复标签方面表现得更好。在某些情况下,与现有最好的方法相比,它将修复的准确度提高了 58%
  • 更少的遗留错误: 在 Relabeler 完成工作后,剩余的数据集中的错误更少了(在最终任务中的性能提升了高达 6%)。
  • 适用于所有类型的噪声: 无论是随机错误(比如抛硬币产生的错误)还是系统性错误(比如混淆外观相似的事物),Relabeler 处理它们的效果都比竞争对手更好。

核心结论

这篇论文认为,与其仅仅教机器人去忽略坏数据(这就像告诉学生去忽略错误答案),我们应该去修复数据本身。Relabeler 是一个工具,它能找到错误的答案,弄清楚正确的答案应该是多少,并创建一个干净、高质量的数据集。这使得任何基于该新数据训练的机器学习模型都能表现得更加出色且更加可靠。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →