← 最新论文
🤖 machine learning

XMix: Combating Extremely Noisy Labels via Local Smoothness in Self-Supervised Feature Space

XMix 是一个利用自监督特征空间中的局部平滑性来估计噪声率、选择平衡洁净样本并生成可靠伪标签的新颖框架,从而在无需预先获知噪声知识的情况下,显著优于现有方法处理极高噪声标签的能力。

原作者: Chengqi Li, Yangdi Lu, Zhihao Shi, Wenbo He, Chamseddine Talhi, Nadjia Kara

发布于 2026-07-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Chengqi Li, Yangdi Lu, Zhihao Shi, Wenbo He, Chamseddine Talhi, Nadjia Kara

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一个机器人识别动物。你给它看了成千上万张图片,但这里有个陷阱:这些图片的标签是由一个疲惫、分心甚至调皮的人写的。有时一张猫的照片被标记为“狗”,有时一张汽车的照片被标记为“飞机”。这就是“带噪声标签学习(Learning with Noisy Labels)”的混乱现实。在人工智能的世界里,模型通常需要完美的数据来学习,但在现实世界中,完美的数据既稀缺又昂贵。科学家们一直试图构建能够忽略错误标签并从正确标签中学习的机器人,但当噪声变得非常高时——比如当 90% 的标签都是错误的时候——大多数机器人要么会放弃,要么会陷入混乱。

你即将阅读的这篇论文正是在解决这个问题的。它介绍了一种名为 XMix 的新方法。把它想象成一个侦探,它不仅仅信任文件上写的标签,而是通过观察图片本身,来看看哪些图片在视觉上“看起来”属于同一类。如果一张猫的照片在机器人的记忆中与许多其他猫的照片非常相似,那么侦探就会假设它们都是猫,即使标签上写的是别的。这种方法使用了一个叫做“局部平滑性(local smoothness)”的概念,这是一种高级说法,意思就是:“看起来相似的东西通常属于同一个组。”通过这种逻辑,XMix 试图清理混乱,并比以往的方法更好地教导机器人,尤其是在数据处于完全崩溃的状态时。

问题所在:一个充满恶作剧者的教室

想象一个教室,老师正试图教学生识别不同种类的水果。老师手里拿着一叠闪卡,但一群恶作剧者把标签换掉了。一些苹果被标记成了“香蕉”,一些橙子被标记成了“葡萄”。

在过去,聪明的计算机程序(称为深度学习模型)有一个锦囊妙计,叫做“记忆效应(memorization effect)”。它们会研究这些卡片,并意识到:“嘿,我非常擅长猜这张特定卡片的标签,但我对那张卡片却表现得很差。”它们假设那些猜得好的就是真实的(干净数据),而那些让它们感到挣扎的则是恶作剧者的谎言(噪声数据)。

但问题在于:当恶作剧者开始疯狂捣乱,交换了 90% 的标签时,计算机就会感到困惑。它再也无法分辨出一个真正的苹果和一个被标为苹果的香蕉了。此外,计算机经常会只专注于研究一种水果,而忽略了其他种类,这使得它在识别多样性方面表现很差。它需要一种新的策略,而不是依赖于知道房间里有多少个恶作剧者。

解决方案:XMix 与“看脸识人”规则

于是,XMix 这个新侦探登场了。XMix 不仅仅看书面标签,它还使用一副特殊的眼镜(自监督特征编码器)来观察水果的视觉细节。它知道一个红色的、圆圆的、带有茎的水果看起来非常像其他红色的、圆圆的、带有茎的水果。

以下是 XMix 如何解决这三个大问题的:

1. 在没有“作弊表”的情况下猜测噪声水平
通常,这些计算机程序需要知道确切有多少标签是错误的(例如,“50% 是错的”)才能设定规则。如果它们猜错了,就会失败。XMix 不需要这个“作弊表”。它观察一个水果及其在图像世界中最近的“长相相似”的邻居。如果邻居们的标签各不相同,XMix 就会计算道:“哇,这里的噪声一定很高。”它使用一种叫做“极大似然(maximum likelihood)”的数学技巧来自动估算噪声水平。这就像一个侦探观察犯罪现场并说:“根据破碎窗户的数量,我猜这可能是一场暴乱,”而不需要查看警察报告。

2. 寻找更多的“好学生”(平衡且扩展的选择)
当噪声达到极端水平时,旧的方法只能找到少量的“干净”样本(好学生)来进行学习。XMix 则说:“等等,如果我们发现了一个好苹果,而且它看起来和附近的这五个苹果完全一样,那我们也信任这五个吧!”它通过纳入附近的邻居来扩大受信任样本的范围。
至关重要的是,它还解决了“类别不平衡(class imbalance)”问题。如果恶作剧者藏起了所有的“香蕉”标签,计算机可能会停止研究香ло。XMix 注意到了这一点并说:“我们需要更多香蕉!”它会向更远的地方寻找香蕉的“长相相似者”,以确保每种水果都有公平的学习机会。这确保了机器人能学到均衡的知识,而不是只盯着一种最喜欢的食物。

3. 对未知情况进行更好的预测
最后,对于那些它仍不确定的卡片(即噪声数据),XMix 不会只是随机猜测。它会询问邻居:“你觉得这是什么?”它会收集最受信任的邻居(即干净样本)的意见,并取其平均值,从而创建一个“伪标签(pseudo-label)”(即最佳猜测标签)。这就像是请一组专家对神秘物体进行投票。因为这些专家的选择是基于他们与该物体的相似程度,所以他们的投票比随机猜测要可靠得多。

研究结果:战胜概率

研究人员在著名的图像数据集(如 CIFAR-10 和 CIFAR-100,包含汽车、飞机、动物等图片)上测试了 XMix。他们故意搞乱了标签,以创造极端场景:

  • 90% 对称噪声: 想象 100 个标签中有 90 个是完全随机的。
  • 98% 噪声: 几乎所有东西都是谎言。

在这些残酷的条件下,以往的方法(如 DivideMix 和 ProMix)开始崩溃。例如,在 90% 噪声的 CIFAR-10 数据集上,旧的最佳方法(DivideMix)仅达到了约 76% 的准确率。然而,XMix 将其提升到了 91.2%。在 95% 噪声的 CIFAR-100 上,旧方法仅得到 19.1%,而 XMix 达到了 31.4%

论文表明,XMix 不仅仅是做得好一点,它是在形势最严峻时表现卓越。它成功识别出了比旧方法多得多的“真实干净”样本,有时甚至能让机器人可以学习的优质样本数量增加两到三倍。

结论

XMix 证明了你不需要知道数据的确切混乱程度也能将其清理干净。通过信任图像之间的视觉相似性——利用特征空间的“局部平滑性”——它可以自动调整策略,找到更多好数据,并教导机器人忽略噪声。

作者认为,这种方法是一个重要的进步,特别是在现实世界的场景中,数据是混乱的,而且我们并没有一份手动说明来告诉我们情况有多糟。虽然它并不是一个能完美解决一切问题的“魔杖”(在噪声较低且不需要扩展的情况下,它仍然会犯一些小错误),但它在最具挑战性的高噪声环境下始终优于现有的最先进方法。它将一个混乱的恶作剧教室变成了一个依然可以进行学习的地方。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →