← 最新论文
🤖 machine learning

Stop Replacing Noise with Noise: Two-Source Reliability Assessment for Label Correction and Sample Reweighting in Label-Noise Learning

该论文介绍了 TRACE,这是一个通过使用不同的可靠性指标来解耦观测标签与伪目标评估的框架,旨在防止噪声标签学习中常见的陷阱,即纠正一个不可靠信号会无意中放大另一个信号。

原作者: Wenxiao Fan, Kan Li

发布于 2026-08-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Wenxiao Fan, Kan Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人识别动物,方法是给它看成千上万张照片。但这里有个陷阱:一个淘气的格林姆林(gremlin)在一些标签上乱涂乱画,写错了名字。一张猫的照片可能被标记为“狗”,而一张狗的照片可能被标记为“猫”。这就是“噪声标签学习”(noisy-label learning)的世界,它是计算机科学中一个棘手的领域,机器在这里试图从错误的老师那里学习真理。

为了解决这个问题,科学家们开发了一种聪明的策略,叫做“翻新”(refurbishment)。把它想象成一个正在考试的学生:如果学生对某个答案不确定,他们不会盲目猜测;而是会查看自己的笔记(模型当前的知识)来看看它认为答案应该是多少。旧的方法是对老师的标签和学生的猜测使用同一个“信任计”。如果这个计数器显示“不要相信老师”,系统就会自动说:“太好了,改相信学生的猜测吧!”它假设如果一个来源不可靠,另一个就一定是可靠的。但如果学生的笔记也是错的怎么办?如果机器人最初从老师那里学到了错误的答案,而现在它正自信满满地重复同样的错误呢?这正是这篇论文所探讨的危险所在。

这项研究背后的研究人员——来自北京理工大学的范文晓(Wenxiao Fan)和李侃(Kan Li)发现,这种“全或无”的信任切换是危险的。他们将这个问题称为“用噪声替换噪声”。想象一位侦探,在意识到一名证人在撒谎后,立即转向信任另一名站在撒谎者旁边、听到了同样谎言的证人。第二位证人并不一定在说实话;他们可能只是在重复第一个人的话。

论文指出,在深度学习中,当模型被噪声标签搞糊涂时,它的“深层”部分(负责复杂推理的部分)会变得混乱并开始相信错误的事情。然而,“浅层”部分(负责观察基本形状和边缘的部分)则保持相对冷静和稳定。旧方法盲目地信任被搅乱的深层网络来修正标签,这往往只会让错误变得更严重。

为了解决这个问题,作者提出了一个名为 TRACE 的新框架。TRACE 不再对所有事物使用单一的信任计,而是使用两个独立的检查机制:

  1. 检查老师: 它通过三个线索来观察原始标签:模型的拟合程度、基本形状的稳定性(浅层部分),以及两个不同的“学生”模型是否对答案达成一致。
  2. 检查学生的猜测: 它通过一个完全不同的线索来观察模型自身的猜测:模型对该特定猜测的信心程度。

TRACE 的魔力在于,它并不假设如果老师错了,学生就是对的。它会问:“老师错了吗?”以及“学生真的对吗?”如果老师错了,但学生也在胡乱猜测,TRACE 会说:“等等,现在我们谁都不能信任。”只有当学生确实充满信心且可靠时,TRACE 才会利用学生的猜测来修正标签。

团队在多种杂乱的数据集上测试了这个想法,包括合成噪声(即我们故意弄乱标签)以及来自互联网的照片等现实世界中的杂乱数据。他们发现 TRACE 始终优于以往的方法。例如,在一个标签错误率为 50% 的 CIFAR-100 数据集上,TRACE 将现有最佳方法的准确率提高了约 1.16 个百分点。更重要的是,它减少了模型出现“高置信度错误”的情况——即那些机器人非常确定自己是对的,但实际上却错了的时刻。

简而言之,这篇论文表明,在从杂乱数据中学习时,我们不应该只是用另一个不可靠的来源去替换另一个。我们需要独立地检查每一个来源。通过将我们对原始标签的信任与对模型自身修正的信任分开,TRACE 帮助机器人学习真理而不被自己的错误所误导。这提醒我们,在人工智能的世界里,有时修正谎言最好的方法,是不要假设下一个猜测自动就是真相。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →