← 最新论文
💻 computer science

Rethinking Learning with Noisy Labels: A CriticalReview of Structured Supervision, RepresentationDynamics, and Robust-Learning Pipelines

这篇批判性综述通过超越随机误差假设,转而分析结构化监督失配、表示动力学以及鲁棒流水线,重新定义了带有噪声标签的学习,并最终将噪声假设与风险修正及评估协议相联系,以应对现代基础模型和开放世界生态系统中的挑战。

原作者: Wenxiao Fan, Kan Li

发布于 2026-09-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Wenxiao Fan, Kan Li

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在人工智能的世界里,机器通过观察示例并被告知这些示例是什么来进行学习。如果一台计算机看到一张猫的照片并被告知“猫”,它就会学会识别猫。这个过程依赖于一个基本假设:告诉机器它正在看什么的标签是正确的。几十年来,研究人员一直构建着基于这些标签是完美的系统,就像一位从不出错的老师一样。但在现实世界中,这个假设正在失效。现代人工智能系统使用的训练数据来源于互联网、众包工人,甚至是其他人工智能模型。这些来源是混乱的。一张狗的照片可能因为这两种动物看起来很像而被错误地标记为狼;或者一张医学图像可能因为不同专家对诊断意见不一而被贴上错误的病症标签。当训练数据充满了这些错误时,机器可能会学到错误的教训,即记住错误而非真相。

这就是带有噪声标签的学习问题。长期以来,科学家们将这些错误视为简单的、随机的意外,就像抛硬币来决定一个标签是正确还是错误一样。他们假设,只要向计算机输入足够多的数据,随机错误就会相互抵消。然而,一种新的观点认为这种看法过于简单。现代数据中的错误并非是随机的,而是具有结构的。它们遵循某些模式,这些模式基于物体的相似程度、图像解释的难度,或是数据的收集方式。来自北京理工大学的研究人员温晓蔚(Wenxiao Fan)和李侃(Kan Li)的一项近期批判性综述指出,我们必须停止将噪声标签仅仅视为需要修复的简单错误,而应开始将其理解为数据所展示的内容与系统所接收到的信息之间复杂的失配。

研究人员旨在绘制这一新景观,超越单纯的错误修复方法列表。相反,他们研究了当标签不可靠时,学习过程本身是如何变化的。他们发现,计算机的学习过程并不是一个静态的事件,而是一个动态的旅程。在训练的早期阶段,机器倾向于先学习简单、清晰的模式。拟合一个常见且易于识别的物体,比拟合一个令人困惑的物体要容易得多。这创造了一个短暂的机会窗口,计算机可以通过这个窗口区分一个干净、正确的示例和一个噪声、错误的示例。研究人员表明,这个窗口并非保证,它在很大程度上取决于数据的结构。如果错误是细微的,例如混淆两种非常相似的鸟类,计算机学习错误模式的速度可能与学习正确模式的速度一样快,从而在它能够利用该窗口纠正数据之前就关闭了窗口。

他们工作的一个重要部分涉及测试一种许多人工智能系统都在使用的流行策略:信任那些计算机发现最容易学习的示例。其核心思想是,如果计算机在一个图像上犯了小错,那么标签很可能是正确的;但如果它感到吃力,那么标签很可能是错误的。研究人员证明,这种策略存在一个隐藏的弱点。当错误是结构化的——也就是说,错误的标签是以一种符合语义逻辑的方式附加在图像上的,例如因为两者都是车辆而将卡车与汽车混淆——计算机学习这些错误模式的速度可以与学习正确模式一样快。在这种情况下,“容易”的示例并不一定是正确的。计算机可能会自信地记住一个错误的标签,因为该图像非常符合错误的类别,这使得仅凭任务的难度就无法将真相与错误分离。

为了解决这个问题,作者提出将解决方案视为一个由五个相互关联的步骤组成的流水线,而非单一工具。首先,系统必须表征存在的噪声类型,理解错误是随机的、结构化的,还是来自预期类别之外。第二,它必须隔离出真正可靠的信号,不仅要看图像的难度,还要观察相似图像是如何聚集在一起的。第三,它必须优化目标,这意味着不仅要将错误的标签替换为正确的标签,还要调整计算机对所见内容的置信度和不确定性。第四,系统必须保持数据的几何结构,确保不同物体之间的关系即使在标签错误时也能保持完整。最后,系统必须控制自身的学习过程,明确何时应该停止以及何时应该继续,以避免记住错误。

该综述还强调,我们测试这些系统的方式往往存在缺陷。许多研究使用合成噪声,即研究人员以一种受控的方式人工翻转标签来测试其方法。作者认为,这并不能反映现实。现实世界的错误更为复杂,且往往更难与正确数据区分开来。他们检查了使用真实人类错误的基准测试,并发现那些在人工测试中表现完美的算法,在面对互联网或医疗记录中混乱的现实时往往会失败。例如,一种方法在处理动物数据集(其中的错误是随机的)时可能表现良好,但在处理服装数据集(其中的错误源于相似款式或颜色的混淆)时却可能完全失效。

研究人员总结道,该领域需要摆脱“噪声之下总有一个唯一的‘正确’标签”的观念。在许多现代场景中,例如数据来自不同的专家或由其他人工智能模型生成时,真相可能是模糊或不完整的。目标不仅仅是找到正确答案,而是理解所提供信息的可靠性。他们建议,未来的研究应专注于创建能够处理这种不确定性的系统,即使在标签不完美的情况下,也能保留数据的有用结构。这意味着要构建能够意识到自身不确定性的 AI,而不是强迫它带着虚假的信心进行猜测。

这项工作的意义延伸到了我们如何构建和信任未来的人工智能系统。随着这些系统被应用于医疗保健、自动驾驶和科学发现等关键领域,从错误数据中学习的代价已高到无法忽视。作者强调,我们不能仅仅依靠更多的数据或更大的模型来解决这个问题。相反,我们需要设计出能够感知自身局限性及其面临错误性质的学习过程。通过理解监督机制失效的具体方式——从标签生成的途径到计算机组织知识的方式——我们可以构建出不仅能应对随机错误,而且能应对定义现实世界的复杂结构化错误的稳健系统。前进的路径不是要求完美的数据(因为完美的数据并不存在),而是教会机器如何从现有的不完美数据中进行有效的学习。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →