← 最新论文
🤖 machine learning

Ordinal Adaptive Correction: A Data-Centric Approach to Ordinal Image Classification with Noisy Labels

本文提出了一种名为 ORDinal Adaptive Correction(ORDAC)的新型以数据为中心的框架,该框架利用标签分布学习在训练过程中动态调整和校正噪声序数标签,从而在 Adience 和糖尿病视网膜病变等数据集的各种噪声条件下显著提升了模型的鲁棒性和准确性。

原作者: Alireza Sedighi Moghaddam, Mohammad Reza Mohammadi

发布于 2026-05-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Alireza Sedighi Moghaddam, Mohammad Reza Mohammadi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试教一个机器人仅通过观察照片来猜测一个人的年龄。你向它展示了成千上万张图片,但存在一个问题:那些给照片标注的人(告诉机器人“这是 20 岁”、“这是 30 岁”)犯了错误。也许他们觉得一个 25 岁的人看起来像 30 岁,或者他们只是输错了数字。这被称为噪声数据

通常,当计算机从杂乱的数据中学习时,它们会感到困惑并表现不佳。大多数现有的解决方案试图通过丢弃它们认为标注错误的照片来解决这个问题。这就像一位老师告诉学生:“我不信任这份作业,所以我要把它扔进垃圾桶,只批改我确信的那些。”问题在于,你可能会扔掉一张实际上标注正确的照片,或者一张虽然略有偏差但仍包含宝贵信息的照片。

本文介绍了一种名为ORDAC(序数自适应校正)的新方法。ORDAC 不像丢弃数据那样,而是像一个智能编辑,在保留每一张照片的同时温和地修正错误。

以下是其工作原理,使用简单的类比:

1. “模糊标签”概念

在正常的计算机学习中,标签是一个硬性数字(例如,“年龄 = 30")。
ORDAC 将标签视为一个模糊的云团。它不是说“它绝对是 30 岁”,而是说“它可能在 30 岁左右,但我们不是 100% 确定”。

  • 云团中心:这是当前的年龄猜测。
  • 云团大小:这代表了计算机的“不确定”程度。云团越大,表示计算机越困惑;云团越小,表示它越有信心。

2. “学习小组”策略

为了在不被自身错误混淆的情况下修正标签,ORDAC 使用了一种K 折策略。想象你有一个学生班级(数据),并将其分成 5 组。

  • 你有 5 位不同的“老师”(模型)。
  • 老师 #1 研究第 2、3、4 和 5 组,但研究第 1 组。
  • 然后,老师 #1 查看第 1 组并说:“基于我从其他人那里学到的东西,我认为第 1 组的标签是错误的。让我们调整它们。”
  • 接着,老师 #2 做同样的事情,但他们研究第 1 组并修正第 2 组。
    这确保了没有任何一位老师会修正他们刚刚教过的学生,从而防止他们仅仅强化自身的错误。

3. “温和修正”过程

当一位老师查看学生的标签时,他们不会只是打个响指就改变它。他们使用两步调整:

  • 步骤 A:修正偏差。有时,老师们会偷懒,因为更安全而给每个人都猜“平均”年龄。ORDAC 有一条特殊规则来阻止这种情况,确保他们不会只是给每个人都猜中间的数字。
  • 步骤 B:移动云团。如果老师认为标签是错误的,他们会温和地将“云团中心”推向正确的年龄。
    • 如果老师非常有信心,他们会大幅移动中心。
    • 如果老师不确定,他们只会轻微移动它。
    • 他们还会缩小或扩大“云团大小”(不确定性)。如果老师确信标签是错误的,他们会缩小云团(更确定)。如果他们仍然困惑,他们会保持云团较大。

4. 结果:清理混乱

研究人员在两个现实世界的问题上测试了这种方法:

  1. 猜测年龄:使用来自互联网的照片(Adience 数据集),人们经常错误地猜测自己的年龄。
  2. 评估眼疾:使用视网膜图像(糖尿病视网膜病变数据集),医生可能对疾病的严重程度意见不一。

他们故意在数据中添加了大量人为错误(噪声)来测试该系统。

  • 旧方法(丢弃数据):当 40% 的标签错误时,旧方法难以应对。
  • ORDAC 方法:即使 40% 的标签混乱不堪,ORDAC 也成功“编辑”了标签。它不仅仅是猜测;它实际上修正了数据。
    • 在年龄数据集上,它显著降低了平均误差。
    • 它甚至发现并修正了在开始测试之前就已经存在于原始“干净”数据集中的错误!

结论

该论文声称,与其丢弃看起来可疑的数据,不如自适应地修正它。通过将标签视为灵活的不确定云团,而不是僵硬的数字,并通过让模型以循环方式相互“教学”,ORDAC 创建了一个更干净、更可靠的数据集。这使得计算机即使在原始信息混乱且充满人为错误的情况下也能更好地学习。

简而言之:不要因噎废食;只需洗净婴儿,保留洗澡水。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →