想象一下,你正在尝试教一个机器人仅通过观察照片来猜测一个人的年龄。你向它展示了成千上万张图片,但存在一个问题:那些给照片标注的人(告诉机器人“这是 20 岁”、“这是 30 岁”)犯了错误。也许他们觉得一个 25 岁的人看起来像 30 岁,或者他们只是输错了数字。这被称为噪声数据。
通常,当计算机从杂乱的数据中学习时,它们会感到困惑并表现不佳。大多数现有的解决方案试图通过丢弃它们认为标注错误的照片来解决这个问题。这就像一位老师告诉学生:“我不信任这份作业,所以我要把它扔进垃圾桶,只批改我确信的那些。”问题在于,你可能会扔掉一张实际上标注正确的照片,或者一张虽然略有偏差但仍包含宝贵信息的照片。
本文介绍了一种名为ORDAC(序数自适应校正)的新方法。ORDAC 不像丢弃数据那样,而是像一个智能编辑,在保留每一张照片的同时温和地修正错误。
以下是其工作原理,使用简单的类比:
1. “模糊标签”概念
在正常的计算机学习中,标签是一个硬性数字(例如,“年龄 = 30")。
ORDAC 将标签视为一个模糊的云团。它不是说“它绝对是 30 岁”,而是说“它可能在 30 岁左右,但我们不是 100% 确定”。
- 云团中心:这是当前的年龄猜测。
- 云团大小:这代表了计算机的“不确定”程度。云团越大,表示计算机越困惑;云团越小,表示它越有信心。
2. “学习小组”策略
为了在不被自身错误混淆的情况下修正标签,ORDAC 使用了一种K 折策略。想象你有一个学生班级(数据),并将其分成 5 组。
- 你有 5 位不同的“老师”(模型)。
- 老师 #1 研究第 2、3、4 和 5 组,但不研究第 1 组。
- 然后,老师 #1 查看第 1 组并说:“基于我从其他人那里学到的东西,我认为第 1 组的标签是错误的。让我们调整它们。”
- 接着,老师 #2 做同样的事情,但他们研究第 1 组并修正第 2 组。
这确保了没有任何一位老师会修正他们刚刚教过的学生,从而防止他们仅仅强化自身的错误。
3. “温和修正”过程
当一位老师查看学生的标签时,他们不会只是打个响指就改变它。他们使用两步调整:
- 步骤 A:修正偏差。有时,老师们会偷懒,因为更安全而给每个人都猜“平均”年龄。ORDAC 有一条特殊规则来阻止这种情况,确保他们不会只是给每个人都猜中间的数字。
- 步骤 B:移动云团。如果老师认为标签是错误的,他们会温和地将“云团中心”推向正确的年龄。
- 如果老师非常有信心,他们会大幅移动中心。
- 如果老师不确定,他们只会轻微移动它。
- 他们还会缩小或扩大“云团大小”(不确定性)。如果老师确信标签是错误的,他们会缩小云团(更确定)。如果他们仍然困惑,他们会保持云团较大。
4. 结果:清理混乱
研究人员在两个现实世界的问题上测试了这种方法:
- 猜测年龄:使用来自互联网的照片(Adience 数据集),人们经常错误地猜测自己的年龄。
- 评估眼疾:使用视网膜图像(糖尿病视网膜病变数据集),医生可能对疾病的严重程度意见不一。
他们故意在数据中添加了大量人为错误(噪声)来测试该系统。
- 旧方法(丢弃数据):当 40% 的标签错误时,旧方法难以应对。
- ORDAC 方法:即使 40% 的标签混乱不堪,ORDAC 也成功“编辑”了标签。它不仅仅是猜测;它实际上修正了数据。
- 在年龄数据集上,它显著降低了平均误差。
- 它甚至发现并修正了在开始测试之前就已经存在于原始“干净”数据集中的错误!
结论
该论文声称,与其丢弃看起来可疑的数据,不如自适应地修正它。通过将标签视为灵活的不确定云团,而不是僵硬的数字,并通过让模型以循环方式相互“教学”,ORDAC 创建了一个更干净、更可靠的数据集。这使得计算机即使在原始信息混乱且充满人为错误的情况下也能更好地学习。
简而言之:不要因噎废食;只需洗净婴儿,保留洗澡水。
技术摘要:序数自适应校正(ORDAC)
问题陈述
本文解决了序数图像分类中标签噪声的关键挑战。在年龄估计和疾病严重程度分级等任务中,类别边界往往模糊不清,使得标注过程容易出错。与错误是离散的标称分类不同,序数错误具有语义距离(例如,将 20 岁误判为 25 岁比误判为 60 岁后果较轻)。
现有的处理噪声标签的方法通常分为两类:
- 以模型为中心:设计抗噪声的损失函数或正则化方法。
- 以数据为中心(样本选择):识别并丢弃潜在的噪声样本(例如 CASSOR、ICDF)。
作者认为,样本选择对于序数数据而言并非最优,因为它丢弃了包含在错误标注实例中的潜在有价值的特征信息。此外,标准的序数回归方法缺乏处理错误排名标注的显式机制,导致性能下降和可靠性降低。目前尚缺乏能够校正而非丢弃噪声标签的方法,这些方法应通过自适应建模序数数据的固有不确定性来填补这一空白。
方法论:序数自适应校正(ORDAC)
提出的解决方案是ORDAC,这是一个利用标签分布学习(LDL)的以数据为中心的框架。ORDAC 不再将标签视为单个离散值,而是将每个标签表示为具有均值(μ)和标准差(σ)的高斯分布。均值代表标签值,而标准差量化模型的不确定性。
核心工作流程
该框架采用K 折交叉训练策略进行迭代运行,以防止模型受到其自身自信但可能错误的预测的偏差影响:
初始化:
- 将数据集划分为 K 折。
- 初始化 K 个相同的固定形式标签分布学习(FLDL)模型。
- 每个样本的标签初始化为高斯分布 N(μi,σi2),其中 μi 是噪声标签,σi 是代表均匀初始不确定性的固定常数。
预热阶段:
- 所有 K 个模型在其各自的训练集上并行训练指定的轮数(Ecorr),以便在噪声数据上学习初始特征表示。
迭代校正阶段:
- 预热结束后,自适应校正机制启动。
- 对于每一折,在剩余 K−1 折上训练的模型预测留出验证折的标签。
- 这些预测用于更新验证样本的标签分布(μ 和 σ)。
- 更新后的分布随后被传播回其他模型的训练集,用于下一个轮次。
自适应校正机制
更新过程包含应用于验证折中每个样本的两个阶段:
类别级预测去偏:
- 序数模型由于损失函数和数据不平衡,往往会对中间排名类别产生偏差。
- 为了抵消这种偏差,模型的预测被调整,使类别级预测围绕真实类别标签重新居中。
- 调整后的预测 y^ishifted 计算如下:y^ishifted=y^i−(meanμi−μi)。
样本级分布更新:
- 基于模型置信度(γi)和类别频率(πμi)计算校正系数 λicorr,以确保稀有类别的校正更加谨慎。
- 标准差更新(σ):如果预测误差 ∣ei∣ 大于当前不确定性 σi,则增加不确定性(表明可能是噪声标签)。如果误差较小,则降低不确定性。
- σinew=σi+αi×(∣ei∣−σi)
- 均值更新(μ):均值向去偏后的预测方向移动。
- μinew=μi+βi×ei
- 其中,αi 和 βi 是源自基础率 αbase 和 βbase 的样本特定学习率。
变体
作者引入了两个变体以分析框架的行为:
- ORDACC(校正):在训练后生成静态的清洗数据集。在新数据集上从头开始训练一个新模型,不再进行进一步的在线校正。
- ORDACR(移除):基于 ORDACC,但在校正后移除那些仍然高度不确定(其中 σinew≥σiinitial)的样本,将其视为异常值。
实验结果
该方法在两个基准数据集上进行了评估:Adience(年龄估计)和糖尿病视网膜病变(DR)(疾病严重程度)。实验涉及以 τ∈{0.2,0.4} 的比率注入非对称高斯噪声。
主要发现
- 噪声下的性能:在所有噪声水平下,ORDAC 及其变体均显著优于标准基线(CORAL、DLDL-v2)和最先进的样本选择方法(CASSOR)。
- 示例:在 40% 噪声的 Adience 数据集上,ORDACR 将平均绝对误差(MAE)从 0.86(DLDL-v2)降低至0.62,并将召回率从 0.37 提高至0.49。
- 固有噪声校正:即使在未注入噪声(τ=0)的情况下,ORDAC 的表现也优于基线。这表明原始数据集中包含固有的标签噪声(例如 Adience 中的自报错误),该方法成功识别并校正了这些噪声。
- 校正与选择:虽然样本选择(CASSOR)表现良好,但 ORDACR 通常取得了更好的结果,特别是在较高噪声水平下,这表明校正标签比丢弃标签更具数据效率。
- 消融研究:
- 移除类别级去偏步骤会导致校正过程向多数中间类别崩溃,显著降低性能。
- 超参数分析显示,**较小的 αbase(0.2)和较大的 βbase(0.8)**产生了最佳结果,表明模型在更新不确定性时应保持保守,而在校正均值时应更加积极。
意义与贡献
本文声称具有以下贡献:
- 范式转变:提出了从样本选择(丢弃数据)到序数任务自适应标签校正的转变,保留了有价值的特征信息。
- 不确定性建模:引入了一种机制,动态更新标签分布的均值和标准差,使模型能够在训练过程中显式地表示和管理不确定性。
- 鲁棒性:广泛的实验证明,利用标签分布进行自适应校正是一种有效的策略,可增强序数分类模型在存在噪声数据时的鲁棒性和准确性。
作者总结道,通过自适应校正在根本层面上提高数据质量,ORDAC 为更准确、更可靠的序数分类铺平了道路,特别是在清洁数据稀缺且标签模糊度高的领域。未来的工作建议探索非参数分布和校正率的自动调整。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。