← 最新论文
🤖 machine learning

Stochastic Order Learning: An Approach to Rank Estimation Using Noisy Data

本文提出了随机序学习(Stochastic Order Learning, SOL),该框架将噪声序数标签下的秩估计重新表述为一个随机序问题,通过判别性与随机序损失来有效捕捉标签不确定性并实现可靠的性能。

原作者: Chaewon Lee, Seon-Ho Lee, Chang-Su Kim

发布于 2026-07-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Chaewon Lee, Seon-Ho Lee, Chang-Su Kim

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试猜测照片比赛中人们的年龄。通常情况下,你只会选择一个确定的数字:“这个人是24岁。”但如果评委们的看法有些模糊呢?也许一个人认为他们是22岁,另一个人认为26岁,而第三个人则坚信是30岁。在现实世界中,像年龄、美貌评分或医疗严重程度这样的标签并不总是完美的客观事实;它们往往是一团混乱的可能性云团。

这就是这篇论文所解决的问题:带有噪声数据的秩估计(Rank Estimation with Noisy Data)

旧方法:“非黑即白”的错误

大多数计算机程序将错误视为一场“狗 vs 猫”的游戏。如果计算机把狗看成了熊,它就错了。如果它把狗看成了猫,它也错了。计算机认为这两种错误是一样严重的。

但在秩估计(如猜测年龄)中,并非所有的错误都是等同的。

  • 旧方法: 把24岁猜成26岁是一个小失误。把24岁猜成59岁则是一个巨大的灾难。
  • 现实情况: 标准的计算机程序并不理解这一点。它们将“24岁 vs 59岁”的误差与“24岁 vs 26岁”的误差视为同等对待。当数据存在噪声(即混乱)时,这些旧程序会变得困惑并做出荒唐、糟糕的猜测。

作者认为,我们不应该再假装每个标签都是一个单一、坚实的客观事实。相反,我们应该承认一个标签更像是一个模糊的云团。一个24岁的人可能确实是24岁,但也有相当大的可能性,其噪声标签实际上是23岁或25岁。

新思路:随机序学习 (Stochastic Order Learning, SOL)

作者提出了一种名为随机序学习 (SOL) 的新方法。把它想象成教计算机如何在一片雾气缭绕的山脉中航行,而不是在一张平坦清晰的地图上行走。

1. “模糊云团”法
与其强迫计算机说“这个人恰好是24岁”,SOL 说道:“这个人很可能是24岁,但也可能是23岁或25岁。”它将照片与年龄之间的联系视为概率性的(基于概率),而非确定性的(固定的)。

2. “两步舞步”
为了学习这一点,SOL 使用了两个特殊的动作,就像舞伴引导计算机一样:

  • “磁铁”动作(判别损失/Discriminative Loss): 它将照片的数字表示拉向它所属的“平均年龄”(质心),但同时也会轻轻地将其推离那些过远的年龄。这就像一块磁铁,既能吸引你回到自己的社区,又会排斥你前往隔壁城镇。
  • “顺序”动作(随机序损失/Stochastic Order Loss): 它确保计算机理解序列。它确保即使标签有些混乱,如果照片 A 比照片 B 年轻,计算机也能保持这种顺序。这就像在书架上排列书籍:即使书脊上的标签模糊不清,计算机仍知道1990年代的书应该放在2000年代的书的左边。

3. “识破冒充者”的小技巧
有时,标签纯粹是错误的(比如把一个20岁的人标为60岁)。SOL 有一个特殊的步骤来寻找这些“离群值”。它观察数据,发现那些奇怪的样本,并在重新训练前轻轻地修正它们的标签。这就像老师注意到学生在考试中写了“2+2=5”,意识到这是一个笔误,并在给全班评分前将其修正。

这篇论文实际发现了什么

作者在四个完全不同的领域测试了该方法:

  1. 面部: 猜测人类年龄(MORPH II 和 CLAP2015 数据集)。
  2. 艺术: 评价一张照片的“美感”程度(AADB 数据集)。
  3. 医学: 从 X 光片中估算骨龄(RSNA 数据集)。
  4. 文本: 评价机器翻译的质量(WMT2020 数据集)。

结果:
在这些实验中,SOL 始终优于其他方法。

  • MORPH II 面部数据集中,在存在中度噪声的情况下,SOL 的平均绝对误差 (MAE) 为 2.489 年,而次优方法为 2.516
  • AADB 美感数据集中,SOL 实现了一个得分,其中 92.70% 的预测值与真实得分的差距在 0.25 以内,明显领先于第二名的水平。
  • 即使在噪声很大(通过添加随机误差来模拟)的情况下,SOL 也能比其他方法更好地保持稳定性。例如,在 CLAP2015 数据集的高噪声环境下,SOL 的误差为 4.002,而排名第二的方法为 4.105

论文表明,通过承认数据的“模糊性”,计算机变得更加可靠。

SOL 不是什么(“不”清单)

了解这篇论文没有声称的内容非常重要:

  • 它不是魔术橡皮擦: 论文明确指出,该方法并不假设标签是完美的。它并不试图在不存在真实答案的地方强行寻找一个“唯一真解”;它拥抱了这种不确定性。
  • 它不仅仅针对人脸: 虽然他们在人脸上进行了测试,但该方法适用于美感评分、医学 X 光片和文本。它是一个通用的工具,而非仅针对面部的技巧。
  • 它不是解决所有问题的“终极方案”: 作者承认,如果噪声具有某种特定的规律(例如某一个标注者总是出错),目前的固定模型可能会遇到困难。他们建议,学习个体噪声模式是未来的工作方向。
  • 它并不完美: 在一些失败案例中(如论文图示所示),系统仍然会猜错,尤其是当照片很难辨认时(如模糊的面部或 X 光片中折叠的手部)。

我们有多确定?

作者根据其实验表现得审慎且自信。他们不仅仅是在猜测;他们通过不同数据集和不同类型噪声(高斯分布、拉普拉斯分布、均匀分布)进行了数千次测试。

  • 他们通过这些模拟证明了 SOL 在平均绝对误差 (MAE) 和累积得分 (CS) 方面优于现有方法。
  • 他们暗示这种方法之所以有效,是因为它模拟了序数数据的“结构不确定性”(即 24 距离 25 比距离 50 更近这一事实)。
  • 他们也提醒道,虽然该方法具有鲁棒性,但它仍然依赖于一些需要调优的设置(例如预期会有多少“噪声”),并且尚未实现完全自动化。

简而言之,论文表明,当你不再把混乱的数据视为破碎的拼图,而是将其视为一团模糊的云团时,你的计算机在进行排序估计时会变得出色得多。这是一种从不完美的老师那里学习更聪明的方式。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →