← 最新论文
🤖 machine learning

Distributions In, Distributions Out: The Case for Soft-Label Training

本文证明了使用标注者标签的全分布(软标签)而非坍缩后的多数投票(硬标签)来训练监督分类器,能够提高准确率、减少与人类标注的偏差,并在视觉和自然语言处理任务中使模型不确定性与真实的人类分歧更好地保持一致。

原作者: Agamdeep Singh, Ashish Tiwari, Hosein Hasanbeig, Priyanshu Gupta

发布于 2026-07-31
📖 1 分钟阅读☕ 轻松阅读

原作者: Agamdeep Singh, Ashish Tiwari, Hosein Hasanbeig, Priyanshu Gupta

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

知其不知的艺术

想象一下,你正在尝试教一个机器人如何观察世界。你给它看一张模糊形状的照片,并问道:“那是猫还是狗?”如果你问十个不同的人,你可能会得到六票“猫”和四票“狗”。在人工智能领域,这是一个经典问题:我们如何教会机器理解世界并不总是非黑即白的?

长期以来,训练这些机器的标准方法是强迫出一个单一答案。我们统计那十个人的投票,然后告诉机器人:“答案是猫。”我们丢弃了那四票“狗”,假装这张照片从未有过歧义。对于像识别红色停止标志这样明确的事物,这种方法效果很好。但当人类自身都无法达成一致时,这种方法就失效了。如果一个人看着一张棘手的图像感到不确定,但机器人被强迫说“1拟定的100%是猫”,那么机器人就在对其自身的置信度撒谎。这就像一位天气预报员明明知道有50%的降水概率,却为了符合简单的预报格式而坚持说:“一定会下雨。”

这篇论文深入探讨了机器学习中一个特定的领域,叫做监督分类(supervised classification)。简单来说,这是指我们通过展示带有标签的示例,来教计算机将事物分类(例如“礼貌”与“无礼”的文本,或“猫”与“狗”的照片)。作者提出的核心问题是:当人类对标签产生分歧时,我们应该强迫计算机选出一个唯一的赢家,还是应该让它从整个群体的分歧中学习? 作者认为,强迫出一个单一答案会丢弃关于世界真实运作方式的宝贵信息。

支持软标签:让群众发声

本文的作者,来自微软的 Agamdeep Singh 及其同事,决定测试一种不同的方法。他们没有将一群人的意见压缩成一个“硬”标签(比如单一的“猫”),而是尝试使用全分布(full distribution)来训练 AI。他们称之为软标签训练(soft-label training)

可以这样理解:

  • 硬标签训练(Hard-Label Training) 就像一位老师在处理一个棘手问题时,看到全班投票结果是60%的学生认为答案是“A”,40%认为答案是“B”,然后老师在黑板上写下“答案是A”。老师告诉学生:“答案是A。记住它。”于是学生学会了对“A”百分之百确定,尽管全班意见并不统一。
  • 软标签训练(Soft-Label Training) 则像是老师在黑板上写道:“我们中有60%的人认为它是A,40%的人认为它是B。”老师告诉学生:“答案是一个混合体。请保持60%的把握认为它是A,以及40%的把握认为它是B。”学生学会了反映出教室里真实的困惑感。

论文在三个不同的数据集上测试了这个想法:一个用于理解文本逻辑(ChaosNLI),一个用于判断文本的礼貌程度(POPQUORN),以及一个用于识别照片中的物体(CIFAR-10H)。在所有这些案例中,数据都是混乱的,人类在正确答案上存在着真正的分歧。

他们的发现:不确定性是特性,而非缺陷

研究结果非常清晰。当研究人员将“硬”模型(用单一答案进行训练的模型)与“软”模型(用全群体的分布进行训练的模型)进行对比时,软模型在几乎所有关乎理解人类不确定性的维度上都胜出了。

1. 它们能更好地匹配人类的困惑。
最重要的衡量标准是计算机的猜测与实际人类投票分布之间的接近程度。作者使用了一个名为 KL 散度(KL divergence) 的数学工具来衡量这一点。数值越低,意味着计算机越接近人类的现实情况。软标签模型在所有数据集上的平均误差降低了 32%。用通俗的话说:软模型在表达“我不完全确定,且以下是我有多不确定”方面做得出色得多,精准匹配了人类对数据的真实感受。

2. 它们不会损失准确性。
一个常见的担忧是,如果你教计算机变得不确定,它可能会变差,无法得到“正确”的答案。论文表明事实并非如此。在礼貌性数据集(POPQUORN)和图像数据集(CIFAR-10H)上,软标签模型的准确率与硬标签模型一样高。在逻辑数据集(ChaosNLI)上,软标签模型甚至更准确(55.30% 对比 51.75%)。因此,诚实面对不确定性并没有让它们变笨,反而让它们变得更聪明。

3. 它们知道“何时”该不确定。
这也许是最酷的发现。研究人员观察了计算机的“不确定性”(通过熵来衡量)如何随样本的变化而变化。他们发现,对于软标签模型,计算机的不确定性追踪人类不确定性的强度比硬标签模型强了 61%

  • 如果人类对某张照片感到困惑,软标签模型也会感到困惑。
  • 如果人类百分之百确定,软标签模型也会百分之百确定。
  • 然而,硬标签模型往往即使在人类意见分歧时,也会表现得过度自信地正确或过度自信地错误。它们无法“感知”到歧义。

为什么这很重要

论文指出,旧有的做法——将所有人类分歧压缩成单一的“多数票”——是一个错误。这种做法将人类的分歧视为需要修复的“噪声”或错误。作者认为,当专家产生分歧时,这种分歧往往就是真相本身。它反映了世界上有些事物(比如一个笑话是否礼貌,或者一个模糊的动物是否是猫)确实具有歧义。

通过在全分布上进行训练,我们构建的 AI 系统更加诚实。它们不会假装知道自己不知道的事情。作者指出,即使在没有大量人类投票的情况下(仅有 6 或 7 票),这种方法依然有效,而在拥有更多投票(如 100 票)时效果会更好。

最后,论文建议,对于任何涉及人类判断的任务——如安全性、礼貌性或偏好——我们都不应强迫 AI 选出一个单一的赢家。相反,我们应该让它们从整个群体中学习。正如作者所言,为了实现值得信赖的 AI,我们需要能够“知其不知”的系统。软标签训练正是教导它们做到这一点的途径。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →