← 最新论文
🤖 machine learning

Position: Every Ground Truth is a Human Construction, not an Objective Truth

本立场文件认为,机器学习中的地面真值数据集并非客观事实,而是人为构建的人造产物,并主张通过“情境可靠性”来承认其偶然性,从而提高模型的可靠性、透明度和问责制。

原作者: Charlotte Högberg, Ericka Johnson, Kiri L. Wagstaff

发布于 2026-07-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Charlotte Högberg, Ericka Johnson, Kiri L. Wagstaff

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个机器人识别“猫”。你给它看成千上上万张照片,并对每一张说:“是的,这是一只猫,”或者“不,这是一只狗。”在机器学习的世界里,你给出的这些标签被称为地面真值(Ground Truth)

长期以来,科学家们一直把这些标签视为一面魔镜:他们认为“地面真值”是一个等待被发现的、完美的、客观的现实反映,就像寻找一张隐藏的藏宝图。

但这篇文章认为,藏宝图并不是隐藏起来的;它是我们画出来的。

作者 Charlotte、Ericka 和 Kiri 表示,“地面真值”并不是从天而降的自然事实。它更像是一个配方,而不是一块石头。就像厨师决定加多少盐、何时搅拌以及使用哪些原料一样,人类和机器在创造训练 AI 的“真理”时,做出了大量的选择。

“配方”类比

把构建地面真值数据集想象成制作一杯复杂的果昔,用来测试一台新的搅拌机。

  • 水果: 你必须决定买哪些水果。你是只用红苹果,还是也包括绿苹果?
  • 切割者: 谁来切水果?是专业厨师?一个疲惫的实习生?还是一个机械臂?
  • 搅拌机: 你的刀片转速有多快?
  • 品尝测试: 谁来决定这杯果昔是否“好喝”?

论文指出,如果你改变其中任何一个步骤,你都会得到不同的果昔。如果你改变了“真理”(果昔配方),搅拌机(AI 模型)学到的东西也会完全不同。

为什么这很重要(“像素”问题)

作者给出了一个真实的例子来展示为什么这很重要。有一个著名的用于教计算机识别手写数字的数据集叫做 MNIST。早在 20 世纪 90 年代,计算机运行缓慢且内存较少,所以制作数据集的人决定将图像从 128x128 像素 缩小到 28x28 像素

正是因为几十年前做的这一个决定,今天的成千上万个 AI 模型仍然仅针对 28x28 像素 的图像进行训练。如果你尝试给它们展示一张今天拍摄的高清数字照片,它们就无法读取!由于受限于为了适应旧电脑而做的决策,它们被困在了过去。它们所学习的“真理”受到了当时可用工具的限制,而非数字本身。

“专家”的迷思

有时,我们认为专家就像神谕之神(Oracle Gods),总是知道绝对的真理。或者我们认为他们像是机器人传感器,只是在记录事实而没有情感。
论文说:并非如此。 即使是专家也会犯错,彼此之间会有分歧,并且看问题的角度也不同。

  • 在医学领域,两名医生可能会观察同一张 X 光片,一名说“健康”,而另一名说“患病”。
  • 在众包项目中(比如让互联网上的成千上上万人为照片打标签),一个人可能认为一张照片是“快乐”的,而另一个人可能认为它是“悲伤”的。

如果我们假定专家是完美的机器人,我们就忽略了这样一个事实:他们的“真理”实际上是受其培训、情绪和所给规则影响的人类观点。

“情境可靠性”的概念

作者建议我们不要再假装我们的 AI 是普遍完美的。相反,我们应该讨论**“情境可靠性”(Situated Reliability)**。

把它想象成一副太阳镜

  • 它们在明亮的沙漠阳光下(特定的语境)表现出色。
  • 它们在黑暗的洞穴里(不同的语境)表现糟糕。
  • 它们在水下毫无用处。

太阳镜并没有“坏”,它们只是有情境化的用途。论文认为,AI 模型也是如此。一个基于特定“地面真实”训练的模型,可能在某家医院或某个城市表现完美,但在另一个地方却会失败得一塌糊涂。我们需要诚实地说明模型在哪里以及何时有效,而不是声称它们无处不在。

我们应该怎么做?

这篇论文并不是说“停止制造 AI”。它是在说我们需要成为诚实的建设者

  1. 停止假装真理是神奇的。 承认我们为了创造数据而做出了选择。
  2. 写下配方。 当我们分享一个数据集时,我们应该详细解释我们是如何制作它的:谁进行了标注?我们使用了什么工具?我们遗漏了什么?
  3. 尝试不同的配方。 与其只有一个“地面真值”,也许我们应该尝试制作几个不同的版本,看看 AI 会发生怎样的变化。
  4. 组队合作。 机器学习专家需要与那些真正了解该领域的人(如医生、生物学家或社会学家)进行交流,以确保“真理”在现实世界中是合理的。

底线

论文指出,“地面真值”并不是宇宙中一个固定不变的事实。它是一个由人类创造的工具,受到我们的选择、工具和局限性的影响。通过承认这一点,我们可以构建更好、更安全、更诚实的 AI,让它知道自己的局限性,而不是假装自己是一个能完美洞察一切的神。

作者并不是说我们已经解决了这个问题。他们是说我们需要开始讨论这个问题,这样我们才不会在无意中制造出那些虽然自信但却是错误的机器人,或者那些在实验室里表现优异但在现实世界中却会失败的模型。这关乎于保持一份谦逊,并更加谨慎地对待我们如何教机器去观察这个世界。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →