← 最新论文
💻 computer science

Data Annotations as Pedagogical Hints: From Subjective Labels to Critical Thinking

本研究表明,将人工数据标注任务纳入机器学习课程,能有效地促使学生从将数据标签视为客观事实转向理解其为一种主观解释,从而培养他们对偏差和模型行为的批判性思维,尽管未来的迭代必须更好地将解释性的分歧界定为一种教学特征,并减轻处理敏感内容时产生的情绪不适。

原作者: Ralf Raumanns, Theresa Elstner, Louis Ferger-Andrews, Louise M. Carlsen, Martin Potthast, Gerard Schouten, Josien P. W. Pluim, Veronika Cheplygina

发布于 2026-07-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Ralf Raumanns, Theresa Elstner, Louis Ferger-Andrews, Louise M. Carlsen, Martin Potthast, Gerard Schouten, Josien P. W. Pluim, Veronika Cheplygina

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

机器人大脑背后的隐形之手

想象一下,你正在教一个机器人识别不同种类的水果。你给它看了一千张苹果和橙子的照片,并告诉机器人:“这是苹果,”或者“这是橙子。”在机器学习的世界里,这种给图片贴标签的过程被称为数据标注(data annotation)。长期以来,学习如何构建这些机器人的学生拿到的都是预先标注好的数据集,就像一本所有答案都已填好的教科书。他们学习如何训练机器人,却从未见过决定这些图片究竟“是什么”时,那背后混乱的人类工作。

这项研究探讨的核心问题是:当“真相”并非非黑即白时,会发生什么?在许多现实世界的情况下,两个聪明的人可能会看着同一张图像,却诚实地对所见之物持有不同意见。如果机器人从人类产生分歧的数据中学习,它是会变得困惑,还是会学到更深层的东西?这篇论文探讨了一个大胆的想法:如果我们不只是给学生预先标注好的数据,而是让他们亲自进行标注呢?通过强迫学生成为机器人背后的“人类大脑”,研究人员想要观察这是否能帮助他们理解:人工智能不仅仅是数学,它也是人类观点、偏见以及我们看待世界那混乱现实的一种反映。

实验:皮肤病灶上的毛发标注

来自荷兰、德国和丹麦大学的研究团队决定在两个不同的课堂上测试这个想法。他们没有使用猫或狗这类简单的图片,因为这些通常很容易达成共识。相反,他们给了学生数百张显示皮肤病灶(皮肤上的斑点)的医学图像,并要求他们完成一项非常具体且棘手的任务:计算覆盖在斑点上的毛发量。

学生必须针对每张图像做出决定:是无毛有一些毛,还是有很多毛

这听起来很简单,但其实是针对人类大脑的一个陷阱。不像猫显然就是猫,皮肤病灶上的毛发是模糊的。几根零星的毛发算“有一些”还是“很多”?一片稀疏的毛发算“有一些”吗?一名学生可能会说“有一些”,而他们的搭档看着完全相同的图片却说“有很多”。并没有一个注定的“正确答案”写在星辰之中。研究人员想看看当 43 名学生(其中 30 名来自 Fontys 大学,13 名来自哥本哈根 IT 大学)陷入这种分歧的灰色地带时,会发生什么。

他们的发现:“顿悟时刻”与“修复本能”

结果既有极佳的学习效果,也有一种有趣的心理反应。

好消息:灯泡亮了
在执行任务之前,许多学生认为数据只是等待被收集的事实。在进行标注后,他们的理解发生了巨大的变化。

  • 主观性: 他们意识到自己的个人观点实际上塑造了数据。他们看到两个聪明的人可以看着同样的东西却看到不同的东西。
  • 偏见: 他们理解了,如果大家都同意称这些毛发为“很多”,那么机器人就会学习到“很多”就是真相。但如果他们产生分歧,机器人就会感到困惑。他们学到了,机器人的错误往往始于标注数据的那些人,而不只是代码本身。
  • 有效性: 学生们评价这种混乱的、动手实践的活动比枯燥的讲座更能有效地理解偏见是如何运作的。他们觉得学习 AI 的动力更强了,因为他们亲身“感受”到了这个问题。

转折: “修复它”的本能
有趣的地方就在这里。尽管学生们学到了分歧是正常现象且是过程的一部分,但当被问及如何改进这项任务时,他们的第一直觉却是消除分歧

当研究人员问:“我们如何让这项任务变得更好?”最常见的回答是:“给我们更清晰的规则,这样我们就能达成一致!”或者“给我们一些示例,这样我们就不会感到困惑!”

研究人员称之为“教学张力(pedagogical tension)”。学生们发现了世界是混乱的,但他们仍然渴望一个干净、完美的答案。他们将分歧视为一个“Bug”(错误/漏洞),而不是一个“Feature”(特性/功能)——即人类看待事物时自然的组成部分。他们想要消除那个让他们获得学习的东西。

过程中的阻碍

进展并非一帆风顺。研究人员注意到了一些具体的障碍:

  • “恶心”因素: 许多学生对观察皮肤病灶的医学图像感到不适。这有点令人反感,对某些人来说,这种不适分散了他们的注意力,影响了学习。
  • 枯燥感: 一个接一个地标注 100 张图片是重复性的工作。学生们称其为“枯燥”且“缓慢”。他们希望花更多时间讨论为什么存在分歧,而不是花时间点击按钮。
  • 工具问题: 一些学生在操作用于标注的软件时遇到了困难,希望有更简单的工具或预设脚本,以便他们能专注于思考部分。

核心启示

论文指出,让学生进行标注是让他们理解 AI 并非客观的 的一种有力方式。它向他们展示了喂给机器人的数据是由人类构建的,带着我们所有的偏见和分歧。

然而,研究人员警告说,这种方法需要谨慎处理。如果你只是把学生扔进一个混乱的任务中,他们可能只会感到沮丧,并试图去“修复”这个混乱,而不是从中学习。关键在于引导他们意识到:分歧是教训,而不是错误

简而言之,论文证明了通过亲手接触数据,能让你更好地理解机器人的大脑。但也表明,我们必须教会学生去热爱这种混乱,因为在现实世界中,并不存在单一的“正确”标签——只有不同的视角。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →