Doomed to Re-Annotate, Forever: The ImageNet Story
本文介绍了 ReImageNet,这是一个对 ImageNet-1k 验证集进行了全面重新标注的版本,它修正了约 12% 的原始标签,并引入了多标签、定位和语义属性,从而在显著提升监督模型和多模态大语言模型(MLLMs)准确率的同时,证明了大规模标注需要人类与大语言模型之间的迭代协作。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在试图教一个机器人如何观察世界,就像一个孩子在动物园里学习识别动物一样。为了做到这一点,你需要一本巨大的图画书,其中的每一张照片都要用正确的名称进行标注。在计算机视觉的世界里,这本“图画书”被称为 ImageNet。十多年来,它一直是衡量机器人眼睛是否变得更加敏锐的金标准,是终极测试。测试方法很简单:给机器人看一张照片,然后问:“这张照片里的主要物体是什么?”如果机器人猜对了单词,它就得一分。这个分数被称为“Top-1 准确率”,它是每一次人工智能重大突破的计分板。
然而,这里有一个陷阱。想象一下,如果你的图画书是由一群并不了解动物、且按小时计费的匆忙人群编写的。他们可能会漏掉躲在灌木丛中的第二只动物,把玩具狗当成真狗,或者把镜子里的反射图像标注为实际物体。随着时间的推移,这些微小的错误会不断累积。如果测试书本身很混乱,你就无法真正判断机器人是真的聪明,还是仅仅因为猜中了那些混乱的答案而走运。这篇论文深入研究了这本混乱的图画书,看看它到底有多乱,以及我们是否可以在不破坏计分板的前提下将其清理干净。
伟大的 ImageNet 清理行动:关于混乱标签与聪明机器人的故事
把 ImageNet-1k 数据集想象成一本由全世界 AI 用来训练其视觉能力的、长达 5 万页的巨型相册。多年来,研究人员一直将这本相册视为神圣的文本,假设每一个标签都是完美的。但本文的作者——来自布拉格捷克理工大学的一个团队——决定用放大镜对整个相册进行审视。他们提出了一个简单却令人胆战心惊的问题:如果我们的测试书里的答案是错的怎么办?
他们不仅仅是瞥了几页,而是从头开始重新标注了整个验证集。这意味着他们再次查看了所有 5 万张图像,但这次采用了更聪明、更谨慎的方法。他们意识到,旧的标注方式——即人类必须为一张图片只选择一个词——就像是通过只命名站在门口最近的那个人来描述一场混乱的派对。你可能会错过 DJ、蛋糕,或者桌上的猫。
大揭秘:相册很混乱
当他们完成工作时,发现原始标签远非完美。
- “错误答案”率: 大约 12% 的图像标签完全错误。就像一张猫的照片被标注成了狗。
- “缺失项目”率: 高达 33.3% 的图像实际上包含多个重要的东西,但旧标签只选择了其中之一。如果一张照片里有狗、球和篱笆,旧标签可能只说“狗”,忽略了其他部分。
- “无匹配”率: 出人意料的是,3.8% 的图像甚至不包含他们应该测试的 1,000 个类别中的任何内容。这些图像要么是空白,要么是不符合规则的事物。
为了解决这个问题,团队创建了 ReImageNet。他们不再强迫人类只选出一个赢家,而是允许使用**多标签(multilabel)**标注。他们允许标注者说:“好吧,这里有一只狗、一个球和一个篱笆。”他们还增加了特殊的“属性”来处理棘手的情况:
- 反射(Reflection): 如果你在镜子里看到一张脸,那是脸吗?是的,但它是一个反射图像。
- 拟制品(Rendition): 那是一把真枪还是一把玩具枪?标签需要知道区别。
- 人群(Crowd): 如果照片里有五十个人,我们要把他们全部算进去吗?他们创建了一个特殊的标签用于群体,这样标注者就不必画出五十个微小的方框。
“人类 + 机器人”团队
他们故事中最有趣的部分之一是他们是如何做到的。他们并没有仅仅雇佣一群互联网上的陌生人(这种方法被称为众包)并听天由命。他们发现,众包往往会导致混乱,因为规则很难通过一份简短的手册来解释清楚。
相反,他们建立了一支“梦之队”。他们聘请了一小群经过培训的专家,并赋予了他们一种超能力:AI 助手。他们使用强大的 AI 模型(如 GPT-4o 等)先观察照片并建议其中有什么。然后,人类专家会对这些建议进行检查。这是一种协作:AI 是快速、不知疲倦的侦察兵,而人类则是细心的编辑。论文发现,这种结合是获得高质量标签的最佳方式。AI 单独并不完美,人类单独则太慢,但两者结合,他们达到了新的准确度水平。
当他们测试机器人时发生了什么?
一旦有了新的、干净的标签,他们再次让旧的 AI 模型进行测试。结果既有“哎呀”也有“哇哦”。
- 旧卫士(监督学习模型): 那些使用混乱旧标签进行训练的传统 AI 模型并没有得到太多提升。它们的得分仅上升了 0.05% 到 1.2%。看来它们已经学会了很好地猜测那些混乱的答案。
- 新成员(多模态大语言模型/MLLMs): 更先进、更强大的模型(多模态大语言模型)看到了巨大的飞跃。它们的得分增加了 5% 到 6%。这表明这些更聪明的模型实际上曾被旧的、混乱的标签所困惑。当标签被清理干净后,它们终于展示出了真实的实力。
“缩放”带来的惊喜
团队还做了一件聪明的事:他们从照片中剪切出特定的物体(比如只裁剪出那只狗的部分),并在这些微小的碎片上测试机器人。他们发现,旧式的机器人一旦背景消失,识别能力就会变得极差。它们的准确率下降了高达 33%。这意味着这些机器人是在依赖背景(比如知道狗通常出现在草地上)而不是真正识别狗本身。新的、更聪明的模型在这一点上表现得好得多,证明它们确实“看到”了物体。
涟漪效应
论文还警告我们,这种混乱不仅仅存在于 ImageNet 中。因为许多其他测试都是以 ImageNet 为蓝图构建的,错误已经像病毒一样传播。作者估计,这些衍生测试的错误率比原始测试高出 1.7 到 5.8 倍。这就像如果你建造一座新房子时使用了测量错误的蓝图,那么新房子也会同样歪斜。
总结
作者得出结论,我们不能指望一次性就建立一个完美的测试。这不是一次性的工作,而是一个过程。你必须不断检查、不断完善,并不断使用最先进的工具。他们认为,“一次性”标注的时代已经结束了。要构建 AI 的未来,我们需要人类的细心与强大 AI 的协作,不断地互相校验工作。
简而言之,这篇论文告诉我们,长期以来,我们一直在用一本充满错别字的题库来给 AI 评分。现在我们修复了这些错别字,我们发现有些 AI 实际上比我们想象的要聪明得多,而另一些则只是擅长猜对错误的答案。而给所有人的教训是:不要仅仅因为一本题库很古老就信任它;有时候,你必须重写它。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。