Unmasking LAION-5B: Age, Gender, Race, and Emotion Biases in Large-Scale Image Datasets
这项研究揭示了广泛使用的 LAION-5B 数据集存在显著且一致的人口统计学偏差,包括年轻白人男性的过度代表以及少数群体和老年女性的代表性不足,同时还存在性别与情感表达之间的刻板印象关联,这可能会对下游 AI 系统产生负面影响。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,互联网就像一座巨大的、混乱的图书馆,里面包含了数十亿本书(图像)及其标题(说明文字)。LAION-5B 数据集就像一个巨大的自动化机器人,它进入了这座图书馆,抓取了一大堆这样的书,并把它们交给了 AI 艺术家,用来教它们如何绘画。
这篇论文是对那一堆书做的“读书报告”。作者们想要探究的是:这些图片里到底是谁,以及他们在做什么? 他们发现,这个机器人抓取的并不是一个公平、随机的人类样本。相反,它抓取了一个非常特定、存在偏差的群体。
以下是他们的发现,通过简单的分类进行了解析:
1. “谁”的问题:一个偏斜的群体
作者使用两种不同的“智能相机”(名为 FairFace 和 DeepFace 的 AI 模型)观察了数据集中约 8 万张面孔,以推测人们的年龄、性别和种族。
- 年龄差距: 该数据集对年轻人有着近乎痴迷的偏好。这就像一场派对,几乎所有人都在 20 到 39 岁之间。儿童、青少年或老年人(尤其是 60 岁以上的人)非常稀少。
- 性别失衡: 人群主要由男性组成。在某些统计中,男性占面孔总数的 70% 以上。女性的代表性显著不足。
- 种族构成: 该数据集由白人主导(约 50–60%)。其他种族群体,如黑人、印度人和拉丁裔,在现实世界中比例很高,但在数据集中却非常罕见。
类比: 想象你要求一个机器人为教科书拍一张“人”的照片。机器人并没有拍下一张多元化的城市街道照片,而是只拍了一群特定的、在咖啡馆里闲逛的年轻白人男性的照片。如果你根据这些内容教 AI 如何画“人”,它就会认为这就是世界的全部。
2. “做什么”的问题:刻板的情绪
作者还观察了这些人表现出的情绪(快乐、愤怒、悲伤等)。他们发现,该数据集强化了关于不同群体“应该”如何表现的陈旧刻板印象。
- 男性 = 愤怒: 当数据集中出现男性时,他们表现出愤怒或厌恶情绪的可能性不成比例地高。
- 女性 = 快乐: 当数据集中出现女性时,她们表现出快乐情绪的可能性不成比例地高。
- “愤怒的男人,快乐的女人”法则: 这是一个经典的刻板印象,而数据表明,这种印象已经深深植根于训练材料之中。
类比: 这就像一部电影剧本,其中男人出现的唯一时刻是在大声叫喊,而女人出现的唯一时刻是在微笑。如果 AI 从这个剧本中学习,它就会认为世界就是这样运作的。
3. “双重麻烦”问题:交织偏见
作者不仅观察了单一的年龄或性别,还观察了它们是如何混合在一起的(例如“中年女性”或“年轻黑人男性”)。
- 缺失的中年女性: 这个群体在数据集中几乎是隐形的。
- 过度代表的年轻女性: 年轻女性(30 岁以下)非常普遍,但随着女性年龄的增长,她们在数据集中就消失了。
- 过度代表的白人婴儿: 虽然少数族裔的婴儿很罕见,但白人婴儿在数据集中却出奇地多。
类比: 如果你正在制作一个关于人类的拼图,你会拥有大量的“年轻白人男性”和“年轻白人女性”碎片,但你会丢失几乎所有的“老年女性”和“老年少数族裔男性”碎片。你拼出的画面将是不完整且扭曲的。
4. 为什么这很重要?
论文解释说,AI 模型(如生成图像的模型)通过记忆这个数据集中的模式来进行学习。
- 镜像效应: 如果数据集是一面扭曲的镜子,那么 AI 的输出结果也将是一个扭曲的倒影。
- 后果: 如果你要求 AI “画一个 CEO”,它可能会画一个年轻的白人男性,因为那是它看到最多的;如果你要求它“画一个快乐的人”,它可能会画一个女性;而要求它画“一个愤怒的人”,它可能会画一个男性。
论文“没有”说明的内容
坚持研究者实际发现的内容至关重要:
- 他们没有测试 AI 模型本身(如 Stable Diffusion)是否会产生糟糕的图像;他们仅仅分析了来源材料(数据集)。
- 他们没有声称这个数据集是唯一的问题,但他们确实表示这是一个“基础性”问题,意味着许多其他工具都是建立在其之上的。
- 他们在本文中没有提供解决方案,除了建议未来的数据集需要更好的策展,以及我们需要更好的工具来衡量多样性。
核心结论
作为现代 AI 核心驱动力的 LAION-5B 数据集,就像一个带有偏见的相机镜头。它过度聚焦于年轻的白人男性并将其与愤怒联系起来,同时将女性和老年人推向背景,或将其与快乐联系起来。由于 AI 是通过这个镜头进行学习的,论文警告称,这些机器所发展的“世界观”从根本上说是失衡的,反映的是互联网的偏见,而非真实的人类多样性。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。