Relating Word Embedding Gender Biases to Gender Gaps: A Cross-Cultural Analysis
本文提出了一种量化词嵌入中性别偏见的方法,并展示了其利用 2018 年推特数据,在预测和表征美国 51 个地区及 99 个国家在教育、政治、经济和健康领域的统计学性别差距方面的能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你拥有一面由语言构成的巨大数字镜子。这面镜子的构建方式是让计算机学习来自世界各地数百万条推文。当计算机学会理解单词时,它会创建一个“地图”,在这个地图中,经常一起使用的词语会坐得比较近。
这篇论文的作者提出了一个引人入胜的问题:如果我们观察这幅语言地图的“形状”,我们能否看到现实世界中男女之间的差距?
可以这样理解:如果一种文化在无意中将“医生”视为一个男性化的词,将“护士”视为一个女性化的词,那么这种文化是否也存在现实世界的差距,即医生中男性多于女性?
以下是他们所做工作的简单分解以及他们的发现:
1. 实验:将单词映射到现实
研究人员获取了两类数据:
- 语言地图: 他们仅使用 2018 年的英文推文,为 99 个国家和 51 个美国地区构建了定制的“词汇地图”。
- 现实检验: 他们收集了关于性别差距的官方统计数据,例如谁掌握政治权力、谁上了大学、谁赚得更多以及谁运动得更多。
他们将语言地图视为一个指南针。他们问道:“语言指向的方向(例如,将‘领导力’与男性联系起来)是否与现实世界的统计数据(例如,男性持有更多领导职位)的方向一致?”
2. 发现:语言之镜反映现实
他们发现,语言地图和现实世界的统计数据往往指向同一个方向。这就像是,人们在 Twitter 上的表达方式成为了他们社会性别动态的一个指纹。
- 政治: 在那些语言显示“政府”等词汇与女性联系更紧密的国家,这些国家的女性实际拥有更多政治权力。
- 金钱: 在美国一些将“威胁”、“危险”或“可怕”等词汇与女性联系得更紧密的州,存在着更大的薪资差距(即女性收入低于男性)。研究人员认为,这可能意味着在那些男性感到其统治地位受到“威胁”的地方,他们会通过加强控制来做出反应,这在语言和薪酬中都有体现。
- 教育: 在那些语言中“STEM”(科学、技术、工程、数学)和“校友”等词汇与男性联系较弱的地方,实际上有更多的女性获得了数学和计算机科学学位。
3. “主题化”线索
研究人员并没有仅仅观察随机的单词。他们将单词分组成了主题,就像侦探寻找特定的线索一样:
- “威胁”主题: 单词如 危险的、有毒的、可怕的。
- “照顾”主题: 单词如 孩子、婴儿、父母。
- “权力”主题: 单词如 参议院、投票、总统。
他们发现这些主题具有选择性。“权力”类词汇可以预测政治差距,但不能预测健康差距。“威胁”类词汇可以预测薪资差距,但不能预测教育差距。而随机的一组单词(如随机形容词列表)则显示出没有任何联系。这证明了这种联系并非巧合;语言的特定部分反映了社会的特定部分。
4. “好词”与“坏词”
他们还观察了单个形容词。他们发现,与缩小性别差距(即男女更加平等)相关的词汇,往往具有更高的“正面情绪”(效价)和更强的“支配感”(优势感)。
- 示例: 与更好的薪资平等相关的词汇是 非凡的、优秀的和杰出的。
- 示例: 与更差的薪资差距相关的词汇是 悲伤的、精疲力竭的以及差劲的。
5. 这意味着什么(以及不意味着什么)
论文得出结论,语言偏见不仅仅是计算机错误,它是一种文化信号。 在计算机“大脑”(词汇地图)中发现的偏见,似乎镜像了该文化中男性和女性的实际机会和地位。
重要的局限性(细则):
- 它是镜子,而非魔杖: 该研究展示的是相关性(一种联系),而非因果关系(其中一个导致另一个)。语言并不一定创造了差距;它们很可能是共同成长的。
- 英文过滤器: 他们只研究了英文推文。这忽略了那些不说英语、无法上网或不使用 Twitter 的人。这就像试图通过只听某家特定咖啡馆里的人说话来理解整个国家的文化。
- 无临床用途: 论文并不建议使用这些数据来修复差距或在临床环境中诊断社会问题。这纯粹是对语言数据如何与现有统计数据相关联的一种分析。
简而言之: 计算机学到了,在那些语言微妙地将女性推向“威胁”或“软弱”的文化中,现实世界往往会在薪资或权力方面反映出这一点。我们推文的数字镜像,能如此准确地展示出我们社会不平等的轮廓。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。