Institutional Prestige as Geographic Bias in Large Language Models: Evidence from Three Factorial Experiments with Bootstrap Confidence Intervals
通过涉及四种大语言模型、共计4,320次API调用的三次析因实验,本研究表明,机构声望和发表渠道对候选人评估产生的歧视效应显著强于申请人的姓名、族裔或地理来源,并展示了一种“挽救效应”,即高影响力论文可以不成比例地补偿低机构声望带来的影响。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在现代世界中,人工智能已悄然成为了一个守门人。这些被称为大语言模型的计算机程序,正越来越多地被要求做出影响人类生活的决策。它们帮助决定谁能获得工作、谁能获得研究资助以及谁有资格获得贷款。它们通过阅读申请材料并进行评分来完成这些工作,扮演着自动化法官的角色。多年来,科学家们一直担心这些数字法官可能会带有构建它们的人类的偏见。我们知道它们可能会基于姓名、性别或种族对人产生偏见。但一个更新、更微妙的问题出现了:这些模型是否仅仅因为一个人就读的学校而给予优待?这与一个人的工作质量无关,而是关于其简历上机构的声誉。如果一个计算机程序给来自著名大学的科学家打分高于同样优秀的来自知名度较低大学的科学家,那么它并不是中立的;它是在强化现有的等级制度。
一个研究小组致力于使用四种不同的人工智能模型来测试这种特定类型的偏见。他们想知道模型是对大学的声望做出反应,还是仅仅对该大学所在的国家做出反应。为了找到答案,他们创建了数千份虚假的求职和资助申请。他们在每种场景中都保持候选人的技能和经验完全一致。他们唯一改变的是候选人就读的大学名称,以及在某些情况下,候选人发表论文的期刊名称。他们测试了来自顶尖美国大学、来自智利和哥伦比亚受尊敬机构以及来自一所未出现在全球排名名单上的厄瓜多尔大学的候选人。他们还改变了申请书上的姓名,包括盎格鲁、拉丁和阿拉伯起源的姓名,以观察模型是否仍然持有旧有的刻板印象。
结果清晰且具有统计学上的稳健性。人工智能模型一致地给予来自声望卓著大学的候选人更高的分数。这种差距并非微小的波动,而是一个稳定且可衡测的趋势。在不同的模型和专业领域中,来自顶尖大学的候选人获得的评分比来自排名较低大学的候选人高出近零点三分。在自动化评分的世界里,这种差异是显著的。然而,当研究人员查看申请书上的姓名时,情况发生了变化。模型并未表现出对盎格鲁姓名相对于拉丁或阿拉伯姓名的统计学显著偏好。不同姓名组的分数非常接近,其差异可以归因于随机偶然。这表明,虽然模型已成功训练到可以忽略族裔姓名,但它们尚未训练到可以忽略简历上学校的地位。
为了理解这种偏见是来自学校的声誉还是其所在的国家,研究人员进行了第二组实验。他们对比了一所位于墨西哥的高排名大学和一所位于美国的低排名或无排名大学。如果模型仅仅是对发展中国家存在偏见,它们应该会更青睐美国的学校。相反,模型倾向于青睐墨西哥的大学,尽管这所大学虽然不如顶尖美国学校有名,但比那所美国小规模学校更具知名度。这证明了模型是对机构本身的声望做出反应,而非仅仅是对地理位置做出反应。这种偏见是关于大学的品牌,而非申请人的护照。
最令人惊讶的发现出现在研究人员引入第三个变量时:即候选人发表研究工作的期刊。他们将发表在世界最著名科学期刊上的候选人与发表在较小的开放获取期刊上的候选人进行了对比。两者之间的差异是巨大的。期刊的声望对得分的影响远大于大学的声望。一位来自知名度较低大学但发表在顶尖期刊上的候选人,其得分远高于一位来自顶尖大学但发表在较小期刊上的候选人。事实上,知名期刊带来的提升几乎是知名大学带来的提升的六倍。这创造了一种“拯救效应”,即在顶尖期刊上发表作品可以完全补偿机构声望的不足。模型似乎认为,在顶级期刊上发表作品是如此强烈的质量信号,以至于它盖过了对学校的偏见。
研究人员还观察了模型在评分方面的一致性。他们发现,在评估来自知名度较低机构的候选人时,模型的评分表现得更不一致。有时,模型可能会给来自较小大学的候选人低分,而另一次,对于完全相同的个人资料,它可能会给出稍高的分数。这种不一致性在处理来自顶尖大学的候选人时并不常见。这表明,模型在评判那些它们了解较少的机构的人时,确定性较低,从而导致了双重劣势:较低的平均分和更不可预测的评估。
最终,这项研究揭示了尽管人工智能在避免某些形式的歧视方面取得了进展,但它也继承了对地位的深层偏见。这些模型充当了现有社会等级制度的放大器,奖励那些熟悉且显赫的存在,同时惩罚那些未知的存在。它们似乎并不那么在意原籍国,而是在意学校的品牌名称。然而,这项研究也提供了一条前进的路径。它表明,高质量的工作,只要发表在正确的平台,就可以打破这些障碍。对于来自知名度较低机构的研究人员来说,通往这些数字法官公平评估的路径不在于改变他们的姓名或国家,而在于他们发表作品那无可辩驳的分量。机器正在学习重视作品,但前提是必须将其呈现在最显赫的舞台上。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。