AI Alignment Amplifies the Role of Race, Gender, and Disability in Hiring Decisions
这项涵盖 27 种语言模型和 177 种职业的大规模研究揭示,后训练对齐显著放大了女性和黑人候选人的招聘优势,同时加剧了残障候选人的劣势,有效逆转了人类研究中观察到的种族歧视方向,并使人口统计因素的影响程度等同于额外接受一年教育。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你雇佣了一位体型巨大、超级聪明的机器人图书管理员,来帮你挑选最佳工作候选人。你给这位机器人两份简历,它们在技能、教育和经验方面几乎完全相同。唯一的区别是顶部的“求职信”,其中向机器人透露了候选人的性别、种族或是否患有残疾。
这篇论文描述了一项大规模实验,研究人员让 27 种不同版本的此类“机器人图书管理员”(人工智能语言模型)做出招聘选择。他们想看看这些机器人是会像人类雇主(通常存在歧视行为)那样行事,还是会表现出不同的行为。
以下是他们发现的结果,使用了一些简单的类比:
1. 机器人拥有“偏见开关”
研究人员发现,机器人确实会在意候选人是谁,但它们在意的方式与人类不同。
- 对于女性和黑人候选人:机器人实际上给予了他们加分。如果两位候选人资质相当,机器人更倾向于选择女性或黑人候选人,而非男性或白人候选人。
- 对于残疾候选人:机器人给予了他们减分。如果候选人提到自己有残疾,即使其技能完美,机器人也不太可能录用他们。
幅度:这种偏见并非微不足道。给予女性和黑人候选人的优势大致相当于多接受六个月到一年的教育。而对残疾候选人的减分同样显著。
2. “训练营”效应(对齐)
这项研究最令人惊讶的部分在于为什么会发生这种情况。研究人员比较了“原始”机器人(预训练模型)与“经过训练”的机器人(指令微调或“对齐”模型)。
- 原始机器人:原始机器人有些困惑,做出的招聘决定几乎完全是随机的。它不太在意资质或人口统计特征。
- 经过训练的机器人:研究人员“训练”机器人变得乐于助人、无害且诚实(这被称为对齐)。
- 结果:这种训练营不仅让机器人变得更聪明,还极大地强化了偏见。
- 对女性和黑人候选人的加分幅度增长了325% 至 330%。
- 对残疾候选人的减分幅度增长了171%。
这就像一位教练教导一名球员要“公平”。结果教练并没有让球员保持中立,而是不小心教会了他对某些球员格外友善,而对另一些球员格外严厉。
3. “缺失拼图”问题
为什么机器人会以不同方式对待这些群体?论文提出了两个主要原因,类似于侦探破案的方式:
- “加分”理论(差异化回报):当机器人看到一位女性或黑人候选人拥有某项特定技能(如学位或经验)时,它给予该技能的认可度高于对男性或白人候选人的认可。这就像仅仅因为属于该群体就额外给予加分。
- “缺失线索”理论(信息不对称):当候选人没有提供清晰的信号(例如未列出工作经验)时,机器人会起疑心。它因这种“缺失线索”而对女性和残疾候选人的惩罚远比对男性严厉。这就好比机器人心想:“如果我看不见他们的经验,他们一定在隐瞒什么”,并因此对边缘化群体因这种不确定性而做出更严厉的评判。
4. 机器人与人类的比较
研究人员将机器人的结果与数十年来关于人类招聘歧视的研究进行了比较。
- 种族:人类通常更频繁地拒绝黑人候选人。机器人则相反,更倾向于录用他们。
- 残疾:人类会大量拒绝残疾候选人。机器人仍然会拒绝他们,但程度低于人类(尽管他们确实仍然会拒绝)。
- 性别:人类表现出对女性的轻微偏好。机器人则放大了这种偏好,使得对女性的偏好比人类通常表现出的要强烈得多。
核心结论
该论文得出结论:人工智能不仅仅是复制人类的种族主义或性别歧视。相反,“对齐”人工智能的过程(教导其安全且乐于助人)创造了一种全新的、不同的偏见模式。
机器人并非以与人类相同的方式“出错”;它们是以一种独特的方式出错。该研究警告称,我们不能简单地假设人工智能会重蹈历史覆辙。相反,我们为使人工智能变得“良好”而采取的每一步,都可能意外地创造出新的、被放大的不平等现象,尤其会伤害残疾候选人,同时给女性和黑人候选人带来巨大的优势。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。