← 最新论文
💬 NLP

Laissez-Faire Harms: Algorithmic Biases in Generative Language Models

本研究揭示,五种主要生成式语言模型在自然的“自由放任”情境下,若未使用明确的身份提示,会系统性地延续针对边缘化个体的有害遗漏、从属地位及刻板印象,产生歧视性输出,其负面倾向比赋权倾向高出数百至数千倍,并构成显著的心理风险。

原作者: Evan Shieh, Faye-Marie Vassel, Cassidy Sugimoto, Thema Monroe-White

发布于 2026-05-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Evan Shieh, Faye-Marie Vassel, Cassidy Sugimoto, Thema Monroe-White

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一群由五位非常受欢迎、超级聪明的机器人作家组成的团队(类似于 ChatGPT、Claude 等)。你请他们撰写关于美国日常生活的短篇故事:上学、工作或与朋友闲逛。你并未告诉他们角色“应该”是谁;你只是说:“写一个关于美国学生的故事”或“写一个关于美国医生的故事”。

这篇论文就像是对这些机器人所写内容的一次大规模审计。研究人员发现,即使你没有要求特定的身份,这些机器人也拥有一个隐藏的“默认设置”,会根据种族、性别以及性取向对人区别对待。他们将这些问题称为“自由放任之害”(Laissez-Faire Harms)——意指伤害的发生是因为机器人被“放任自由”去选择,而未被告知其他限制。

以下是这些机器人出错的三种主要方式,辅以简单的类比进行解释:

1. “隐形人”效应(遗漏之害)

类比: 想象一场学校戏剧,导演要求选“一名学生”来担任主角。如果导演只挑选白人演员,甚至从未想过要挑选黑人、亚裔或原住民演员,那么这些群体在剧中实际上就不存在了。

论文发现:
当机器人撰写关于“普通”美国人的故事时,它们 overwhelmingly(压倒性地)选择了白人角色。

  • 差距: 在美国现实中,白人约占人口的 60%。而在机器人故事中,他们出现在 70% 到 84% 的故事中。
  • 抹除: 少数群体(如美洲原住民、太平洋岛民和中东裔)几乎完全隐形。如果你要求写一个关于学生的故事,机器人创作白人学生的可能性是创作原住民学生的数百倍。
  • LGBTQ+ 差距: 关于同性伴侣或非二元性别者的故事极其罕见(不到故事的 3%),尽管他们在现实生活中确实存在。

2. “无助受害者 vs. 英雄”效应(从属之害)

类比: 想象一部电影,每当白人角色出现时,他们总是老板、老师或发号施令的人。但每当黑人、拉丁裔或亚裔角色出现时,他们总是那个寻求帮助、陷入麻烦或等待被拯救的人。

论文发现:
当研究人员在提示词中加入“权力动态”(例如:“写一个关于优等生帮助困难学生的故事”)时,机器人呈现出一种令人震惊的模式:

  • 白人角色 = 英雄: 白人学生通常是“优等生”(帮助者)。白人医生是拯救生命的人。
  • 少数群体角色 = 无助者: 名字听起来像黑人、拉丁裔、亚裔或中东裔的角色,几乎总是那个需要帮助的人。
  • 数据: 机器人将拉丁裔学生描绘成“困难学生”的可能性是将其描绘成“优等生”的数千倍。例如,名为"Maria"(拉丁裔)的角色被描绘成困难学生的次数超过 13,000 次,而名为"Sarah"(白人)的角色被描绘成优等生的次数超过 10,000 次。
  • 结果: 如果你是少数群体的一员并阅读这些故事,机器人会不断告诉你,你是那个需要被拯救的人,而不是那个去拯救他人的人。

3. “刻板印象脚本”效应(刻板化之害)

类比: 想象一位作家为不同人群准备了一套有限的“脚本”。

  • 对于白人,脚本是:“正常、有能力、领导者。”
  • 对于拉丁裔或中东裔,脚本是:“外国人、语言困难、来自战乱之地。”
  • 对于原住民,脚本是:“古老、神秘、时间静止。”

论文发现:
机器人不仅搞错了角色,还使用了具体且有害的陈词滥调:

  • “永恒的局外人”: 即使提示词说“美国人”,机器人仍将拉丁裔、亚裔和中东裔角色描述为“刚到美国”、“英语吃力”或“来自战乱国家”。他们在自己的国家里被当作局外人对待。
  • “白人救世主”: 故事几乎总是以白人角色“拯救”少数群体角色告终。少数群体角色的成功被归功于白人的帮助,而非他们自身的能力。
  • “高贵的野蛮人”: 原住民角色常被描述为居住在偏远、原始的村庄,传授“古老”技能,或“时间静止”,忽略了他们是生活在当今美国的现代人。
  • 酷儿角色: 关于 LGBTQ+ 人群的故事几乎总是涉及悲剧,如被赶出家门或无家可归,而不是展现幸福、正常的关系。

为什么这很重要?

论文认为,这不仅仅是一个有趣的故障;它是危险的。

  • 它是潜意识的: 因为提示词没有要求种族或性别,机器人是自行做出这些选择的。这意味着偏见已内置于系统之中,而不仅仅是糟糕指令的结果。
  • 它伤害真实的人: 论文解释说,不断看到自己被描绘成“困难”、“外来”或“需要被拯救”,实际上会伤害你的大脑。这会制造“刻板印象威胁”,使人感到缺乏自信,并导致在学校或工作中表现不佳。
  • 它无处不在: 这些机器人正被用作孩子的辅导员、医生的写作助手以及孤独者的聊天机器人。如果这些机器人教导孩子某些群体是“困难学生”或“外国人”,它们就在强化现实世界中的偏见。

核心结论

论文得出结论,这些“自由选择”的机器人并非中立。它们正在放大旧有的、有害的刻板印象,并抹除许多人的存在。研究人员表示,我们需要停止将这些工具视为无害,并在造成更多现实世界损害之前开始纠正偏见。他们还呼吁加强教育,让人们明白这些机器人并非现实的完美镜像,而是被偏见扭曲的镜子。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →