← 最新论文
💬 NLP

Measuring Stereotype and Deviation Biases in Large Language Models

本研究通过分析四个先进大语言模型生成的个人档案,考察了刻板印象偏差与偏离偏差,揭示所有被评估的模型在将特定属性与人口群体相关联以及偏离现实世界人口分布方面均表现出显著偏差。

原作者: Daniel Wang, Eli Brignac, Minjia Mao, Xiao Fang

发布于 2026-05-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Daniel Wang, Eli Brignac, Minjia Mao, Xiao Fang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有四位不同的 AI“故事讲述者”(大型语言模型,或称 LLM)。你让它们发明一个角色,并告诉你关于这个角色的所有信息:他们的政治观点、宗教信仰、爱谁、收入多少以及从事什么工作。

这篇论文就像一份侦探报告,旨在核查这些故事讲述者是在讲述关于真实世界的真相,还是仅仅在重复陈旧、懒惰的刻板印象。研究人员提出了两个主要问题:

  1. “刻板印象”测试:这些 AI 故事讲述者是否以不同方式对待不同的人群?(例如:它们是否总是把男性设定为“工程师”,而把女性设定为“教师”?)
  2. “偏差”测试:它们发明的角色是否真的像现实世界中的真人?(例如:如果它们发明了 100 个人,这些人的政治观点是否符合美国实际人口分布,还是所有人突然都变成了自由派?)

以下是他们发现的简要总结:

1. “政治透镜”是破碎的

当 AI 被要求猜测一个人的政党归属时,它表现得像指南针失灵了一样。

  • 发现:AI 发明的几乎每一个人都被设定为自由派。无论角色是男性、女性、黑人、白人还是亚裔,AI 压倒性地表示:“他们是自由派。”
  • 现实核查:在现实世界中,人们在自由派、保守派和中立派之间分布。AI 几乎完全忽略了保守派和中立派。
  • 类比:这就像请一位厨师为一群人准备自助餐,但这位厨师只供应披萨。即使你要求沙拉、牛排或塔可,厨师还是只给你更多的披萨,因为那是他们习惯烹饪的东西。

2. “宗教”过滤器过于狭隘

当 AI 猜测一个人信奉什么宗教时:

  • 发现:AI 主要猜测是基督教无宗教信仰。它很少猜测印度教、犹太教或伊斯兰教,尽管现实中数百万人信奉这些信仰。
  • 年龄转折:AI 对老年人(婴儿潮一代)有一个特定的习惯:它几乎总是猜测他们是基督徒。而对于年轻一代,它则猜测他们是“无宗教信仰者”。
  • 类比:想象一张地图,上面只画了美国和加拿大,而所有其他国家都被标记为“未知”。AI 对世界宗教的地图缺失了实际人口中的巨大部分。

3. “爱情生活”的扭曲

当 AI 猜测性取向时:

  • 发现:AI 发明了过多的**LGBTQ+**角色。在现实世界中,大多数人认同为异性恋。AI 却颠倒了这一点,使其发明的绝大多数角色成为 LGBTQ+。
  • 性别差异:它有一个特定的模式:它几乎总是猜测男性是同性恋,而女性是双性恋。
  • 类比:这就像走进一个房间,AI 说:“这里每个人都戴着红帽子”,而实际上只有少数人戴着。AI 将少数群体放大到了看起来像多数的程度。

4. “工作”与“金钱”的刻板印象

当 AI 猜测职业和财富时:

  • 发现:AI 严重依赖老式的刻板印象。
    • 职业:它非常喜欢为几乎所有人(尤其是老一代)设定教师平面设计师的职业。
    • 种族与金钱:它经常猜测黑人是“下层阶级”,而亚裔是“上层阶级”。
    • 拒绝回答:其中一个 AI 模型(Claude)因为对猜测某些群体(如白人男性或黑人男性)的职业感到过于紧张,直接拒绝回答,声称“我做不到”。
  • 类比:AI 就像一个只看过几部电影的人。如果它看到一个黑人角色,就假设他们是社区组织者;如果它看到一个亚裔角色,就假设他们是医生。它们是在依据“电影逻辑”行事,而非现实统计数据。

5. “名字游戏”(显式与隐式)

研究人员做了一件巧妙的事。他们以两种方式询问 AI:

  • 显式:“写一个黑人男性。”
  • 隐式:“写一个名叫贾马尔的男人。”(名字暗示了种族,但未明说)。

结果:AI 在两种情况下的表现几乎相同。无论你是直接说“黑人男性”,还是仅仅使用与该群体相关的名字,AI 仍然应用了相同的刻板印象。这表明 AI 不仅仅是对你输入的词语做出反应;它已经在“大脑”深处“学会”了这些关联。

大局观

该论文得出结论:这些 AI 模型并非社会的“中立镜子”。相反,它们更像是哈哈镜,拉伸或压缩了某些群体。

  • 它们让自由派观点看起来像是唯一的观点。
  • 它们让**LGBTQ+**身份看起来像是大多数。
  • 它们让老年人看起来像是基督徒和教师。
  • 它们让亚裔看起来富有,而让黑人看起来贫穷。

作者警告说,如果我们使用这些 AI 模型来做决策(如招聘、贷款或分析新闻),我们可能会无意中构建一个看起来像 AI 扭曲想象的世界,而不是真实世界。他们建议开发者需要修复训练数据,以便 AI 停止重复这些“懒惰”的猜测,并开始更准确地反映现实。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →