← 最新论文
🤖 AI

StereoTales: A Multilingual Framework for Open-Ended Stereotype Discovery in LLMs

StereoTales 是一个涵盖 10 种语言、包含超过 65 万篇故事的多语言框架与数据集,它揭示了开放式大语言模型生成如何系统性地产生与文化相适应的有害刻板印象(无论模型规模大小),同时证明了人类与人工智能在偏见判断上存在高度一致性。

原作者: Pierre Le Jeune, Étienne Duchesne, Weixuan Xiao, Stefano Palminteri, Bazire Houssin, Benoît Malézieux, Matteo Dora

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Pierre Le Jeune, Étienne Duchesne, Weixuan Xiao, Stefano Palminteri, Bazire Houssin, Benoît Malézieux, Matteo Dora

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有来自不同科技公司的 23 位不同的“故事讲述者”(AI 模型)。你让每一位都为一个角色写一个短篇故事,但你只给他们关于该角色的一个具体细节作为起点——比如“该角色是一位退休教师”或“该角色是一位年轻移民”。

这篇论文《StereoTales》是一项大规模实验,旨在观察这些故事讲述者会自行发明哪些其他细节。它们是否会无意中用有害的刻板印象来填补空白?

以下是他们发现的分解,使用了简单的类比:

1. 实验:一场“填空”游戏

研究人员并没有仅仅询问 AI“这句话是否有偏见?”(这就像多项选择题)。相反,他们让 AI 自由创作故事。

  • 设置:他们创建了10 种不同语言(英语、法语、阿拉伯语、中文等)的提示,涵盖了79 种不同的人物特征(年龄、职业、宗教、收入等)。
  • 体量:他们生成了超过65 万个故事。
  • 目标:观察 AI 在无人干预的情况下,是否会自动将某些群体与负面特征联系起来(例如,将“移民”与“贫穷”联系起来,或将“女性”与“秘书”联系起来),而无需被指示这样做。

2. 发现一:“坏习惯”无处不在

比喻:想象一个房间里坐满了 23 位不同的厨师。你让他们都做一顿饭。你可能会期待“高级”厨师做得完美,而“简单”的厨师会犯错。
现实:论文发现,每一位厨师都在他们的菜肴中加了一撮有害的香料,无论他们多么出名或昂贵。

  • 普遍性:从最大、最强大的模型到较小的开源模型,它们都产生了有害的刻板印象。
  • 共性:这不仅仅是某一个“害群之马”。几乎在所有不同公司之间,都出现了相同的有害联系。就好像它们都从同一本训练用的书籍库中学到了同样的坏习惯。
  • 规模无关紧要:让 AI 变得更“聪明”或更“大”并不能阻止这种行为。事实上,能力最强的模型有时产生的有害联系反而更多,而不是更少。

3. 发现二:“文化变色龙”效应

比喻:想象一只变色龙,它改变颜色不仅基于它栖息的树枝,还基于你对它说的语言
现实:AI 并不是只有一套偏见然后将其翻译成不同的语言。相反,它会调整其偏见以适应你所使用的语言文化

  • 本地刻板印象:如果你用英语提问,AI 可能会刻板地看待在美国常见的特定群体。如果你用西班牙语提问,它可能会刻板地看待在拉丁美洲常见的不同群体。
  • 危险:这意味着仅用英语测试 AI,就像只在绿叶上检查变色龙一样。你会错过它在红色或蓝色叶子上展现的所有其他颜色。论文认为,AI 在英语中可能看起来“安全”,但当你切换到另一种语言时,它可能充满偏见。

4. 发现三:AI 可以评判自己(但它有点盲目)

比喻:研究人员让 AI 审视自己的故事并回答“这有害吗?”,并将其与 247 名人类评委的评判进行了比较。
现实:AI 和人类总体上达成了一致(约 62% 的吻合度),但 AI 有一些有趣的盲点。

  • 对某些事过度谨慎:AI 对“性别”和“性取向”非常严格。它知道这些是敏感话题,并努力避免在这些方面产生偏见。
  • 对其他事的盲点:AI 对金钱、教育、年龄和宗教等方面却出奇地宽松。它并不认为将“穷人”与“文盲”联系起来像人类认为的那样有害。
  • 结论:AI 擅长识别我们谈论的刻板印象(如性别),但它会漏掉那些我们谈论得较少的刻板印象(如阶级或教育)。

5. 大局观

该论文得出结论,我们不能仅仅通过用英语问 AI 几个多项选择题来检查它是否“公平”。

  • 偏见隐藏在故事中:当 AI 自由写作时,偏见才会显现,而不仅仅是在回答测验时。
  • 偏见具有文化性:AI 在一种语言中可能是安全的,但在另一种语言中可能是危险的。
  • 偏见是结构性的:这不是某个模型中的故障;而是这些模型的构建和训练方式的一个特征。

简而言之:AI 故事讲述者就像镜子。如果你用英语与它们交谈,它们会向你展示美国的偏见。如果你用阿拉伯语或印地语与它们交谈,它们会展示那些文化中的本地偏见。不幸的是,几乎每一面它们举起的镜子都反映出一些有害的刻板印象,无论这面镜子声称自己多么“聪明”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →