← 最新论文
💬 NLP

Standard Language Ideology in AI-Generated Language

本文引入了“标准人工智能生成语言意识形态”的概念以及一个社会技术分类法,用以分析大型语言模型如何通过合法化和抹除等机制强化标准语言偏见,并最终针对保护语言多样性和确保更公正的人工智能未来提出建议。

原作者: Genevieve Smith, Eve Fleisig, Ishita Rustagi, Xavier Yin

发布于 2026-06-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Genevieve Smith, Eve Fleisig, Ishita Rustagi, Xavier Yin

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,像 ChatGPT 这样的大型语言模型(LLM)就像一位读遍了互联网上几乎所有内容的、超级聪明的超级图书管理员。你向这位图书管理员提问,他们会为你写出一个故事或一个答案。

这篇论文指出,这位图书管理员并不是中立的。相反,他们有一种非常强烈且隐形的偏见:他们认为只有一种特定的说话方式才是“正确”、“聪明”且“专业”的,而所有其他的表达方式都是“破碎的”、“滑稽的”或“错误的”。

作者将这种偏见称为标准语言意识形态(Standard Language Ideology)。在现实世界中,这通常意味着图书管理员更青睐“标准美式英语”(即美国富有、白人、中产阶级人群的说话方式),并将其他一切视为低等的。

以下是使用简单类比对该论文核心思想的拆解:

1. “金标准”过滤器

想象一下,图书管理员的桌子上有一个过滤器。当你在上面写着像非裔美国英语(AAE)或某种地域口音的便条递给他们时,过滤器会在他们阅读之前,自动将其重写为“标准美式英语”。

  • 问题所在: 论文称之为合法化(Legitimation)。AI 将“标准”版本视为唯一合法的沟通方式。
  • 结果: 如果你用自己的方言说话,AI 可能会忽视你、误解你,或者给你一个较差的答案。这就像一家餐厅只为穿着特定西装的人提供食物,并要求其他所有人必须先换好衣服才能点餐。

2. 对某些顾客的“劣质服务”

因为图书管理员读过的书大多是用“标准”英语写的,所以他们很难理解其他方言。

  • 问题所在: 这是服务质量不平等(Unequal Quality of Service)。如果你用一种少数群体使用的方言提问,AI 可能会感到困惑、拒绝回答,甚至仅仅因为你使用的词汇而将你的问题标记为“仇恨言论”。
  • 结果: 使用这些方言的人被迫进行“语码转换”(即假装像“标准”群体那样说话),才能获得有用的答案。这就像进入一栋建筑前必须戴上面具,以便保安能让你进去一样。

3. “卡通化”效应

有时,AI 确实会尝试模仿你的方言,但它做得非常刻板或滑稽。

  • 问题所在: 这是刻板印象与种族化(Stereotyping and Racialization)。如果你要求 AI 用某种方言写作,它通常会产生一种漫画式的效果——一种充满了刻板印象、侮辱性词汇或现实中无人使用的“破碎”语法的卡通版本。
  • 结果: 这强化了这样一种观念:那些以这种方式说话的人是没受过教育或很滑稽的。这就像喜剧演员在拙劣地模仿某个群体,但 AI 却将其呈现为对该群体说话方式的严肃、事实性的呈现。

4. 图书馆里的“小偷”

AI 可以学会说一种少数群体的方言,但它是未经那些真正使用该语言的人同意的情况下进行的。

  • 问题所在: 这是挪用(Appropriation)。AI 拿走了某种文化中“酷”或“独特”的部分,将其变成一种产品卖给所有人,而原始的使用者却一无所获。
  • 结果: 一个白人可以使用 AI 听起来像是属于黑人社区,而无需承担该社区面临的种族主义。这就像一个小偷偷走了家族的传家宝食谱,把它印在麦片盒上并以此牟利,而那个家族既得不到名誉也得不到钱。

5. “橡皮擦”

最后,AI 有时会直接删除这些方言。

  • 问题所在: 这是抹除(Erasure)。为了规避刻板印象或挪用的风险,开发者可能会直接设定程序,让 AI 永远不要 使用这些方言。
  • 结果: 如果你想让 AI 用你的母语方言回复,它根本做不到。这就像一家图书馆决定不再进购某种语言的书籍,因为“管理起来太难了”,从而在数字世界中让这种语言变得隐形。

核心问题:AI 应该怎么做?

论文提出了一个难题:AI 应该为了保险起见只坚持使用“标准”英语,还是应该尝试说每一种方言?

  • 如果它坚持使用“标准”英语,它会伤害那些不以这种方式说话的人。
  • 如果它尝试说每一种方言,它就有可能嘲弄或窃取这些文化。

作者表示,这不仅仅是一个“技术修复”问题(比如仅仅增加更多数据),因为这是一个权力问题,而不仅仅是代码问题。构建 AI 的人(主要是美国大型科技公司的人)决定了什么是“标准”,而他们并没有询问那些被忽视语言的群体。

解决方案:谁掌握钥匙?

作者认为,我们不应该只是试图让 AI “减少偏见”,而是需要改变谁在掌权。他们提出了三个主要想法:

  1. 衡量伤害: 我们需要测试 AI,不仅是看它的速度有多快,还要看它如何对待不同的方言。它是在进行羞辱吗?它是在忽视人们吗?
  2. 让社区建立自己的工具: 与其让大公司从社区获取数据,不如让这些社区建立自己的 AI 工具。(论文提到了非洲和新西兰的一些团体已经在这样做)。
  3. 分享权力: 如果大公司想要使用某个社区的语言,他们需要与该社区坐下来,让该社区做出决策,并分享利润。这不仅仅是“咨询”社区,而是要让社区拥有决策权。

简而言之: 论文认为,目前的 AI 正在强化“某些说话方式比其他方式更好”的观念。要解决这个问题,我们不能仅仅微调软件;我们必须把权力还给那些语言正在被使用、被忽视或被嘲弄的人们。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →