AI systems and the reproduction of (standard) language ideologies in World Englishes
本文认为,人工智能系统通过在其设计与使用过程中优待“内圈”规范并边缘化非主流英语,从而复制了标准的语言意识形态,同时通过一种既使语言同质化又使其多元化的“标准化悖论”,重新引发了关于世界英语中语言合法性与所有权的争论。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,英语是一座规模宏大、繁忙喧嚣的城市。长期以来,城市规划师们(教师、编辑和词典编纂者)认定只有一个特定的社区——“标准”区——才是真正的、正确的城市。其他所有人的社区,带着他们独特的俚语、口音和语法,都被视为混乱的建筑工地,或者是“破碎版”的真实事物。这种观念被称为语言意识形态(language ideology):一套关于哪种说话方式是“好”的、哪种是“坏”的信念,常被用来评判一个人的智力或价值。
现在,新的城市规划师进场了:人工智能(AI)。这些是被称为“大语言模型”(LLMs)的巨型计算机大脑,它们阅读了互联网上几乎所有的内容来学习如何交谈。你可能会想:“太棒了!如果它们读了所有东西,它们就会学会每个社区的风格!”但转折在于:这些 AI 大脑是基于旧蓝图构建的。它们倾向于认为“标准”社区才是唯一重要的,并且经常将其他所有人的说话方式视为错误。这篇论文提出了一个大问题:这些 AI 工具是在复制旧有的、不公平的城市规则,还是在无意中创造了一个让所有不同社区都能被听见的空间?
AI 城市规划师与“Delve”侦探故事
这篇由 Kingsley Ugwuqi 撰写的论文调查了 AI 系统是如何充当英语语言严格的守门人的。作者认为,AI 并不是一个中立的工具;它是一个意识形态参与者(ideological actor)。把 AI 想象成一个动作极快、极其自信的机器人厨师。如果你给它一本食谱(训练数据),而这本食谱大多包含来自英国和美国高级餐厅的食谱,那么这个机器人就会学到:只有这些食谱才是“真正的食物”。如果你要求它烹饪一道来自尼日利亚或印度街头小贩的菜肴,它可能会感到困惑,或者更糟,它可能会试图通过添加不属于原菜肴的配料来“修正”这道菜,使其尝起来像高级餐厅的版本,而不是原汁原味。
论文发现,这些 AI 系统在创建过程中的每一步都在复制标准语言意识形态:
- 训练数据: AI 阅读的“食谱书”充斥着来自“核心圈”(美国、英国等)的文本。这使得 AI 认为这些国家的人说话的方式是默认标准,而其他一切都是故障。
- 测试: 当科学家测试 AI 是否聪明时,他们使用的是用标准美式英语编写的考试。如果 AI 尝试回答一个用非裔美国英语(AAVE)或尼日利亚英语编写的问题,它往往会失败,或者给出粗鲁、困惑的回答。这就像是用驾驶员听不懂的语言进行驾驶员测试,然后说这个驾驶员技术很差。
- 人工干预: 即使在人类帮助训练 AI(通过纠正其错误)时,他们也经常被要求让 AI 听起来“正确”。这通常意味着抹去任何非标准英语中的独特风味,强迫 AI 听起来像一个来自全球北方的、通用的、精致的机器人。
“Delve”争议:当一个单词变成一种罪名
为了展示这一切如何在现实世界中发生,论文讲述了一个关于单个单词——“delve”(意为深入研究某个话题)——的迷人故事。
最近,人们开始注意到 AI 聊天机器人非常喜欢使用“delve”这个词。很快,网上掀起了一波投诉。来自美国和英国的人开始说:“如果你使用 'delve' 这个词,你一定是个机器人!”他们把这个词当作一种泄露身份的秘密代码,以此证明写作者是虚假的。
论文指出,这种反应实际上是一个陷阱。
- 指控: 一些评论人士声称,因为 AI 过度使用“delve”,所以它一定是在模仿非洲英语使用者,他们声称这些人使用该词过于频繁。他们称之为一种“侮辱”,暗示 AI 听起来像来自非洲是不好的。
- 事实核查: 作者检查了数据,发现“delve”在很久以前就已经在包括亚洲和非洲在内的世界许多地方被广泛使用了,甚至在 AI 出现之前。这个词并不是“具有 AI 感”的,它只是某些人使用的普通单词。
- 反击: 当来自全球南方(如尼日利亚和印度)的人看到这些投诉时,他们进行了强力回击。他们指出,他们在学校里就被教导要使用像“delve”这样的词。他们辩称,称他们的英语是“虚假”或“AI 生成”的,是另一种说“你的英语不够好,配不上我们”的新方式。这是现代版的殖民统治,即来自强大国家的人决定什么才算“真实”的英语,以及什么算作“可疑”的。
论文暗示,这不仅仅关乎一个单词,而是关乎谁拥有决定权。当一名富有的美国投资者发推特称使用“delve”证明你在作弊时,他正在利用他的权力来监管他人的表达方式。论文表明,AI 已成为一个新的战场,在这里,关于谁拥有英语所有权的旧争论正在重新上演。
“标准化悖论”:一线希望?
情况真的如此悲观吗?论文提出了一个奇怪的转折,称为**“标准化悖论”(standardization paradox)**。
想象一面巨大的镜子(AI)。在这一侧,镜子正在被擦拭,只为了展示一张完美的、标准的脸(英美英语)。这使得英语看起来更加统一且乏味。但在另一侧,由于这面镜子非常巨大,反射了来自各种不同来源的数据,它同时也开始呈现出所有其他面孔的轮廓。
- 好消息: 由于 AI 是在海量数据上训练的,它接触到的英语多样性比以往任何时候都多。一些研究人员正试图构建“适配器”(类似于小型插件模块),这些模块可以教 AI 说特定的方言,而不会破坏整个系统。
- 坏消息: 论文警告说,这并不意味着 AI 突然变得公平了。训练 AI 的人通常报酬微薄,并且被迫遵循严格的规则,从而抹去了他们自己的语言特色。因此,虽然 AI “听到了”多样性,但它通常是以一种标准化的、西方的声音在“说话”。
这为什么与你有关
论文总结道,这不仅仅是计算机科学家的技术问题,也是一个现实世界的问题。如果一个 AI 导师无法理解一名尼日利亚学生的英语,那么这名学生可能会不及格。如果一个 AI 招聘工具拒绝了一份用印度英语编写的简历,那个人就会失去工作。如果一个录音设备无法理解一位原住民社区长者的语言,那么他们的历史可能会因此失传。
作者认为,我们必须停止将 AI 视为一个中立的工具,而应将其视为一个既可以强化旧有偏见,也可以帮助我们建立一个更具包容性世界的系统。挑战在于,我们需要设计出这样的系统,使它们能够识别出:英语不是一种单一的、只有一种“正确”说话方式的语言,而是一个由许多种不同且同样有效的语言组成的家族。在修复了“食谱书”和“品尝者”之前,AI 将会持续供应那份陈旧、排外的菜单。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。