← 最新论文
💬 NLP

Which English Do LLMs Prefer? Triangulating Structural Bias Towards American English in Foundation Models

该论文通过构建包含 1813 组英美变体的语料库并引入无训练方法 DiAlign,从预训练语料库偏差、分词成本及生成偏好三个维度系统揭示了大型语言模型在开发全过程中对美式英语的结构性偏见,指出这种以美式英语为默认规范的现象加剧了全球 AI 部署中的语言同质化与认知不公。

原作者: Mir Tafseer Nayeem, Davood Rafiei

发布于 2026-04-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Mir Tafseer Nayeem, Davood Rafiei

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文就像是一次对大型语言模型(LLM,比如 ChatGPT、Claude 等)的"语言体检"。

研究人员发现,虽然这些 AI 号称能理解全球英语,但它们其实有一个巨大的“隐形偏见”:它们更偏爱“美式英语”(AmE),而把“英式英语”(BrE)当成了二等公民

为了让你轻松理解,我们可以把整个研究过程想象成"一家跨国连锁餐厅的菜单风波"。

1. 核心问题:为什么菜单上只有“美式汉堡”?

想象一下,你走进一家号称服务全球的顶级餐厅(AI 模型)。你想点一份“英式下午茶”(用英式英语交流),但服务员(AI)却总是给你端上来“美式汉堡”(美式英语)。

  • 现状:虽然英国英语在世界上很多前殖民地(如印度、新加坡、尼日利亚)是官方语言,也是很多国际机构的标准,但现在的 AI 系统里,默认选项几乎全是“美式英语”。
  • 后果:这不仅仅是拼写不同(比如 color vs colour)的小问题,这就像是你明明想要“土豆”(potato),AI 却坚持给你“薯条”(fries),或者把“地铁”(underground)强行说成“地铁”(subway)。这种偏见会让非美国用户感到被忽视,甚至觉得自己的语言习惯是“错误”的。

2. 研究方法:他们是怎么发现这个偏见的?

研究人员没有只问 AI“你喜欢哪种英语”,而是像侦探一样,从三个环节层层深入,找出了偏见的根源

第一站:原材料仓库(预训练数据)

  • 比喻:想象 AI 是在一个巨大的图书馆里学习的。研究人员去检查了这个图书馆的藏书。
  • 发现:图书馆里关于“美式英语”的书堆得像山一样高,而“英式英语”的书虽然也有,但比例少得多。
  • 数据:他们检查了 6 个主要的数据集(比如维基百科、网页爬虫数据),发现美式英语的词汇出现频率比英式英语高出 70% 以上。这就好比厨师只买了 70% 的牛肉,却指望做出 50% 的牛肉和 50% 的羊肉,结果肯定全是牛肉味。

第二站:切菜刀(分词器 Tokenizer)

  • 比喻:AI 不是一字一句读文章的,它是把句子切成小块(Token)来处理的。这就好比厨师切菜。
  • 发现:这把“切菜刀”对美式英语很顺手,切得很细碎、很流畅;但对英式英语,这把刀就显得很笨拙,经常要把一个词切成好几块(比如把 travelling 切成 trav + ell + ing)。
  • 后果:切得越碎,处理起来越慢,占用的“内存”也越多。这意味着,英式英语在 AI 眼里是“难吃”且“费钱”的食材。研究发现,英式词汇往往需要更多的“碎片”才能被 AI 理解。

第三站:上菜环节(模型生成)

  • 比喻:最后,研究人员让 AI 自己写东西。
  • 发现:即使你明确告诉 AI:“请用英式英语回答”,它还是忍不住偷偷把 colour 改成 color,把 lift 改成 elevator
  • 数据:在默认情况下,AI 生成的内容里,70% 到 80% 都是美式英语。哪怕你特意要求它说英式英语,它还是有一半以上的概率“露馅”,偷偷变回美式风格。

3. 为什么会这样?(后殖民视角的解读)

论文用了一个很深刻的视角来解释:这不是语言本身的问题,而是权力的问题。

  • 历史背景:英国曾经通过殖民把英语带到了世界各地(所以很多国家用英式英语);但后来美国通过好莱坞、互联网和科技巨头,把美式英语变成了“全球默认值”。
  • AI 的偏见:AI 只是忠实地反映了这种历史权力结构。因为互联网上美国的内容最多,AI 就认为“美式英语”才是标准的、正确的,而把其他变体当成了“方言”或“错误”。

4. 这意味着什么?(为什么我们要关心?)

这不仅仅是拼写对错的小事,它关乎公平

  • 认知不公:如果 AI 总是纠正你的英式英语,或者用美式习惯来回答你的问题,这会让那些习惯英式英语的人(比如英国人、印度人、澳大利亚人)觉得自己的文化习惯不被尊重。
  • 全球影响:随着 AI 进入法律、医疗、教育等关键领域,如果它只懂“美式标准”,那么全球其他地方的用户可能会在不知不觉中受到误导,或者在沟通中处于劣势。

5. 解决方案:如何把餐厅改造成“国际美食”?

研究人员提出了一些简单的改进建议:

  1. 平衡原材料:在训练 AI 时,刻意多找一些英式英语(以及其他英语变体)的书籍和网页,不要让美式英语一家独大。
  2. 换一把好刀:重新设计“分词器”,确保它切英式词汇时和切美式词汇一样顺滑,不要让它觉得英式英语很难处理。
  3. 动态检测:他们开发了一个叫 DIALIGN 的工具,就像是一个“口味检测器”,能自动检查 AI 生成的内容是偏向美式还是英式,帮助开发者及时调整。

总结

这篇论文告诉我们:现在的 AI 并不是中立的,它带着深深的“美式滤镜”

就像一家餐厅如果只卖美式汉堡,却标榜自己是“世界美食”,那是不诚实的。为了让 AI 真正服务于全球用户,我们需要打破这种“美式默认”的惯性,让英式英语(以及其他英语变体)在 AI 的世界里也能挺直腰杆,被平等对待。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →