← 最新论文
💬 NLP

Structural Silence: When AI Infrastructure Fails Speakers of Underrepresented Languages

本文认为,AI 基础设施通过结构性障碍——包括严重的数据匮乏、分词效率低下以及连接性差距——系统性地使孟加拉语等代表性不足语言的使用者处于劣势,而非仅仅是孤立的技术限制,因此有必要转向以公平为导向、以离线优先的设计策略。

原作者: Avijit Roy, Proma Roy

发布于 2026-08-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Avijit Roy, Proma Roy

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

机器中的无形之墙

想象一下,互联网就像一座巨大且繁忙的图书馆,记录了人类历史上所有的书籍、视频和对话。这就是人工智能(AI)用来学习如何说话、写作和解决问题的“训练数据”。长期以来,这座图书馆几乎完全由英文书籍组成。因为 AI 只能阅读英文书籍,它成为了英文专家,却难以理解其他任何语言。这就是“低资源语言”的核心问题:如果一种语言在数字世界中代表性不足,那么旨在帮助使用该语言的人群所构建的 AI,从诞生之初就带有缺陷。

要理解为什么这很重要,我们需要了解两个简单的概念。首先,**认知负荷(Cognitive Load)**就像是你大脑背负的一个背包。当你学习新事物时,你的背包会变得越来越重。如果你必须在学习一个困难数学概念的同时,还要将其从一种你不熟悉的语言中翻译出来,你的背包就会沉重到破裂,导致你无法学习数学。其次,**分词(Tokenization)**是计算机将单词切分成微小碎片以理解它们的方式。可以把它想象成一个拼图:如果一种语言的拼图碎片切割得非常完美,图像就会清晰;如果另一种语言的碎片被切成了细碎、杂乱的碎片,计算机就必须付出更多努力才能把图像重新拼凑起来。

为什么人们应该关心这个问题?因为 AI 正被宣传为一种神奇的导师,可以教任何人、在任何地方学习编程或解决问题。但如果这位导师只读过英文书、只说英文,并且只有在你拥有超高速互联网连接时才能工作,那么它就辜负了那些最需要它的群体:比如使用孟加拉语的农村地区的学生。本文研究了为什么对于他们来说,这个“神奇”的导师实际上是失灵的——这并非因为技术不好,而是因为构建它的基础从未为他们设计。


无声的失败:为什么 AI 忽视了孟加拉语使用者

这篇题为《结构性沉默》(Structural Silence)的论文讲述了 AI 基础设施如何无意中在代表性不足的语言使用者周围筑起了一道墙,并以孟加拉语作为案例研究。孟加拉语是一门庞大的语言,拥有约 2.85 亿使用者——约占全球人口的 4%。它拥有超过 1400 年的历史,是两个国家的官方语言。你可能会认为,这样一种规模的语言在 AI 世界里应该是超级巨星。但作者发现,孟生的孟加拉语并没有成为明星,反而正被四种特定的结构性失败所“噤声”,这些失败像叠起来的纸牌屋一样层层堆叠。

1. 空荡的书架(网络存在感差距)

想象一下,你试图通过给机器人一间图书馆来教它说孟加拉语。问题在于,这座图书馆几乎是空的。尽管孟加拉语使用者占全球 4%,但该语言在互联网上的内容占比却不足 0.5%。相比之下,拥有相似母语使用者数量的英语,其在网络内容中的占比约为 49.5%

AI 模型通过“爬取”网络来获取文本进行训练。由于网络上的孟加拉语文本如此稀少,AI 得到的练习机会极少。这就像是通过听一首歌来学习小提琴,而你的英文朋友却能听上一百万首歌。作者指出,这不仅仅是互联网接入权限的问题,更是关于几十年来谁一直在网上撰写和发布内容的问题。结果呢?AI 在学习第一个单词之前,就已经在训练中处于巨大的劣势。

2. 数据饥渴(训练 Token 缺失)

由于网络上的孟加拉语内容如此匮乏,AI 会出现“Token 饥饿”。Token 是计算机用于学习的微小文本块。论文强调了一个令人震惊的差距:在主要的训练数据集中,每 1 个孟加拉语 Token 对应着 67 个英语 Token

这可以想象成一种饮食习惯。如果英语可以享用 67 盘丰盛的大餐,那么孟加拉语只能得到一个碎屑。作者指出,即使在“多语言”模型(尝试学习多种语言的模型)中,孟加拉语的表现仍然远逊于英语。数据不仅是稀缺,而且稀缺到 AI 根本没有看到足够的例子来正确学习该语言的规则。

3. 破碎的拼图碎片(分词惩罚)

这里情况变得复杂了。即使你给了 AI 与英语相同数量的孟加拉语文本,它仍然会表现挣扎。为什么?因为计算机切割单词的方式。

英语使用拉丁字母,对于计算机来说相对容易切割。而孟加拉语使用一种“音节文字”(alphasyllabary)脚本,其中的字母会与微小的符号(变音符号)结合,并以复杂的方式连接在一起。标准的计算机工具是为英语设计的,会将孟加拉语单词切成细碎、杂乱的碎片。作者称之为“分词惩罚”。

想象你正在组装一个拼图。对于英语,碎片是形状清晰的大块;对于孟加拉语,同样的图像被切成了数千个细小、锯齿状的碎片。计算机必须付出更多努力才能弄清楚这些碎片如何组合在一起。这意味着,为了理解相同程度的含义,孟加拉语模型需要“吃”下更多的数据。论文建议,为了达到与英语相同的性能,孟加拉语模型需要大幅增加数据量,以克服这种混乱的切割问题。

4. 云端陷阱(连接性排斥)

最后的失败不在于 AI 的大脑,而在于 AI 的身体。如今大多数 AI 工具都存在于“云端”。这意味着你必须通过互联网将问题发送到巨大的服务器,服务器进行思考后将答案传回。

论文指出了一个残酷的现实:在许多孟加拉语使用者居住的孟加拉国农村地区,个人互联网普及率仅为 36.5%,而城市地区为 71.4%。此外,只有 9.2% 的家庭拥有电脑。如果一个 AI 导师要求必须有持续、快速的网络连接才能工作,那么对于农村学生来说,它在功能上是隐形的。这就像是设计了一座只有当你拥有私人飞机才能到达时才会开放的图书馆。作者认为,这不仅仅是不便,这是一种设计选择,它假设每个人都已经实现了联网,从而有效地将那些最需要帮助的人拒之门外。

双重负担:沉重的背包

当这四种失败结合在一起时,结果就是学习者的“双重负担”。想象一名农村地区的学生试图学习计算机编程:

  1. 语言障碍: AI 导师用英文解释代码(因为它主要基于英文训练)。学生在试图理解复杂的编程概念时,必须在脑海中同时进行英文翻译。
  2. 认知过载: 他们的脑力正在同时处理两项艰巨的任务:翻译语言学习数学。他们的“背包”(工作记忆)变得太重,导致他们无法理解。

论文引用研究表明,当学生在缺乏支持的情况下使用第二语言学习技术概念时,他们的学习效果更差,保留的信息也更少。对于孟加拉语使用者来说,一个只会说英语的 AI 导师不仅是不方便,而且往往是无法有效使用的。

论文建议我们该怎么做

作者谨慎地指出,这不仅仅是一个“修复代码”的问题。他们认为,我们不能仅仅通过微调 AI 来使其奏效。整个基础是建立在排斥非英语使用者的假设之上的。

  • 停止将数据视为次要项目: 论文建议,构建孟加拉语等语言的数据集不应被视为“初步工作”。它应该被视为一项重大的科学贡献,其重要性不亚于发明一个新的 AI 模型。
  • 坚持“离线优先”: 我们不应该假设每个人都有互联网,我们应该设计可以在手机或电脑上运行、无需联网的 AI 工具。这并不是一个“低配版”的 AI;这是世界上唯一真正有效的版本。
  • 倾听语言学家: 论文呼吁语言学家介入,解释为什么标准计算机工具在处理孟加拉语等语言时会失效。他们拥有能够识别出工程师可能忽略的这些结构性缺陷的专业词汇。

核心结论

这篇论文并不声称已经为孟加拉语使用者构建了一个完美的 AI。相反,它扮演着侦探的角色,指出了当前系统失效的四个结构性原因。它表明,性能上的差距并非因为孟加拉语是一种“难学”的语言,也不是因为学生不够聪明。而是因为 AI 基础设施在设计时是以英语为中心的——从它阅读的书籍到它切割单词的方式,再到它对每个人都拥有高速互联网连接的假设。在这些结构性沉默被修复之前,AI 作为通用教师的承诺,将仅仅是少数人的特权。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →