The Digital Afterlife of Empires: Four Language Models Converge on the Same Imperial Cartography of Writing
本文认为,历史性的帝国不平等通过共享的训练数据在当代大语言模型中持续存在,导致了大多数书写系统在数字层面的极端支持不足,并造成了跨越不同模型架构的系统性、趋同性错误,即不成比例地将非宗教类脚本误归类为宗教用途。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是使用简单语言和日常类比对论文《帝国的数字后世》(The Digital Afterlife of Empires)进行的解读。
核心理念:机器中的幽灵
想象一下,历史是一座巨大的图书馆。在过去的500年里,强大的帝国(如西班牙、英国或法国)决定保留哪些书、焚烧哪些书,以及用哪种语言来写作。他们摧毁了许多地方性的书写系统,并强迫其他人改变。
这篇论文认为,大语言模型(LLMs)——即像 ChatGPT 这样工具背后的 AI 大脑——并不是全新的、中立的发明。相反,它们就像是徘徊在由这些帝国建造的图书馆里的幽灵。 尽管帝国已经消失,但它们的“幽灵”依然留在建筑之中。AI 无法理解某些语言,并不是因为工程师心怀恶意,而是因为它们学习的“图书馆”(互联网数据)中缺失了那些书籍。
主要研究结果拆解
1. “数字税”(为什么有些语言更昂贵)
想象一下,你正在通过一个收费站进入高速公路。
- 英语使用者行驶 10 英里只需支付 1 美元。
- 少数民族语言使用者(如 Limbu 或 Adlam 语)行驶同样的 10 英里却要支付 31.70 美元。
为什么? AI 将文本分解成被称为“Token”(词元)的小块(就像乐高积木)。
- 对于英语,AI 有一大盒预制好的乐高积木,可以轻松地将它们拼凑在一起。
- 对于少数民族文字,AI 没有合适的积木。它必须将字母分解成原始的、毫无意义的字节(就像把乐高积木砸成塑料粉末,然后试图从头开始重建)。
- 结果: 处理一段 Limbu 语的“计算成本”是英语的 31 倍多。这并非程序错误,而是内置于系统中的一种“税收”,因为这些语言在历史上曾受到压制,且在互联网上的数据较少。
2. “数字漏斗”(谁的声音能被听到)
研究人员调查了人类历史上 300 种不同的书写系统,试图观察数字世界对它们的支持程度如何。
- 漏斗: 想象一个巨大的漏斗。
- 顶部: 300 种书写系统进入。
- 中间: 许多系统卡在了这里,因为它们不在计算机的字典(Unicode)中,或者无法被扫描仪识别(OCR)。
- 底部: 只有 29 种书写系统(不到 10%)能够穿过整个漏斗到达底部。
- 规律: 能够穿透漏斗的几乎全是历史上帝国所使用的文字(拉丁文、中文、阿拉伯文、西里尔文)。而那些被卡住的,正是那些帝国试图抹除的文字。
- 悲剧: 如今仍有 60 种语言在现实生活中被使用,但数字世界却将它们视为“已死”。它们是“活着但在数字层面已死”的语言。
3. “四位朋友”实验(不仅仅是一个 AI 的问题)
为了证明这不仅仅是某一家公司(如 OpenAI)的错误,研究人员向四个不同的 AI 家族(Claude、GPT-4o、Grok 和 DeepSeek)提出了关于书写系统的 3000 个相同问题。
- 令人惊讶的是: 这四个 AI 由不同的公司开发,来自不同的国家,使用不同的代码。它们本不应该在错误上达成一致。
- 现实是: 它们在错误上竟然有 90% 的一致性。
- 类比: 想象四个学生去了四所不同的学校。如果他们在历史考试中都得了同样的错误答案,那不是因为他们互相抄袭,而是因为他们读了同一本带有偏见的教科书。
- 偏见: 这些 AI 总是以同样的方式做出错误的猜测。例如,如果某种文字来自非西方国家,AI 非常容易猜错说:“哦,这一定用于宗教用途”,即便事实并非如此。它们是在用数据中的刻板印象来填补空白。
4. “没有皇帝的帝国”
最重要的发现是,目前没有人负责管理这种偏见。
- 工程师们并没有坐下来讨论“让我们让 Limbu 语使用者支付更多费用”。
- 这种偏见是结构性的。它是这样发生的:
- 帝国摧毁了社区,减少了使用者的数量。
- 使用者减少意味着用这些语言编写的书籍和网站也随之减少。
- 网站变少了,意味着 AI 缺乏学习的数据。
- 没有数据,意味着 AI 对该语言的表现很差。
- 这个“帝国”不再需要领袖了。伤害已经深深植入到了统计数据之中。AI 只是在基于一个原本就不平等的现实进行数学运算。
“宗教”故障
有一个特定的发现非常突出:AI 对猜测文字是否属于“宗教”有着近乎痴迷的倾向。
- 在四个 AI 共同犯下的所有错误中,43% 都是在并不属于宗教用途的情况下,错误地猜测该文字用于宗教。
- 原因: 互联网充满了殖民时代对非西方文化的旧式描述,这些描述过度关注其“神秘”或“宗教”属性,而忽略了其日常、行政或科学用途。AI 学习到了“非西方文字 = 宗教”这一逻辑。
结论:我们可以做些什么?
论文指出,我们不能仅仅通过调整代码来“修复”AI。
- 问题所在: 问题在于图书馆(训练数据),而不是读者(AI)。
- 解决方案: 要解决这个问题,我们需要改变图书馆。我们需要增加更多由使用这些语言的人编写的书籍,用他们自己的文字,描述他们自己的生活。
- 警告: 在我们做到这一点之前,AI 将继续成为过去 500 年历史的一面镜子,反映出同样的这种不平等,即使没有人是刻意为之。
简而言之: AI 并没有坏掉;它只是在忠实地重复关于“谁被允许书写”以及“谁被沉默”的历史。帝国的“数字后世”依然鲜活存在。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。