← 最新论文
💬 NLP

Do Chinese models speak Chinese languages?

本研究揭示,尽管中国拥有多元的语言生态,但其领先的开源大语言模型却展现出与西方模型惊人相似的多语言性能特征——在汉语、法语和德语等主要全球语言上表现优异,却往往无法支持哈萨克语和维吾尔语等少数语言——这表明全球基准测试实践和共享训练资源正推动语言能力趋向同质化,而非优先发展本地化语言。

原作者: Andrea W Wen-Yi, Unso Eun Seo Jo, David Mimno

发布于 2026-05-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Andrea W Wen-Yi, Unso Eun Seo Jo, David Mimno

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,人工智能的世界就像一场规模宏大的全球烹饪大赛。来自不同国家的厨师(模型开发者)们正试图烹制出一锅终极的“通用语言大锅”,能够理解并说出地球上的每一种语言。

这篇论文提出了一个具体问题:拥有满屋多样化本地食材的中国厨师,真的会使用这些食材吗?还是说,他们只是遵循与欧美厨师相同的食谱?

以下是他们研究发现的拆解,使用了简单的类比:

1. 背景:多样化的厨房 vs. 全球菜单

中国就像一个巨大的厨房,拥有 14 亿讲普通话的人口,以及数百种其他方言和少数民族语言(如维吾尔语、藏语和哈萨克语)。人们会预期中国厨师拥有特殊优势:他们能轻松获取这些本地食材。

然而,这里有一个陷阱。为了赢得比赛并在全球成名,厨师们要接受一个主要由英语使用者组成的评审团评判,他们使用的是基于英语的评分表(基准测试)。如果你想被认可为顶级厨师,就必须让你的菜肴迎合这些讲英语的评委的口味。

2. 实验:品尝菜肴

研究人员品尝了 6 位中国厨师(如通义千问、Yi 和深度求索)和 4 位西方厨师(如 Llama 和 Mistral)的菜肴。他们在 21 种不同的“语言”上进行了测试,范围从法语和德语等主要语言,到中国少数民族语言等本地语言。

他们使用了三种不同的方式来品尝食物:

  • 翻译测试:模型能否在不丢失风味(含义)的情况下,将句子从英语翻译成另一种语言?
  • 阅读测试:模型能否阅读外语故事并正确回答相关问题?
  • 命名游戏:模型能否查看一段文本并正确地说出“这是用哈萨克语写的”或“这是用藏语写的”?

3. 结果:“普通话例外”

结果出奇地一致,只有一个重大例外。

  • “克隆”效应:对于测试的几乎所有语言(法语、德语、日语、韩语等),中国模型和西方模型的表现几乎完全相同。就好像两组厨师都在遵循完全相同的全球食谱书一样。论文发现两者之间存在 93% 的相关性。如果西方模型擅长法语,中国模型也擅长法语。如果西方模型在少数民族语言上表现挣扎,中国模型也同样挣扎。
  • 普通话超能力:中国厨师真正超越西方厨师的唯一时刻,是在普通话方面。因为他们拥有更多的普通话数据并专注于此,他们的“普通话菜肴”比西方厨师的版本美味得多。
  • 少数民族语言盲点:这是令人难过的一部分。尽管拥有本地食材的获取渠道,中国模型在处理中国少数民族语言(如维吾尔语和哈萨克语)方面同样糟糕,与西方模型无异。事实上,许多中国模型甚至无法识别一段文本是用维吾尔语或哈萨克语写的。他们对待这些本地语言的方式,就像它们不存在一样,正如西方模型所做的那样。

4. 为什么会发生这种情况?

论文提出了两个主要原因:

  1. “全球评分表”的压力:为了成名并获得资金,中国开发者痴迷于赢得全球基准测试。这些基准测试大多使用英语或主要欧洲语言。因此,他们并没有利用其独有的本地中国数据来构建真正多样化的模型,而是优化模型以在全球记分牌上看起来更出色。
  2. “普通话优先”政策:虽然中国历史上曾试图保护其多种语言,但近期的政策已高度集中于将普通话打造为整个国家唯一的统一语言。人工智能开发者似乎正在追随这一趋势:他们优先考虑普通话(“超级语言”),而忽视其他语言。

结论

该论文得出结论,尽管中国拥有独特的语言景观,并具备构建真正与其多样化人口对话的模型的潜力,但中国模型已经变得“同质化”

它们本质上是西方模型的碳素复制品,只有一个小小的升级:它们的普通话说得稍好一些。它们没有利用其独特地位来拯救或提升中国境内数百种其他语言。相反,它们都在烹制同一道全球菜肴,将本地和少数民族的风味留在了货架上。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →