← 最新论文
💬 NLP

Measuring the Cross-Lingual Comprehension Gap: How the language of the evidence shapes what language models understand

本研究引入了跨语言理解差距(CLCG)概念,旨在证明语言模型在非英语语言中的理解能力显著低于英语,从而揭示了以英语为中心的评估过程高估了低资源语言用户的表现。

原作者: Rafael da Silva, Jeff Eicher

发布于 2026-08-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Rafael da Silva, Jeff Eicher

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在测试一个非常聪明的机器人,它能够阅读并回答问题。你给它一个英文故事,问它一个问题,它答对了。现在,你给它完全相同的故事,但这次是用西班牙语、法语或一种在互联网上书籍极少的语言编写的。这个机器人是否仍然能同样好地理解这个故事?这是人工智能领域,特别是被称为“自然语言处理”的一个领域中的一个重大问题。科学家们早就知道,这些 AI 模型通常比其他语言更擅长英语,但一直很难解释其中的原因。是因为机器人还没读过足够多的该语言书籍吗?是因为翻译不好吗?还是因为当词汇改变时,机器人根本无法“理解”其含义?为了解决这个问题,研究人员需要一种方法来测试机器人的大脑,而不改变其他任何东西——不使用新问题,不使用不同的故事,只是换一种语言。

这篇题为《衡量跨语言理解差距》(Measuring the Cross-Lingual Comprehension Gap)的论文,就像是一个终于隔离出这一特定问题的科学侦探故事。研究人员构建了一套庞大且完美匹配的测试集,包含 559 篇文章,并将其翻译成 18 种不同的语言,涵盖了从广泛使用的葡萄牙语到非常罕见的方言如 Fon 和 Ayacucho Quechua。他们向五个不同的 AI 模型提出了关于这些文章的完全相同的问题。其中的诀窍在于,问题和“正确”答案始终是英文,所以机器人不需要在编写新语言方面挣扎;它只需要阅读理解这种新语言。通过这样做,他们可以精确测量由于故事使用了不同的语言而导致机器人损失了多少“理解力”。他们发现了一个清晰、可衡量的差距:当故事不是英文时,AI 的理解能力显著下降,尤其是在处理数字资源较少的语言时。这项研究证明,仅仅因为 AI 精通英语,并不意味着它在每种其他语言中都同样聪明,并且它表明我们可能高估了这些机器人为使用其他语言的人群所提供的服务水平。

语言陷阱

把语言模型想象成一个非常聪明的学生,他读遍了学校图书馆里的每一本书,但几乎所有的书都是英文的。如果你给他一份用英文编写的历史测试卷,他能拿高分。但如果给他一份完全相同的测试卷,只不过故事被翻译成了一种他几乎从未见过的语言,比如某个小社区使用的稀有方言呢?你可能会预期他表现得同样出色,假设他的“大脑”足够聪明能够理解出来。但这篇文章表明,这个学生的思维实际上开始变得模糊了。

研究人员将这种模糊称为跨语言理解差距(CLCG)。它是指 AI 理解英文故事的能力与理解该完全相同故事在另一种语言中的能力之间的差异。为了衡量这一点,他们并没有从互联网上随机抓取测试题。相反,他们构建了一个数据的“平行宇宙”。他们选取了 559 篇文章(主要来自一个多语言出版来源),并将它们在 18 种不同的语言中完美地对齐。这就像拥有 18 本完全相同的推理小说,每种语言一本。

然后,他们设置了一个严格的实验。他们要求五个不同的 AI 模型(来自五个不同的实验室)阅读这些故事并回答问题。神奇之处在于:问题和“金标准”答案始终是英文。AI 不需要用西班牙语或斯瓦希里语来写出它的答案;它只需要阅读西班牙语或斯瓦希里语的故事,然后用英文给出答案。这至关重要,因为它排除了 AI 在新语言方面“写作能力差”的问题。如果 AI 答错了,那不是因为它无法组织词汇,而是因为它没有理解故事。

结果:理解力的明显下降

结果就像是在观察一名跑步者从平坦的跑道切换到泥泞的田野时速度减慢。当 AI 阅读英文故事时,得分很高。但当同样的故事以 16 种目标语言呈现时,得分下降了。

研究发现,当从英语切换到其他语言时,AI 的表现平均下降了约 17%。在论文的术语中,这是一个 0.078 的差距(在以越高越好的量表中衡量)。这不仅仅是一个微小的故障;这是一个显著的理解力损失。

研究人员还观察了语言的“丰富程度”是否会产生影响。他们使用了一个系统,根据各种语言拥有的数字资源(如书籍和网站)的数量对其进行排名。他们发现了一个清晰的模式:语言拥有的资源越少,差距就越大。

  • 高资源语言(如作为基准的葡萄牙语)与英语相比仍有很小的差距。
  • 低资源语言(如 Fon 或 Ayacucho Quechua)的差距要大得多。

例如,当文本处于低资源语言时,AI 在回答关于故事“目的”或复杂推论的问题时,表现明显变差。论文指出,AI 不仅仅是在“忘记”单词;它在缺乏数字“辅助轮”的情况下,难以拼凑出整个故事的含义。

它排除了什么(以及它没有排除什么)

研究人员非常谨慎地排除了导致得分下降的其他原因。

  • 不是翻译质量问题: 他们使用了来自专业来源的高质量人工翻译文本,因此故事本身质量很高。差距并不是因为翻译破碎,而是因为 AI 无法领悟其含义。
  • 不只是记忆问题: 他们检查了 AI 是否只是在“背诵”英文版本的故事。他们测试了在 AI 训练数据截止日期之后发表的文章(这意味着 AI 此前不应该见过这些文章)。差距依然存在,这证明了 AI 确实在尝试阅读和理解,而不仅仅是在背诵记忆的事实。
  • 不只是问题类型的问题: 他们测试了不同类型的题目,从简单的“寻找单词”任务到复杂的“作者的目标是什么?”这类问题。差距在所有类型中都出现了,尽管对于某些类型的思考,差距有时会更大。

然而,论文也谨慎地指出,这并不意味着这是一个“已解决”的问题,或者说 AI 是“坏掉”了。它仅仅是衡量了这个差距。他们还指出,虽然人类评审员认同总体趋势(他们更倾向于基于英文的答案),但很难让不同的人类对某个特定答案为什么错误达成一致,这表明人类的判断在这里也有局限性。

这为什么很重要

这项研究是一个警钟。长期以来,我们一直假设如果一个 AI 在英语方面很聪明,那么它在任何地方都很聪明。这篇文章表明事实并非如此。如果你正在为一个使用低资源语言的国家开发帮助医生、教师或律师的工具,你不能仅仅假设经过英语训练的 AI 会完美运行。这种“理解差距”意味着 AI 可能会遗漏重要的细节、误解复杂的指令,或者给出不完整的答案。

作者不仅发现了问题,还构建了一个新的衡量工具。他们发布了数据和方法,以便其他科学家可以使用相同的“平行宇宙”测试来检查新的 AI 模型。这就像是给了科学界一把新的尺子,用来衡量 AI 究竟在多大程度上理解了这个世界,而不仅仅是它有多擅长说英语。结论很简单:我们需要停止假设英语流利等于普遍理解,并开始衡量这种差距,从而让 AI 对每个人都公平且准确,无论他们使用哪种语言。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →