← 最新论文
💬 NLP

ChiKhaPo: A Large-Scale Multilingual Benchmark for Evaluating Lexical Comprehension and Generation in Large Language Models

该论文介绍了 ChiKhaPo,这是一个涵盖 2700 多种语言的大规模多语言基准测试,包含旨在评估大语言模型词汇理解与生成能力的八个子任务,并揭示了即使是尖端模型在面对世界上绝大多数书面语言时,也难以具备基本的语言能力。

原作者: Emily Chang, Niyati Bafna

发布于 2026-06-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Emily Chang, Niyati Bafna

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个巨大的、超级智能的图书馆,里面收藏着用成千上上种不同语言编写的书籍。你雇佣了一位才华横溢的新图书管理员(即大语言模型,或称 LLM)来帮助你寻找特定的词汇并进行翻译。你想知道:这位图书管理员是真的理解这些词汇,还是仅仅根据他们学习最多的那几种语言在进行猜测?

这篇论文介绍了一种名为 ChiKhaPo(发音为 Chi-Kha-Po)的新测试,旨在回答正是这样一个问题。这个名字源于一个意为“循序渐进”的说法,因为作者认为我们需要通过细小、谨慎的步骤,来理解这些 AI 模型在世界各种语言中究竟是如何运作的。

以下是他们研究工作的拆解,使用了日常生活的类比:

1. 问题所在:“语言的 VIP 休息室”

目前的 AI 测试就像是 VIP 休息室。它们只允许少数几十种“高资源语言”(如英语、西班牙语或法语)进入。

  • 现实情况: 世界上有超过 3,800 种书面语言。绝大多数都被锁在了这些 VIP 休息室之外。
  • 差距: 我们不知道 AI 是否能处理其他 3,700 多种语言。它可能在英语方面是个天才,但在被要求翻译低资源语言中的一个词时却完全不知所措。

2. 解决方案:大规模多语言考试 (ChiKhaPo)

作者构建了一个涵盖 2,700 多种语言 的庞大考试。他们并没有要求 AI 写一篇复杂的文章或解决数学难题(这些都是很难的任务),而是将重点放在了基础能力上:词汇能力 (Lexical Competence)

  • 类比: 这就像是在要求学生写小说之前,先测试他们的词汇量。他们能识别一个词吗?能说出它的意思吗?能在句子中使用它吗?

该考试包含 8 个不同的部分(子任务),从不同角度测试这些技能:

  • 单词翻译: “‘雨’在马来语中怎么说?”(直接翻译)。
  • 带上下文的单词翻译: “在这个关于风暴的故事中,‘ujan’这个词是什么意思?”(利用上下文线索)。
  • 翻译调节建模 (Translation-Conditioned Modeling): 给定 AI 一个语言的句子,让它预测翻译中的下一个词。(类似于“填空游戏”)。
  • 词袋翻译 (Bag-of-Words Translation): AI 翻译整个句子,测试会检查它是否准确掌握了其中的单个词汇,即使句式结构有点混乱也没关系。

3. 结果:AI 在基础知识上挣扎

作者在现有的 6 个最聪明的 AI 模型 上进行了这项测试。

  • 发现: 即便是最优秀的模型也表现得非常吃力,尤其是在面对低资源语言时。
  • “理解 vs. 生成”的差距: 模型在理解一个词(阅读它并知道其含义)方面比生成它(说出或写出这个词)的表现要好。
    • 类比: 这就像一个人能看懂外语菜单并知道“汤”是什么,但当被要求点餐时,他们却愣住了,说不出那个词。
  • “富 vs. 贫”的差距: 模型在数据丰富的语言(高资源语言)上的表现远好于数据极少的语言(低资源语言)。这种性能差距是巨大的。

4. 为什么这很重要(根据论文所述)

论文指出,我们不能仅仅因为 AI 在英语中表现良好,就假设它是“多语言”的。

  • “代理指标”的发现: 他们发现,如果一个 AI 擅长翻译单个单词(简单的测试),那么它通常也擅长翻译完整的句子(复杂的测试)。这意味着简单的单词测试是一种廉价且高效的方法,可以用来检查一个 AI 是否已经为更难的工作做好了准备。
  • 目标: 作者希望揭示语言不平等现象。目前,自然语言处理(NLP)是不公平的,因为它忽略了数千种语言。ChiKhaPo 是一个工具,旨在迫使研究人员关注这些被忽视的语言,并构建更好的、更公平的 AI。

总结

ChiKhaPo 是一个针对 2,700 多种语言的、循序渐进的 AI 词汇测试。它揭示了即使是最聪明的 AI 模型,目前对世界上大多数语言来说也是“词盲”。它们通常能理解一个词,但在产出该词时却很困难;而且在面对数据较少的语言时,表现得非常糟糕。作者希望这项测试能鼓励 AI 界的同仁们不再仅仅关注那些“VIP”语言,而是开始构建真正理解整个世界的模型。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →