← 最新论文
💬 NLP

UrduMMLU: A Massive Multitask Benchmark for Urdu Language Understanding

本文介绍了 UrduMMLU,这是一个包含 26,000 多个源自本土教育资源的乌尔都语多项选择题的综合基准测试,用于评估 30 个大型语言模型的性能,并揭示了与 STEM 学科相比,这些模型在理解具有地域特色的内容和人文科学学科方面存在显著差距。

原作者: Ahmer Tabassum, Sarfraz Ahmad, Hasan Iqbal, Owais Aijaz, Momina Ahsan, Preslav Nakov

发布于 2026-06-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Ahmer Tabassum, Sarfraz Ahmad, Hasan Iqbal, Owais Aijaz, Momina Ahsan, Preslav Nakov

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图测试一群学生的聪明程度。多年来,你只能给他们提供用英语编写的测试题。你知道他们能读懂英语,但你完全不知道他们是否真正理解了自己文化的历史、文学和科学,还是仅仅背诵了这些概念的英语翻译版本。

这篇论文介绍了 URDUMMLU,这是一个专门为**乌尔都语(Urdu)**设计的庞大全新“考试”,该语言拥有超过 2.3 亿的使用者。以下是他们所做的工作以及研究发现,使用了简单的类比进行说明。

1. 问题所在:“翻译菜单”的问题

直到现在,如果研究人员想要测试 AI 模型在乌尔都语方面的表现,他们大多会采用将英语测试题进行翻译的做法。

  • 类比: 想象一下,如果你试图通过给一位厨师一份从法语翻译过来的菜单,来评判他烹饪正宗意大利美食的能力。他可能能把单词写对,但他可能会忽略文化细微差别、当地食材,或者一道菜传统的烹饪方式。
  • 现实情况: 现有的乌尔都语基准测试就像这些翻译过来的菜单。它们无法捕捉到乌尔都语教育、文学或当地历史(如巴基斯坦研究或伊斯兰研究)所特有的风味。

2. 解决方案:建立一个原生的“乌尔都语考场”

作者构建了 URDUMMLU,这是一个包含 26,431 道多项选择题的基准测试。

  • 题目来源何处? 他们没有翻译英语题目,而是直接溯源:使用真实的巴基斯坦教科书、往届考试试卷(SSC/HSSC)以及当地的乌尔都语题库。
  • “双重检查”系统: 由于一些旧的考试试卷没有答案解析,团队聘请了 17 名母语为乌尔都语的人员(多具有大学学位)充当“监考员”。
    • 规则: 每道题目必须由两名监考员查看并就答案达成一致。如果两人意见不一,或者题目本身有误,该题目将被剔除。这确保了“金标准”答案是 100% 可靠的。
  • 覆盖范围: 该考试涵盖 26 个学科,从数学和物理(STEM)到乌尔都文学、伊斯兰研究和巴基斯坦研究。

3. 测试过程:让 30 个 AI 模型进入考场

研究人员选取了 30 个不同的 AI 模型(既包括像谷歌 Gemini 这样著名的“封闭式”模型,也包括开源模型),并让他们参加这场乌尔都语考试。他们通过两种方式进行测试:

  1. 英语指令: “这是一个乌尔都语问题,请选择答案。”(指令使用英语)。
  2. 乌尔都语指令: “یہاں ایک سوال ہے، جواب منتخب کریں۔”(指令使用乌尔都语)。

4. 结果: “STEM 与文化”之间的差距

结果非常具有启发性,就像一份成绩单显示一名学生擅长数学,却在阅读诗歌方面表现糟糕。

  • 顶尖表现者: 模型 Gemini-3.5-Flash 是明显的获胜者,得分超过 90%。它是唯一突破 85% 门槛的模型。
  • 开源模型的差距: 最好的开源模型(DeepSeek-V4-Flash)得分约为 82%。虽然表现良好,但仍落后于领先者约 8 个百分点。
  • “人文科学”的崩盘: 这是最重要的发现。
    • 类比: 想象一个学生可以解复杂的物理方程(STEM),但在被要求分析一首诗或解释一段宗教文本时却表现得一塌糊涂(人文科学)。
    • 现实情况: 几乎所有模型在科学和数学问题上的表现都远好于人文类问题。当题目转向 乌尔都文学、乌尔都语言和伊斯兰研究 时,许多模型的得分下降了 25 到 40 个百分点
    • 示例: 一个模型可能在物理上获得 97% 的得分,但在乌尔都文学上仅获得 67%。这表明模型掌握了科学的“事实”(这些是通用的),但缺乏处理当地学科所需的深层“文化与语言理解”。

5. 其他令人惊讶的发现

  • 指令语言并不重要: 无论 AI 被要求用英语还是乌尔都语回答,得分几乎没有变化。问题不在于指令语言,而在于模型“大脑”中缺乏关于乌尔都文化的知识。
  • 少样本学习(“小抄”): 研究人员尝试在测试前给 AI 提供几个示例问题(类似于提供一份小抄)。这确实有一点帮助(提高了 1–3 个百分点),但不足以弥补文化知识上的巨大鸿沟。
  • “乌尔都语专用”模型: 有趣的是,专门针对乌尔都语进行训练的模型(如 Qalb 和 Alif)表现相当糟糕(约 35%),甚至比通用模型还要差。这表明仅仅在乌尔都语文本上进行训练是不够的;模型需要接受“教育性”和“推理性”材料的训练,而不仅仅是聊天或新闻内容。

总结

URDUMMLU 就像是为乌尔都语 AI 设立的一场严格的“驾驶执照考试”。它证明了虽然 AI 在用乌尔都语回答科学问题方面变得非常出色,但在理解这门语言的“灵魂”——即其文学、历史和本土文化方面,仍然步履维艰。目前的“最佳”AI(Gemini)是一位优秀的驾驶员,但开源模型仍在学习交通规则,尤其是在涉及乌尔都语世界文化细微差别方面。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →