← 最新论文
💬 NLP

CulturALL: Benchmarking Multilingual and Multicultural Competence of LLMs on Grounded Tasks

本文提出了名为 CulturALL 的综合基准,旨在通过涵盖 14 种语言、51 个地区及 16 个主题的 2610 个高难度接地任务样本,评估大语言模型在多语言和多文化情境下的推理能力,实验结果表明当前最先进模型在此类任务上的准确率仅为 44.48%,凸显了巨大的提升空间。

原作者: Peiqin Lin, Chenyang Lyu, Wenjiang Luo, Haotian Ye, Md Mehrab Hossain, Chunlan Ma, Shaoxiong Ji, Younes Samih, Bo Zeng, Fan Jiang, Yuanbin Cao, Dilda Duisenbek, Adrian Neo Sau Xun, Daria Pozdniakova
发布于 2026-04-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Peiqin Lin, Chenyang Lyu, Wenjiang Luo, Haotian Ye, Md Mehrab Hossain, Chunlan Ma, Shaoxiong Ji, Younes Samih, Bo Zeng, Fan Jiang, Yuanbin Cao, Dilda Duisenbek, Adrian Neo Sau Xun, Daria Pozdniakova, Liubou Misevich, Nevena Marinković, Ngoc Gia Linh Nguyen, Thi Khanh Linh Do, Sarakmatak Sophy, Baotian Hu, Guanhua Chen, Gongbo Tang, Alham Fikri Aji, Longyue Wang, Weihua Luo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 CulturALL 的新“考试”,专门用来测试大型人工智能(LLM)是否真的懂多语言多文化,而且是在真实生活场景中。

为了让你更容易理解,我们可以把这篇论文的内容想象成一场**“全球生存挑战赛”**。

1. 为什么要办这场“挑战赛”?(背景与问题)

以前,我们测试 AI 就像是在考它**“死记硬背”**的能力。

  • 旧考试(比如以前的百科问答): 问 AI“玫瑰是什么?”或者“七夕节是哪天?”。这就像考学生背课文,AI 只要把数据库里的知识调出来就能答对。
  • 新挑战(CulturALL): 现在的 AI 被用到了全世界,我们需要知道它能不能处理**“活生生的人情世故”**。
    • 举个栗子🌰: 如果你问 AI:“我开了一家花店,2025 年 8 月底该主推什么花?”
    • 这不仅仅是问“花”的知识,AI 需要:
      1. 听懂语言(比如用中文提问);
      2. 懂文化(知道 8 月底中国有什么节日或习俗,比如七夕刚过,或者开学季临近);
      3. 会推理(结合时间、地点、商业逻辑,给出一个合理的建议)。

以前的考试大多只考前两点,或者只考死知识。CulturALL 就是要考**“语言 + 文化 + 现实推理”这三合一的“生存能力”**。

2. 这场“挑战赛”是怎么设计的?(构建过程)

为了让考试既全面又难倒 AI,作者们用了一套**“人机协作”**的魔法:

  • 第一步:定题库(人类专家 + AI brainstorm)
    人类专家列出 16 个生活领域(比如旅行、饮食、政府办事、节日等),AI 帮忙扩充,确保覆盖全球 51 个地区、14 种语言。
  • 第二步:出题(人类灵感 + AI 翻译)
    让来自不同国家的母语者(比如新加坡人、巴西人)根据自己真实的经历出题。
    • 比喻: 就像让一位新加坡妈妈出题:“孩子要去新加坡国庆日,该听哪首歌?”这比 AI 瞎编的要地道得多。
  • 第三步:升级难度(“加料”环节)
    这是最精彩的部分。如果题目太简单,AI 一眼就能猜对,那就没意义了。于是他们用了三种“加难”技巧:
    1. 换冷门词(Long-Tail Swap): 把“去香港”改成“去香港麦理浩径徒步”,逼 AI 去查更偏门的知识。
    2. 加/减背景(More/Less Context): 比如加上“你以前办过港澳签注吗?”这种条件,让 AI 必须分情况讨论,不能一概而论。
    3. 组合拳(Compositional): 把两个知识点混在一起,比如“去香港和曼谷的签证要求”,考验 AI 的综合推理能力。
  • 第四步:质检(人类互评)
    像学校老师改卷一样,互相检查题目有没有错、有没有冒犯性内容,确保题目质量过硬。

最终,他们凑齐了 2610 道 这样的“高难度生存题”。

3. 考试结果如何?(发现与结论)

作者拿目前最厉害的 15 种 AI 模型(包括谷歌的 Gemini、OpenAI 的 GPT、阿里的通义千问等)来考这场试,结果让人大跌眼镜

  • 最好的成绩也不及格: 表现最好的模型(Gemini 2.5 Pro)只拿到了 44.48% 的分数。这意味着,面对真实世界的复杂文化问题,最先进的 AI 连一半都做不对。
  • 闭源模型 > 开源模型: 像 Google、OpenAI 这种大公司闭源的模型,比开源模型(如 Qwen 系列)强不少。开源模型在处理这种“人情世故”时显得有点“水土不服”。
  • 联网搜索是“作弊器”: 给 AI 装上“联网搜索”功能,成绩会明显提升。这说明 AI 光靠脑子里的“死知识”不够用,得学会去网上查最新的、具体的信息。
  • 推理能力很重要: 那些能进行多步推理的模型,比只会简单回答的模型表现更好。
  • 语言陷阱: 有趣的是,如果用英语出题,AI 往往答得更好;但用母语(如中文、阿拉伯语)出题,AI 反而容易犯错。这说明 AI 对母语背后的文化细微差别理解还不够深。

4. 总结:这对我们意味着什么?

这篇论文就像给 AI 行业敲了一记警钟:
现在的 AI 虽然能写诗、能写代码,但在处理“接地气”的跨文化问题时,还是个“书呆子”。

  • 现状: AI 还没学会如何像一个真正的“本地人”那样思考。
  • 未来: 我们需要让 AI 不仅要有“百科全书”的知识,还要有“生活经验”和“推理能力”,并且要学会利用互联网去获取实时的文化信息。

一句话总结:
CulturALL 就是给 AI 发了一张**“全球生活体验卡”,结果发现,目前最聪明的 AI 在这张卡上只能打个不及格**,离真正融入人类社会还有很长的路要走。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →