OMGEval: An Open Multilingual Generative Evaluation Benchmark for Large Language Models
本文介绍了 OMGEval,这是首个开源的多语言生成式评估基准,其包含 804 个经过严格验证且具有文化本土化的开放式问题,涵盖五种语言,旨在评估并提升大语言模型的多语言能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你打造了一位才华横溢、无所不知的图书管理员,他能说世界上所有的语言。你想测试这位图书管理员是真的具备全方位的文化智慧,还是仅仅是一个只了解美国文化的“本地专家”。
这篇论文介绍了 OMGEval,它本质上是为这些 AI 图书管理员(大语言模型)准备的一场多文化“驾照”考试。
以下是作者通过简单类比对他们所做工作的拆解:
1. 问题所在:“美国电视节目”偏见
目前大多数针对 AI 的测试就像是在看一部只在英语环境下播放、且只讨论美国节日、食物和历史的电视节目。
- 问题在于: 如果你问一个 AI:“感恩节的传统食物是什么?”它会正确回答“火鸡”。但如果你问一个说中文的人:“端午节的传统食物是什么?”一个仅基于美国数据训练的 AI 可能会感到困惑或给出错误的答案,因为它并不理解当地文化。
- 论文的观点: 现有的测试大多过于关注英语。它们没有检查 AI 是否理解在俄罗斯,复活节涉及特定的蛋糕,或者在西班牙,万圣节有特定的甜点。
2. 解决方案:OMGEval(“当地导游”测试)
作者创建了一个名为 OMGEval 的新测试。他们并没有简单地将英语问题翻译成其他语言(这就像是给一部俄罗斯电影加上英语字幕),而是重写了问题,使其符合当地文化。
- 类比: 想象一个关于“暑假”的测试题。
- 旧方法(翻译): “美国人去哪里过暑假?”(答案:夏威夷)。
- OMGEval 方法(本土化): “中国人去哪里过暑假?”(答案:三亚)。
- 为什么这很重要: 这两个问题都是在询问“暑假去处”,但文化背景不同。OMGEval 确保 AI 理解的是当地版本的故事,而不仅仅是美国版本的故事。
3. 他们是如何构建它的
团队并没有仅仅使用机器人来翻译内容,而是使用了一支由语言学家组成的专家团队来充当文化编辑。
- 过程: 他们将 804 个开放式问题(如谜语、事实或创意写作提示)进行了改编,涵盖了五种语言:中文、俄语、法语、西班牙语和阿拉伯语。
- “人工触感”: 如果某个问题提到了特定的美国名人,他们会将其替换为当地的名人。如果提到了特定的美国节日,他们会将其替换为当地的节日。他们这样做是为了确保测试的是 AI 理解特定文化的能力,而不仅仅是其翻译单词的能力。
4. 他们如何为 AI 评分
由于人类无法瞬间阅读五种语言的数千个答案,他们使用了 GPT-4(一种非常先进的 AI)作为裁判。
- 游戏规则: 他们让 AI 模型回答问题。然后,他们要求 GPT-4 将两个答案进行对比,并决定哪一个更好。
- 校验: 他们还让真实的人类对一小部分样本进行评分,以确保“AI 裁判”是公正的。结果显示,AI 裁判非常准确(与人类的一致性约为 90%)。
5. 结果:谁通过了测试?
他们测试了多种不同的 AI 模型,包括大型商业模型(如 GPT-4)和开源模型(任何人都可以下载的免费模型)。
- 获胜者: GPT-4 是唯一一个持续得分超过 50%(意味着它胜过基准线超过一半的时间)的模型。它是那个“明星学生”。
- 挣扎之处: 开源模型(如 Guanaco、Phoenix 等)表现得非常吃力。
- 差距: 虽然 GPT-4 能很好地处理文化细微差别,但开源模型经常出现事实错误或遗漏文化背景。例如,当被问及一位著名的中国导演的第一部电影时,一些开源模型给出了错误的年份或错误的电影名称,而 GPT-4 则答对了。
- 启示: 在理解不同文化方面,顶尖商业模型与开源模型之间存在巨大的鸿沟。开源模型就像是那些虽然读过教科书,却没能理解当地方言的学生。
总结
OMGEval 是一个全新的、更公平的测试,它检查 AI 模型是否理解世界多元的文化,而不仅仅是理解美国版本的世界。论文表明,虽然最优秀的 AI(GPT-4)在这方面做得相当出色,但许多其他模型在理解不同语言和文化的“当地风味”方面仍然很挣扎。作者希望这项测试能帮助社区在未来构建出更具文化意识的 AI。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。