← 最新论文
💬 NLP

GreekMMLU: A Native-Sourced Multitask Benchmark for Evaluating Language Models in Greek

该论文介绍了 GreekMMLU,这是一个完全源自希腊语本土学术、专业及政府考试的多任务基准测试,包含 21,805 道涵盖 45 个学科的题目,旨在解决现有希腊语评估数据多为机器翻译的问题,并通过对 80 多种语言模型的评估揭示了其在希腊语能力上的显著差距与改进方向。

原作者: Yang Zhang, Mersin Konomi, Christos Xypolopoulos, Konstantinos Divriotis, Konstantinos Skianis, Giannis Nikolentzos, Giorgos Stamou, Guokan Shang, Michalis Vazirgiannis

发布于 2026-03-31
📖 1 分钟阅读☕ 轻松阅读

原作者: Yang Zhang, Mersin Konomi, Christos Xypolopoulos, Konstantinos Divriotis, Konstantinos Skianis, Giannis Nikolentzos, Giorgos Stamou, Guokan Shang, Michalis Vazirgiannis

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 GreekMMLU 的新项目,你可以把它想象成是为希腊语大模型(AI)量身定制的一场"全科目奥林匹克考试"。

在此之前,评估 AI 懂不懂希腊语,就像是用翻译过来的英语试卷来考一个希腊学生。虽然题目意思大概能懂,但那些微妙的文化梗、特有的历史典故,甚至是希腊语独特的语法结构,在翻译过程中都“变味”了。这就像是用翻译软件去考一个中国学生“红楼梦”里的诗词,很难测出他真正的水平。

为了解决这个问题,研究团队做了一件很酷的事情:他们完全抛弃了翻译,直接从希腊本土的“题库”里出题。

以下是这篇论文的通俗解读:

1. 他们做了什么?(造了一座“希腊语知识宝库”)

想象一下,研究团队像是一个超级图书馆管理员,他们跑遍了希腊的:

  • 小学到大学的课本
  • 驾照考试题目
  • 公务员考试卷
  • 专业资格证考试(比如医生、律师、工程师)

他们从中收集了 21,805 道选择题,涵盖了 45 个学科(从数学、物理到希腊神话、历史、法律)。

  • 关键点:这些题目原本就是用希腊语写的,不是从英语翻译过来的。
  • 难度分级:就像学校里的考试一样,有小学题(简单),也有博士论文级别的难题(很难)。
  • 防作弊:为了防止 AI 提前背过答案(数据污染),他们把题目分成了两部分:一部分公开给大家练手,另一部分“锁”在保险柜里,专门用来给 AI 做最终排名(Leaderboard)。

2. 他们测试了谁?(一场 AI 大乱斗)

他们把 80 多个 不同的 AI 模型(包括谷歌、Meta、阿里等大厂的最强模型,以及一些专门针对希腊语训练的小模型)拉到了这个考场上。

这就好比让:

  • 全球通用的“超级学霸”(如 GPT-4, Gemini)
  • 专门补习过希腊语的“本地学生”(如 Meltemi, Krikri)
  • 还没怎么学过希腊语的“普通学生”(各种开源小模型)

一起参加这场考试。

3. 发现了什么?(考试结果大揭秘)

  • 顶尖模型依然最强,但差距巨大
    那些闭源的“超级学霸”(如 Gemini 3 Flash)考得最好,准确率高达 93% 以上。但是,开源的“本地学生”虽然进步很大,和顶尖模型之间还是有一道明显的“鸿沟”。

  • “本地化”训练真的很重要
    那些专门用希腊语数据“特训”过的模型(比如 Llama-Krikri),在考希腊神话、历史、传统这些题目时,表现远超那些“万国通”模型。

    • 比喻:这就好比一个在美国长大的希腊裔孩子,虽然英语流利,但让他考希腊的“地方志”或“民俗”,肯定不如一个在雅典土生土长的孩子考得好。
  • 越大的模型越聪明
    模型参数越大(大脑越复杂),成绩越好。小模型(比如只有 10 亿参数的)在很多题目上几乎是在“蒙”,准确率接近随机猜测。

  • 提示词(Prompt)有奇效
    给 AI 看几个例题(5-shot)再让它做题,比直接让它做(0-shot)要聪明得多。这就像考前给个“模拟卷”热身,效果立竿见影。

4. 为什么这很重要?(不仅仅是为了希腊语)

这篇论文的核心思想是:“翻译”不是万能的。

如果你想真正评估一个 AI 是否懂某种语言,不能只靠把英语题翻过去。因为语言不仅仅是单词的堆砌,它背后是文化、历史、法律和社会习惯

  • 希腊语有复杂的变格和独特的文化背景,直接翻译的英语题会丢失这些灵魂。
  • GreekMMLU 证明了,只有用原生内容(Native-sourced)来测试,才能看到 AI 真正的“母语能力”。

总结

这就好比以前我们只能用“翻译版”的《三国演义》来测试 AI 懂不懂中国历史,现在作者们直接拿出了一本原汁原味的《三国演义》,并告诉所有 AI:“来吧,用你们的希腊语能力,真正读懂它。”

这不仅让希腊语 AI 有了公平的竞技场,也为其他小语种(如阿拉伯语、土耳其语等)如何建立自己的“原生考试标准”提供了完美的样板。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →