KyrgyzLLM-Bench: Benchmarking Kyrgyz Language Understanding
本文介绍了 KyrgyzLLM-Bench,这是首个包含原生编写和精心翻译数据集的大规模基准测试套件,旨在系统地评估 26 个大语言模型在吉尔吉斯语理解方面的能力,并揭示了关于跨语言性能迁移以及翻译人工痕迹影响的重要见解。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图教一个超级聪明的机器人如何理解这个世界。长期以来,科学家们一直通过一个完全用英语编写的庞大问题库来测试这些机器人。这就像是给一个学生做数学测试,但指令却是用一种他们几乎不会说的语言写的。机器人可能会把数学题做对,但它可能会因为在挣扎于理解单词而错失重点。这就是大语言模型(LLMs)的世界:能够阅读和编写文本的强大人工智能系统。科学家使用基准测试(类似于标准化考试)来观察这些机器人的聪明程度。但问题在于:这些测试大多是英文的。如果我们只用英文测试机器人,我们就不知道它们是真的聪明,还是仅仅非常擅长英语。这一点至关重要,因为世界充满了不同的语言,我们希望我们的人工智能能理解所有人,而不只是英语使用者。
现在,想象一种叫做**柯尔克孜语(Kyrgyz)**的语言,由中亚数百万人口使用。它有点像一个语言谜题:单词是通过将许多小的碎片(后缀)拼接在一起构建的,就像一长串乐高积木一样,并且它使用一种带有独特字母的特殊字母表。直到现在,几乎没有方法可以测试人工智能机器人是否能理解柯尔克孜语。你不能直接把一个英文测试拿来翻译,因为机器人可能会被翻译本身搞混,或者测试对于母语使用者来说会显得奇怪且不自然。
这就是论文 KyrgyzLLM-Bench 出场的地方。作者专门为柯尔克孜语构建了一个全新的、定制的测试套件。他们不是简单地翻译旧的英文测试,而是利用真实的柯尔克孜语学校考试和故事,从头开始创建了两个全新的测试,并仔细润色了四个翻译过来的测试,以确保它们听起来自然。然后,他们让 26 个不同的 AI 模型(包括免费的开源模型和昂贵的闭源模型)接受了严苛的考验。他们要求机器人用柯尔克孜语解决数学问题、回答有关历史和文学的问题,以及完成句子。他们通过两种方式进行:首先,直接提问(零样本/zero-shot);其次,先给机器人一些例子(少样本/few-shot),就像在正式考试前给学生展示一道练习题一样。
结果既有好消息,也有一些令人惊讶的小故障。最大的机器人(那些拥有最多“脑力”的模型)通常表现最好,正如预期的那样。当机器人得到一些例子作为学习参考时,它们在阅读理解和基于文本回答问题方面的表现有了很大提升。然而,研究发现了一个棘手的问题:当机器人尝试完成句子或猜测故事接下来的发展(一项被称为“事件延续/event continuation”的任务)时,它们在翻译测试中表现得很糟糕。作者认为这是因为翻译这些特定类型的句子破坏了语言的自然流向,使得这项任务对机器人来说感觉“不对劲”。这就像是用一种你并不完全掌握的语言讲笑话;笑话的梗在英语里可能很有趣,但在翻译后,听起来就很奇怪。
论文得出结论,虽然人工智能在理解柯尔克孜语方面正在进步,但与英语相比,它还有很长的路要走。显然,当机器人拥有更多数据和更大的“大脑”时,它们会变得更聪明,但它们在处理柯尔克孜语独特的“风味”时仍然感到吃力,尤其是对于那些经过翻译而非原生编写的测试。作者警告说,仅仅翻译英文测试是不够的;要真正了解人工智能是否理解像柯尔克孜语这样的语言,我们需要由母语使用者从底层开始构建测试。他们已经向公众发布了他们所有的测试和结果,希望能以此帮助构建更优秀、更公平的人工智能,让它服务于每一个人,而不只是英语使用者。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。