← 最新论文
💬 NLP

Apples to Apples? Towards Comparable Crosslingual Language Model Evaluation

本文表明,广泛使用的跨语言语言模型评估归一化指标由于分词和正字法差异而引入了偏差,并提出在语义等价序列上计算句子级负对数似然,为比较不同语言的模型提供了一种更一致且更公平的替代方案。

原作者: Xiulin Yang, Ethan Gotlieb Wilcox, Catherine Arnett

发布于 2026-08-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Xiulin Yang, Ethan Gotlieb Wilcox, Catherine Arnett

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在人工智能飞速发展的世界中,计算机正在学习用数十种人类语言进行交谈和写作。这些被称为语言模型的数字大脑,通过在海量文本库上进行训练,来预测句子中下一个单词会出现什么。随着这些系统变得越来越强大,研究人员面临着一个关键挑战:我们如何知道一个模型是否真正精通某种特定语言,还是仅仅擅长这种语言在计算机上的书写方式?为了回答这个问题,科学家必须衡量模型对文本含义的理解程度,而不仅仅是它处理原始字符或符号的效率。问题在于,目前用于衡量这种理解能力的工具往往隐藏着陷阱。它们可能会受到单词字母数量、所使用的特定脚本,或者计算机将句子拆分为微小片段进行处理方式的影响。如果这些工具存在偏差,它们可能会让一个模型在一种语言中显得才华横溢,而在另一种语言中显得笨拙,但这并非源于其实际智能,而是由于处理数据时的技术特性。这使得公平地比较人工智能在世界各种不同语言中的表现变得几乎不可能。

来自乔治城大学和 EleutherAI 的一个研究小组试图通过测试这些用于评判模型的工具来解决这个谜题。他们构建了一个受控实验,使用了五十个独立的计算机模型,每个模型都专门针对十种不同语言中的一种进行训练。为了确保测试的公平性,他们在平行数据上训练了这些模型,这意味着模型通过表达相同含义的不同语言文本进行学习。随后,他们使用该领域常用的六种不同测量方法对这些模型进行了测试。其中一些方法统计模型理解一个句子时使用的总“微小构建块”(即 token)的数量;另一些则统计字节(即数字存储单位)的数量,或屏幕上单个字符的数量。研究人员还测试了一种方法,该方法仅简单地汇总模型预测整个句子的总难度,而不将该难度除以文本的长度。

结果揭示了关于这些测量方法运作方式的一个惊人事实。研究发现,那些将模型的表现除以 token、字节或字符数量的方法,在比较不同语言时存在严重缺陷。这些指标一致地偏向于那些自然使用较少字符或字节来表达同一思想的语言(如中文),同时惩罚了那些需要更长符号序列的语言。在一个引人注目的例子中,通过这些有缺陷的测量方法,一个仅接受过英语训练的模型在俄罗斯语上的表现竟然被显示得比在英语上“更好”,仅仅是因为计算机将俄语文本拆分成了更多的碎片,从而人为地降低了得分。尽管该模型从未见过俄语且在现实中表现糟糕,但情况依然如此。这项研究表明,这些流行的指标并不是在衡量模型的实际智能或理解力,而仅仅是在反映设置计算机读取文本时的工程选择。

相比之下,那种不除以长度、直接汇总句子总难度的法被证明是唯一公平的方法。研究人员称之为“句子级负对数似然”(sentence-level negative log-likelihood)的方法,它观察的是模型理解整段文本所付出的总努力。因为它没有试图根据文本在字母或数字存储方面的长度来归一化分数,所以无论语言的脚本或计算机的词汇量如何,它都能保持稳定。当研究人员将这种方法应用于大型真实世界的多语言模型时,它是唯一能够正确识别模型对哪些语言学习得更好的指标,并与已知的训练数据构成相匹配。其他方法则继续产生受文本存储和处理技术细节扭曲的排名。

研究人员还调查了当相同的含义以不同方式表达时,这些测量方法是否保持一致。他们发现,虽然某些指标会根据所使用的翻译或释义的不同而剧烈波动,但句子级方法却保持稳定。这表明,其他方法的所谓稳定性只是由其对表层细节的敏感性所制造的一种幻象,而非真正的可靠性。该研究得出结论,为了真正了解人工智能在不同文化和语言中的表现,科学家必须停止依赖统计 token、字节或字符的指标。相反,他们必须使用尊重文本整体含义的衡量标准,以确保评估反映的是模型的实际学习能力,而非其数字表示形式的特性。这一转变对于构建对每个人都真正公平且有效的系统至关重要,无论他们使用何种语言。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →