← 最新论文
💬 NLP

Mind the Gap... or Not? How Translation Errors and Evaluation Details Skew Multilingual Results

本文揭示了多语言大语言模型中高资源语言与低资源语言之间表现出的性能差距,在很大程度上是 MGSM 基准测试中翻译错误和答案提取不一致所导致的伪像,而当这些数据质量问题得到修正时,这种差距便会消失。

原作者: Jan-Thorsten Peter, David Vilar, Tobias Domhan, Dan Malkin, Markus Freitag

发布于 2026-06-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Jan-Thorsten Peter, David Vilar, Tobias Domhan, Dan Malkin, Markus Freitag

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一位正在为不同语言的学生批改数学测试卷的老师。你想知道你的学生是否在数学方面同样优秀,无论他们说的是英语、法语、斯瓦希里语还是孟加拉语。

这篇论文本质上是一份关于我们如何对这些测试进行评分的成绩单报告,它揭示了一个令人震惊的错误:我们之前是在用一张破损的试卷和一台有故障的评分机来给学生评分。

以下是研究人员发现的过程,通过简单的形式进行了拆解:

1. 最初的(错误)结论

研究人员开始研究一个名为 MGSM 的流行数学测试。该测试包含 250 道简单的数学题(例如“如果你有 5 个苹果……”),并将其翻译成 10 种不同的语言。

当他们让他们的 AI 模型(即“学生”)通过这项测试时,结果看起来非常糟糕,尤其是对于非英语使用者而言。

  • 类比: 这就像是一个说法语的学生在数学测试中得了 60%,而说英语的学生得了 98%。
  • 最初的想法: 大家都认为 AI 在使用法语或斯瓦希里语时并不够“聪明”。人们认为存在巨大的“语言鸿沟”,即 AI 在其他语言中难以进行逻辑推理。

2. 调查过程:“等等,试卷坏了!”

研究人员决定像侦探检查题目一样仔细观察。他们发现了两个导致分数出错的主要问题:

问题 A:“迷失在翻译中”的错误
创建测试的人类翻译人员犯了一些细微的错误。

  • 隐喻: 假设一道数学题说:“星期二,我走的距离是星期一的 6 倍。”但德语翻译不小心把“星期二”改成了“星期四”。
  • 结果: AI 模型非常讲逻辑,它看着题目说:“等等,日期对不上!我没法解这道题!”于是,它答错了。但问题不在于 AI 的数学能力,而在于题目本身是破损的。

问题 B:“有故障的评分机”
即使 AI 给出了正确的答案,用于读取答案的计算机程序也过于死板。

  • 隐喻: 想象 AI 写出的答案是“2.000”(在欧洲常用点号作为千分位分隔符)。评分机由于预期的是英语风格,看到这个点就想:“哦,那是小数点!那是 2.000……等等,那是 2。”或者更糟,它看到一个逗号就感到困惑。
  • 结果: AI 实际上正确地解决了问题,但“评分机”却因为不理解不同国家书写数字方式的不同,而将其判定为错误。

3. 修复方案:清理混乱

研究人员做了两件事:

  1. 修复了题目: 他们检查了测试卷,找到了翻译错误(比如“星期二 vs 星期四”的混淆),并进行了修正。
  2. 修复了评分器: 他们更新了计算机程序,使其在读取数字时更加聪明。它学会了法语中的逗号可能代表小数点,而德语中的点可能代表千分位分隔符。

4. 新的结果:差距消失了

当研究人员使用修复后的题目更智能的评分器重新运行测试时,结果发生了彻底的变化。

  • 类比: 这就像是意识到那个说法语的学生其实也得了 98%,只是我们读错了他们的卷子。
  • 结果: 在最强大的 AI 模型中,英语与其他语言之间的性能差距几乎消失了。对于最强的 AI 模型,它们在法语、俄语或斯瓦希里语中的表现与在英语中一样出色。

核心教训

论文得出结论:对于最聪明的 AI 模型来说,并不存在真正的“语言间的数学差距”。这些模型在任何语言下都能很好地进行数学运算。

我们之所以以为存在差距,是因为:

  1. 测试题目翻译得不好。
  2. 我们使用不理解当地数字格式的工具来评分。

总结:
在我们指责 AI 在其他语言中“数学不好”之前,我们需要确保我们的测试是公平的,并且我们的评分工具正在正常工作。研究人员发布了他们修正后的测试,以便其他人也可以使用一把公平的尺子来衡量未来。

这篇论文并没有说:

  • 它并没有说 AI 在所有语言中都是完美的(较小、较弱的模型仍然会遇到一些困难)。
  • 它并没有说我们应该停止用其他语言进行测试。
  • 它并未声称所有基准测试都坏了,仅指明这个特定的基准(MGSM)存在这些具体问题。

简而言之:问题不在 AI,而在测试。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →