← 最新论文
💬 NLP

Quantifying the Impact of Translation Errors on Multilingual LLM Evaluation

本文通过证明机器翻译基准中的翻译错误显著导致准确率下降,以及自动错误检测方法与人注标注之间存在非 trivial 的一致性,探讨了多语言大语言模型评估的可靠性。

原作者: Klaudia-Doris Thellmann, Bernhard Stadler, Michael Färber, Jens Lehmann

发布于 2026-05-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Klaudia-Doris Thellmann, Bernhard Stadler, Michael Färber, Jens Lehmann

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你是一位老师,正试图给一个说不同语言的学生班级打分。你有一份用英语写成的著名测试(即“金标准”)。为了评估你的学生说西班牙语、法语或德语的水平,你将这份英语测试输入翻译机器,生成翻译版本,然后发给学生作答。

这篇论文提出的核心问题是:如果翻译机器出错,会发生什么?

作者团队(一组研究人员)发现,这些翻译错误并非只是微小的拼写错误;它们更像是路上的坑洼,即使是最聪明的学生,即便完全知道英语答案,也可能因此“翻车”。

以下是他们研究发现的简要说明,辅以简单类比:

1. “机器人评分员”与人类专家

研究人员想知道:我们能否信任其他 AI 模型来识别这些翻译“坑洼”,还是必须依赖人类专家?

  • 实验:他们选取了一组已翻译的测试题,并请四位不同的“机器人评分员”(如 GPT-5.2、Mistral 等 AI 模型)精确标出翻译出错的位置。随后,他们将机器人的标注结果与由专业人类语言学家制定的“金标准”进行对比。
  • 结果:机器人表现尚可,但并非完美。其中一款机器人GPT-5.2在识别“坑洼”方面表现最佳,与人类专家的一致性约为 50%。其他机器人的准确率则低得多。
  • 局限:机器人常常难以准确判断错误的确切起止位置。这就像两个人试图在衬衫的污渍周围画圈:他们可能都同意存在污渍,但一个人只在污渍中心画一个小圈,另一个人则画一个大圈,把整只袖子都圈了进去。

2. “问题根源”(谁该负责?)

有时,英语测试题本身就很奇怪或令人困惑;有时,翻译则让情况变得更糟。研究人员想知道:学生答错,是因为英语原题本身有问题,还是因为翻译搞砸了?

  • 类比:想象一道数学题写道:“如果一辆汽车在 2 小时内行驶 50 英里……"
    • 源题问题:英语原题本身有误,写成“如果一辆汽车在 2 个苹果内行驶 50 英里……"(原题本身毫无意义)。
    • 翻译问题:英语原题无误,但译者将“英里”改为“公里”,将“小时”改为“分钟”,导致题目无法求解。
  • 发现:研究人员发现,翻译错误才是真正的罪魁祸首。即使英语原题完美且可解,仅因翻译错误,AI 学生答错答案的概率就会额外增加 6 到 11 个百分点

3. “分数下降”与“排名”

这是最令人惊讶的部分。研究人员提出:如果我们神奇地修复所有翻译错误,AI 模型的排行榜会改变吗?

  • 类比:想象一场赛跑,由于翻译错误,每位选手都从起跑线后方 10 米处开始。
    • 结果:如果你将所有人向前移动 10 米(即修复翻译),所有人的成绩都会变快。原本第一名的选手仍居第一,第十名的选手仍居第十。获胜者的顺序并未改变。
    • 问题:然而,所有用时都是错误的。你以为冠军跑了 10 秒,实际上他跑了 9 秒。你低估了每个人的真实能力。
  • 结论:翻译错误就像给每个 AI 模型都附加了均匀的负重,同等程度地拉低了所有人的分数。因此,尽管“排行榜”(谁是第一名)保持不变,但实际分数存在偏差且偏低。我们向世界宣称“这个 AI 只有 80% 聪明”,而它实际上可能达到 85% 的聪明程度,仅仅因为测试题的翻译质量不佳。

核心结论总结

该论文指出,使用机器翻译的基准测试来评估 AI 存在风险:

  1. 机器人目前尚不擅长精准识别翻译错误。
  2. 翻译错误会导致可测量的性能下降(准确率降低约 6–11 个百分点)。
  3. AI 模型的排名保持稳定(冠军仍是冠军),但分数被不公平地压低

这就像评判一场烹饪比赛,而食材说明是从另一种语言翻译过来的。最出色的厨师可能仍然获胜,但评委可能会认为食物味道不如实际那么好,因为食谱在翻译过程中略有失真。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →