← 最新论文
💬 NLP

Do Evaluation Metrics Detect Errors in Classical Chinese to English Translations?

本文研究了现有古汉语至英语自动评估指标的可靠性,揭示了尽管所有指标都存在盲点,但 MetricX24 表现最佳,从而凸显了对专门针对具有历史和文化差异性的翻译场景而设计的更具鲁棒性和可解释性的指标的迫切需求。

原作者: Osvaldo Quinjica, Eric Bennett, Xinchen Yang, Andrew Schonebaum, Marine Carpuat

发布于 2026-08-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Osvaldo Quinjica, Eric Bennett, Xinchen Yang, Andrew Schonebaum, Marine Carpuat

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图扮演一名破解谜团的侦探,但你仅有的线索是用一种两千年前就已不再使用的语言写成的。这正是研究古汉语学者的日常现实——那是属于皇帝、哲学家和诗人的古老语言。今天,我们拥有被称为“大语言模型”(LLMs)的超级聪明计算机大脑,它们能够阅读这些古籍并将其翻译成现代英语。这就像拥有一台神奇的时光机,能将尘封的卷轴变成可读的故事。但问题在于,我们如何知道机器没有在胡编乱造?如果计算机把“鸦”这个词翻译成了“鸽子”,或者把一位“王”变成了“公爵”,整个故事可能就会毁于一旦。

为了检查计算机做得是否出色,科学家们使用了“评估指标”。你可以把这些指标想象成自动化的裁判或拼写检查器,它们会给翻译打分。通常,这些裁判是针对法语或西班牙语等现代语言进行训练的。它们会寻找匹配的单词或相似的句子结构。但古汉语是一个“变数”。它极其简短,高度依赖语境,并且经常省略现代语言中必须具备的主语或宾语。一个对现代英语使用者来说听起来完美的翻译,实际上可能完全背离了古文的原意。大问题在于:我们目前的自动化裁判能否发现这些古汉语特有的错误,还是说它们正忙于观察现代语法规则,以至于察觉不到这些历史性的错误?

这篇论文对这些自动化裁判进行了测试。研究人员利用一种被称为“最小对立对”(minimal pairs)的巧妙技巧,为翻译指标设计了一场特殊的“考试”。想象一下,你有一个古文句子的完美翻译。现在,你对这个句子进行一个微小且特定的改动——比如把“鸦”换成“鸽”,或者删掉说话者的名字。这创造了一个与原句几乎完全相同但包含特定错误的“损坏版”。研究人员随后将这个“完美版本”和“损坏版本”同时输入各种翻译指标,观察这些指标是否会给损坏的版本打出更低的分数。

结果喜忧参半,揭示了即使是最聪明的自动化裁判也存在“盲点”。研究发现,虽然有些指标擅长捕捉明显的灾难性错误(比如把整段文本翻译成了现代中文而不是英文),但它们往往无法捕捉到对历史学家而言最重要且细微而危险的错误。例如,许多指标并未注意到翻译时时态的变化(将“是”变为“曾是”),或者未能察觉到像“公爵”被替换为“王”这类特定头衔的变动。正是这类错误会导致学者得出错误的结论,从而误解历史。

在所有受测的裁判中,一个名为 MetricX24 的模型整体表现最佳。它是对错误最敏感的一个,能够正确地惩罚许多损坏的翻译。然而,即便如此,MetricX24 也并非完美;它仍然会漏掉某些类型的错误,特别是涉及词汇在现代与古代含义差异的问题。另一方面,这些指标在某一方面表现得非常出色:它们不会惩罚无伤大雅的改动。如果翻译使用了略微不同的姓名格式,或者在另一个合法的断句处断开了句子,这些指标大多会予以通过。这说明这些“裁判”在风格问题上并不过于苛刻,这是个好消息。

最终,这篇论文表明,我们不能仅仅依赖现有的工具来评估古代文献的翻译。这些指标就像是一副为现代街道设计的眼镜;在现代街道上它们效果很好,但当你试图在古代历史那狭窄、蜿蜒的小巷中穿行时,它们就会变得模糊不清。作者提出,为了获得数字人文领域可靠的翻译,我们需要开发新的、更聪明的评估工具,这些工具需要专门针对理解古汉语的独特特性进行训练,而不是仅仅将现代规则套用到古代文本上。在此之前,人类专家仍需对我们的 AI 时光机的成果进行复核。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →