Source-Free MT Evaluation Is Not MT Evaluation
本文认为,机器翻译评估必须从根本上以源文为依据以确保充分性,并呼吁进行一场范式转变,即要求将质量估计视为一种主要的评估方法,而仅将参考译文作为辅助证据而非主导标准。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在翻译语言的计算机世界中,人们始终需要知道机器做得是否出色。想象一位精通两种语言的翻译员;我们需要一种方法来检查他在第二种语言中所写的内容是否确实与第一种语言所表达的意思相同。几十年来,检查这种方式的标准做法是将机器的输出结果与人类编写的、关于翻译“应该”呈现何种样貌的示例进行对比。这个人类示例被称为“参考译文”。如果计算机的词汇与人类的词汇高度匹配,系统就会获得高分。这种方法在检查翻译是否听起来自然以及语法是否正确方面效果很好。然而,它有一个盲点:如果计算机选择了与人类不同的词汇,它无法轻易判断翻译是否忠实于原意。一个意思表达完美的翻译可能在形式上与人类示例大相径庭,而在旧有的规则下,它会因为这种差异而受到惩罚。
来自印度的研究团队着手调查,目前最先进的工具究竟是在关注原始含义,还是仅仅痴迷于匹配人类的示例。他们专注于一种特定的评估工具,这种工具理应同时观察三件事:原始句子、机器的翻译以及人类的参考译文。研究人员想要知道,这些工具是真的以原始句子作为判断准确性的主要依据,还是在秘密地让人类参考译文来主导评分。为了查明真相,他们设计了一个巧妙的测试:他们取了一个完美的翻译,然后将原始句子或人类参考译文中的其中之一替换为不符合要求的内容。如果一个工具真正以原始含义为基础,那么改变原始句子对得分的影响应该比改变人类参考译文更大。如果一个工具对参考译文存在偏见,那么即使翻译对于原始句子来说仍然有意义,它也会在参考译文发生变化时表现得手忙脚乱。
这项调查的结果揭示了这些先进工具运作方式中一个令人惊讶且系统性的缺陷。当研究人员测试一款名为 COMET 的流行工具时,他们发现改变人类参考译文会导致分数大幅下降,而改变原始句子却几乎没有产生什么影响。事实上,在他们测试的几乎每一个案例中,该工具对人类参考译文变化的敏感度都是对原始文本变化的十倍以上。这意味着该工具将人类参考译文视为绝对真理,而不是将原始句子视为权威。即使机器的翻译根据原始句子来看是完全正确的,仅仅因为其与人类参考译文不符,该工具也会给出极低的分数。研究人员还测试了其他复杂的工具。其中一个工具 XCOMET-XXL 虽然比 COMET 更关注原始句子,但它对人类参考译文的变化反应依然更为强烈。另一个工具 MetricX 则呈现出一种复杂的情况:在将语言翻译成英语时,它表现出对参考译文的严重偏见;但在将英语翻译成其他语言时,它的表现则更为公平。
该研究还探讨了大语言模型(即那些能够进行写作和推理的强大人工智能系统)作为评判者时的表现。当这些模型被要求对翻译进行评分时,如果允许它们将机器输出与人类参考译文进行比较,其表现通常会比仅观察原始句子时更好。这表明,相比于理解一种语言如何真实地匹配另一种语言,这些模型似乎更容易发现两种文本之间的相似性。研究人员发现,当原始句子与人类参考译文发生冲突时,模型往往会站在参考译文的一边,从而忽略了原始含义。这是一个关键问题,因为原始句子是定义翻译应当为何种含义的唯一依据。如果一个翻译保留了原始含义但与人类参考译文不同,那么它是一个好的翻译。如果一个翻译虽然匹配了人类参考译文但改变了原始含义,那么它就是一个坏的翻译。
作者认为,整个领域的研究方向都搞反了。目前,研究人员将人类参考译文视为“金标准”,而将原始句子仅仅视为在缺失参考译文时的备选方案。论文建议翻转这种关系。原始句子应该是判断翻译是否准确的首要权威,而人类参考译文应该被视为表达该含义的一种可能的示例。研究人员指出,单一的人类参考译文永远无法捕捉到一句话所有可能的翻译方式。它可能会在语法或风格上做出原始文本并不要求的选择。通过过度依赖参考译文,评估工具正在惩罚那些虽然忠实于源文但与人类示例不同的翻译。
这项研究并不是说人类参考译文毫无用处。它们在检查翻译是否自然流畅以及是否符合语感方面仍然非常有帮助。然而,研究结论指出,任何在评估过程中剔除原始句子,或者允许人类参考译文凌驾于原始含义之上的系统,在本质上都是不完整的。研究人员呼吁采用一种新的方法,即评估工具应被明确设计为优先考虑原始句子与机器输出之间的关系。他们建议,未来的工具应经过测试,以确保它们在原始含义发生变化时会做出强烈反应,并且应将人类参考译文视为一个有益的提示,而非最终的定论。在此转变发生之前,我们看到的机器翻译系统的评分,可能衡量的并不是计算机理解并保留原始信息的能力,而是它模仿特定人类作者的能力。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。