Fluency and Faithfulness in Human and Machine Literary Translation
本研究分析了来自 106 部小说的 13 万余个翻译段落,揭示出在文学翻译中,人类译者与谷歌翻译均存在流畅度与忠实度之间一致的负相关关系,同时指出这种权衡在 TranslateGemma 中较弱或不显著。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图将一部复杂而优美的小说从外语翻译成英文。你有两个主要目标,但它们往往将你拉向相反的方向:
- 流畅性:让英文读起来平滑、自然,仿佛由母语者所写。
- 忠实度:保持原文作者意图的含义和结构完全不变,即使读起来略显“异域”或生硬。
本文提出了一个简单的问题:在文学翻译的世界里,这两个目标是否相互冲突? 让译文听起来更自然,是否自动意味着你失去了一些原文的含义?
作者 Sarah Griebel 和 Ted Underwood 决定利用一个包含 106 部不同小说的 130,000 个段落的大型图书馆来测试这一点。他们比较了三类译者:
- 人类:专业的人类译者。
- Google Translate:传统的机器翻译系统。
- TranslateGemma:一种较新的、先进的人工智能(大语言模型)。
工具:如何衡量“拔河”
为了衡量流畅性,他们没有让人类去阅读文本,而是构建了一个“侦探机器人”。这个机器人被训练用来识别原本用英文写的文本与经过翻译的文本之间的差异。
- 技巧:为了确保机器人不是仅仅根据故事内容(词汇)来猜测,他们将句子剥离到其骨架:词性(名词、动词、形容词等)。
- 逻辑:如果一个段落看起来像原生英文的骨架,机器人会给予较高的“流畅性”得分。如果它看起来像翻译后的骨架(略显笨拙或结构不同),得分则较低。
为了衡量忠实度,他们使用了一种名为COMET-KIWI的工具。可以将其视为一个“含义检查器”。它查看源文本和译文,并试图猜测:“它保留了多少原文的含义?”它不需要完美的译文作为对照;它直接评估这一对文本。
重大发现:“长度”陷阱
在找到主要答案之前,研究人员遇到了一个障碍。他们注意到段落长度扰乱了他们的结果。
- 类比:想象一下,试图评判一名学生总结一本书的优劣。如果学生写的总结只有一句话长,很难对整本书保持忠实,但让这一句话听起来很流畅却很容易。如果他们写了一篇 10 页的总结,很难保持其绝对流畅,但更容易保留所有细节。
- 发现:长段落往往在流畅性和忠实度两方面得分都较低。短段落在这两方面得分都较高。这使得流畅性和忠实度看起来似乎无关,但实际上,文本的长度是幕后操纵的隐藏变量。
真正的答案:权衡
一旦他们在数学上对段落长度进行了“控制”(进行同类比较),一个清晰的模式便浮现出来:存在一种权衡。
当译文变得更加流畅(更像母语者所说)时,它往往会对原文含义的忠实度略有降低。
- 人类译者:他们展现了这种权衡的最强版本。当人类让文本听起来非常自然时,他们通常不得不微调含义以达成此目的。
- Google Translate:也显示出这种负相关关系,尽管稍弱一些。
- 人工智能(TranslateGemma):这是一个惊喜。人工智能显示出弱得多的权衡,有时甚至不存在。它似乎能够同时做到流畅和忠实,或者至少,这两者之间的关系不像人类那样界限分明。
这意味着什么?
该论文表明,在文学翻译中,你无法总是拥有一切。
- 如果你希望文本读起来完全像一部原生英文小说,你可能不得不牺牲一点点原文的结构或含义。
- 如果你希望严格遵循原文结构以保留每一个细微差别,文本可能会听起来略显“异域”或不够流畅。
作者还指出,他们的“流畅性”检测器是基于 19 世纪和 20 世纪初的书籍训练的。这意味着它偏爱较老式英文文学的风格。由于人类译者通常试图匹配这种历史风格,他们在流畅性上得分可能更高。而基于现代互联网文本训练的现代人工智能,即使语法完美,对检测器来说也可能显得“过于现代”。
总结
简而言之,该论文证明,在翻译小说的世界里,流畅性与严格准确性往往处于一种温和的拔河之中。 让译文听起来更像一本原生英文书籍,通常需要在多大程度上严格遵循原文方面做出微小的妥协。有趣的是,虽然人类和较旧的人工智能系统清晰地展现了这种张力,但更新、更智能的人工智能模型似乎以不同的方式处理这种平衡,有时能够在没有同样明显权衡的情况下,同时做到流畅和准确。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。