← 最新论文
💬 NLP

Learning from Many Voices: Literary MT Using Multi-Reference Human and Synthetic Data

本文提出了一种基于语义相似度的过滤框架,以利用多参考数据集进行文学机器翻译,并证明了在具有中高相似度的人类翻译数据上进行微调,其效果优于低相似度数据以及合成的 LLM 生成替代方案。

原作者: Si Wu, John Wieting, David A. Smith

发布于 2026-09-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Si Wu, John Wieting, David A. Smith

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

语言是一种活生生的事物,当一部伟大的文学作品被翻译时,它并不仅仅像被运送的包裹那样从一种语言移动到另一种语言。相反,它发生了蜕变。同一个故事可以用许多不同的方式来讲述,每种方式都捕捉到了略有不同的意义、节奏或文化细微差别。在机器翻译的世界里,计算机试图学习如何进行文本翻译,这种多样性呈现出了一个独特的谜题。几十年来,研究人员一直利用海量数据来训练这些系统,通常依赖于单一的、完美的译文,或是人工生成的变体,以此来教计算机什么是正确的句子。然而,文学作品不同于新闻报道或技术手册;它们充满了隐喻、风格和文化语境,单一的“正确”版本往往无法捕捉到原著的全部深度。研究人员面临的问题是:计算机能否学会欣赏这些多种有效解读中的丰富性,还是会被其中的差异所困扰。

一个研究小组着手调查如何最好地教机器处理这种复杂性。他们转向了一个包含同一文学段落的多种人工翻译的数据集,主要涉及从法语和俄语翻译成英语的内容。这些并非随机的猜测,而是由不同的专业人士完成的专家级翻译,每位译者都对如何传达作者的声音做出了自己的选择。研究人员想知道,他们是否可以利用这些多个版本来训练一个更好的翻译系统。他们的方法涉及一个精细的过滤过程。他们测量了不同的译文彼此之间的语义相似度。如果两个译文几乎完全相同,它们提供的有用信息就很少;如果它们差异过大,则可能代表对原文的误解。目标是找到那个“甜点区”:即既忠实于原意,又在措辞和结构上具有足够差异,从而向计算机展示故事可以被讲述的多种方式的译文。

该团队发现,并非所有数据都是平等的。当他们使用那些彼此差异极大的译文来训练模型时,结果很差。计算机难以找到一条一致的路径,经常产生错误或生硬的措辞。然而,当他们专注于那些共享核心含义、但在表达方式上仍展现出有意义变化的译文时,性能得到了显著提升。这些“中到高”相似度的数据集教会了机器既要准确又要灵活。事实上,使用这套经过精心过滤的数据集所产生的效果,与使用整个未经筛选的、包含了嘈杂且令人困惑的示例的完整译文集相比,效果持平甚至更好。这表明,在教机器处理文学作品时,质量和正确的多样性远比单纯的数据量更为重要。

研究人员还测试了一种流行的现代捷径:使用人工智能生成额外的译文,而不是仅仅依赖人类专家。其想法是,计算机可以快速创建数千个变体来填补空白,特别是对于人类翻译稀缺的语言。虽然这种方法既廉价又方便,但研究发现它表现不佳。基于这些合成的、计算机生成的译文训练的模型,其表现不如基于人类专家作品训练的模型。人工翻译往往缺乏人类专业人士在任务中所带来的那种微妙的文化理解和风格优雅。即使是用于生成这些合成示例的最先进语言模型,也无法可靠地模仿人类专业知识的深度。人类的译文仍然是金标准,证明了对于文学翻译这一微妙的艺术而言,人类的判断力依然不可或缺。

最终,这项研究为改进机器如何翻译伟大文学提供了一条清晰的路径。它表明,关键不仅在于向计算机喂入更多的数据,而在于喂入正确类型的数据:即那些尊重原意同时拥抱人类表达自然多样性的译文。通过过滤掉噪音,并专注于人类作品中丰富的、忠实的变体,研究人员可以构建出更准确、对源文本之美更具敏感性的系统。虽然人工智能可以辅助生成数据,但它目前还无法取代人类译者的深层直觉理解。文学机器翻译的未来在于一种伙伴关系,即技术利用人类洞察力的精华,确保故事在跨越语言时,能完整地保留其意义与精神。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →