An Investigation of Translationese in the Generations of Multilingual Large Language Models
本文通过分析五种语言的语言特征,并将多语言大语言模型(MLLM)生成的文本与非翻译文本及人工撰写的基准文本进行对比,研究了多语言大语言模型是否会产生类似于人工翻译文本的“翻译腔”。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
当一个人使用非母语进行表达时,他们的言辞往往会携带一种微妙且无形的指纹。他们可能会使用略显生硬的句式,选择那些在技术上正确但当地人极少使用的词汇,或者以一种透露出母语影响的方式来排列短语。语言学家将这种现象称为“翻译腔”(translationese)。它是原始语言留下的持久回响,即使在文本已被成功翻译后依然清晰可见。几十年来,这一概念一直在人类翻译领域中被研究,学者们分析翻译行为如何改变语言的质感。然而,如今人工智能领域出现了一个新的问题。大型语言模型——这些能够用数十种语言流利写作的强大计算机系统——正变得越来越普遍。虽然这些机器生成的文本在表面上看起来完美无瑕,但研究人员开始怀疑,它们是在用目标语言进行真正的思考,还是在秘密地将所有内容从一种占主导地位的内部语言(很可能是英语)进行翻译后再输出最终结果。如果它们确实在这样做,那么它们的输出就会带有人类翻译家所留下的那种隐藏的翻译指纹。
一组研究人员试图通过将人工智能模型生成的文本视为一种“翻译”来调查这种可能性。他们想知道,即使在被要求直接使用特定语言写作时,这些机器生成的文本是否听起来像是经过翻译的。为此,他们收集了五种不同语言的文本样本:英语、德语、西班牙语、希腊语和帕什图语。他们创建了一个庞大的文本集,其中包含三种截然不同的类型:母语者自然书写的文本、由人类进行的真实翻译文本,以及由两种最先进的人工智能模型生成的文本。他们还加入了第四种类型,即由人工智能先用英语写作,再由一个独立的计算机程序将其翻译成目标语言,以此来对比人工智能直接用目标语言写作的效果。随后,研究人员使用了一个精密的计算机程序,该程序经过训练可以识别特定的“翻译腔”模式。该程序在数以千计的人类写作和人类翻译案例上进行了学习,学会了如何识别区分母语使用者与翻译者的细微统计学差异。
结果显示出一个清晰的模式。当人工智能模型用英语写作时,其文本很少被标记为翻译文本,这表明它们在其主导语言中运作自然。然而,一旦模型切换到其他语言,情况就发生了变化。在德语和西班牙语中,人工智能生成的文本表现出强烈的“翻译腔”迹象。计算机程序识别出很大一部分德语文本和大量的西班牙语文本具有明显的翻译特征。这表明,即使在被提示直接使用这些语言写作时,模型可能也在依赖一种类似于翻译的内部过程,或许是先用英语思考,然后再进行转换。当研究人员观察模型选择的具体词汇时,这种效应更加显著。他们发现,人工智能倾向于避开人类可能会犯的最明显、最笨拙的错误,但它仍然在常用词汇的细微分布上表现挣扎。例如,在德语中,模型使用某些常见连接词的模式更符合翻译文本而非母语表达;而在西班牙语中,它们使用诸如“the”(定冠词/指示词逻辑)之类的词汇频率远低于母语使用者。
有趣的是,这种“翻译”效应的程度在很大程度上取决于语言本身。模型在处理数字资源较少的语言(希腊语和帕什图语)时,表现比在处理德语和西班牙语时更好。在这些低资源语言中,人工智能生成的文本被标记为翻译文本的可能性较低。研究人员认为,这可能是因为德语和西班牙语的训练数据中包含大量的现有翻译材料,模型只是在模仿这些材料。相比之下,希腊语和帕什图语的训练数据可能包含较少的翻译内容,从而迫使模型更多地依赖于现有的母语结构。研究团队还请人类读者对一小部分文本进行评判。令人惊讶的是,人类往往无法察觉到计算机程序能轻易识别出的那种“翻译腔”。人类主要注意到奇怪的选词或奇特的组合,而计算机则检测到了词汇排列方式中更深层的统计学偏移。这表明,尽管人工智能可能隐藏了最明显的错误,但其写作的底层结构仍然暴露了其缺乏母语流利度的事实。
研究结论认为,这些强大的语言模型尚未能在非英语语言中实现真正的母语化生成。相反,它们的输出往往带有翻译的隐藏签名,这表明其内部处理过程仍锚定在英语之上。这并不意味着这些模型是失败的;它们通常非常高效且实用。然而,这揭示了它们学习和运作方式的一个根本局限性。它们似乎掌握了许多语言的表层,但在推理时仍依赖于一个以英语为核心的框架。研究人员指出,这一发现有助于解释为什么这些模型有时在处理文化细微差别或非英语语言的自然流利度方面表现挣扎。通过识别这些隐藏的指纹,这项研究提供了一种衡量机器生成文本真实质量的新方法,使其超越了简单的正确性,转而评估机器试图模拟的那种声音是否具有真正的自然感。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。