← 最新论文
💬 NLP

One Form to Transfer Them All: Pretraining Multilingual Language Models Beyond Native Orthography

本文表明,在罗马化文本而非原生正字法或国际音标上进行多语言语言模型的预训练,能显著增强跨不同书写系统的跨语言知识迁移,这表明罗马化应当作为核心预训练设计选择,而非事后的适配手段。

原作者: Muge Zhang, Aaron Jencks, Krishna Badikela, Yulia Tsvetkov, Sachin Kumar

发布于 2026-08-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Muge Zhang, Aaron Jencks, Krishna Badikela, Yulia Tsvetkov, Sachin Kumar

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象这样一个世界:一个单一的计算机程序能够以同等的流利程度阅读、书写并理解地球上的每一种语言。这就是多语言人工智能所承诺的前景,这一领域近年来取得了惊人的进展。这些程序通过阅读海量文本进行学习,吸收语法和意义的模式。它们运作的一个关键部分是一个共享的词汇片段(或称子词)字典,这使得它们能够识别不同语言之间的相似之处。如果两种语言使用相同的字母表,比如英语和西班牙语,它们自然会共享许多此类片段,从而使计算机能够轻松地将知识从一种语言转移到另一种语言。然而,世界充满了使用完全不同书写系统的语言,例如俄语的西里尔字母、印地语的天城文或乌尔都语的阿拉伯字母。当这些脚本互不重叠时,计算机的共享字典就会失效,从一种语言学习以帮助另一种语言的能力也会随之消失。这一障碍长期以来一直是创建真正通用语言模型的绊脚石。

为了解决这个问题,研究人员尝试将不同的书写系统强行转化为统一的形式。一种方法是将文本转换为国际音标(IPA),这是一套代表人类语音符号的通用符号系统。另一种方法是将文本转写为拉丁字母(即英语所使用的字母表),从而有效地将每种语言都用单一的共享脚本重新书写。虽然这些方法在小型实验中显示出了前景,但目前尚不清楚在从头构建大型强大模型时,哪种方法才是真正优越的,或者仅仅在模型训练完成后再进行文本转换是否同样有效。俄亥俄州立大学和华盛顿大学的一个研究小组致力于回答这些问题,他们设计并测试了一系列旨在处理八种不同语言的模型,这些语言跨越了四个不同的语系。

研究人员利用八种语言构建了一个受控实验:英语和西班牙语、俄语和波兰语、印地语和乌尔都语,以及泰米尔语和马拉雅拉姆语。选择这些语言对是因为它们提供了多样化的关系:有些共享脚本,而有些虽然发音相似但使用完全不同的书写系统。他们为每种规模的三种版本语言模型构建了三个模型,规模从大约 4.67 亿参数到超过 10 亿参数不等。对于每种规模,他们分别训练了一个基于原始原生脚本的模型,第二个基于转换为国际音标的文本的模型,第三个基于转换为拉丁字母的文本的模型。至关重要的是,他们保持了其他所有要素的一致性:数据量、计算机架构和训练时间。这使他们能够隔离书写系统本身对模型学习和知识迁移能力的影响。

结果是显著且明确的。在所有测试中,使用转换为拉丁字母(即罗马化)文本训练的模型表现始终最为出色。无论是回答问题、理解句子含义,还是总结新闻文章,罗马化模型在语言间的知识迁移能力上都表现得最强。这种优势随着模型规模的增大而变得更加明显。使用音标训练的模型在大多数情况下也比使用原始脚本训练的模型表现更好,但通常仍逊于罗马化模型。唯一的例外是印地语和乌尔都语这对组合;因为这两种语言在发音上几乎完全相同,但使用完全不同的书写系统,所以音标方法在处理它们时表现异常出色,达到了与罗马化模型相当的水平。然而,当模型被测试处理其从未见过的语言时,罗马化方法仍然是最稳健的。

或许最令人惊讶的发现涉及该领域的一种常用策略:在已使用原生脚本训练好的模型基础上,稍后对其进行罗马化数据的微调。许多研究人员曾认为这是一种高效的捷径,可以让他们在无需重新训练整个模型成本的情况下获得罗马化的益处。研究发现事实恰恰相反。当研究人员将这种捷径应用于他们的模型时,模型在已知语言上的表现实际上大幅下降了。这种干预仅在模型处理从未接触过的语言时才有所帮助,即便如此,与从一开始就用罗马化文本进行训练相比,其提升也十分有限。这表明,罗马化的益处不仅在于最终的输出格式,更在于模型在初始训练阶段如何学习语言的基础结构。

研究还考察了这些不同书写系统的效率。使用复杂脚本(如泰米尔语和马拉雅拉姆语)的语言,在表示相同数量的文本时,比使用拉丁字母的语言需要更多的计算机标记(tokens)。这意味着在原始脚本上进行训练不仅让模型跨语言学习变得更加困难,而且更加昂贵且缓慢。音标法和罗马化方法都压缩了这类文本,使这些语言的成本和速度与其它语言趋于一致。这种压缩结合了在不同脚本间共享知识能力的提升,使得罗马化方法成为构建跨越多样化书写系统多语言模型时最有效的设计选择。

最终,研究表明,对于人工智能而言,要真正弥合世界多种语言之间的鸿沟,如何表示文本是一个根本性的设计决策,而非微小的技术细节。证据表明,在训练模型之前将多样化的脚本转换为共享的拉丁形式,可以产生最佳效果,从而允许系统内化一种适用于跨越语言边界的统一结构。虽然将文本转换为音标符号能带来一些好处(特别是对于发音相似但外观不同的语言),但它无法取代统一脚本的优势。这些发现挑战了“仅在模型建成后进行调整就足够了”的观点;相反,它们指出,在如何教导这些数字大脑阅读世界方面,需要一种深思熟虑的、前置性的策略。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →