← 最新论文
💬 NLP

EstLLM: Enhancing Estonian Capabilities in Multilingual LLMs via Continued Pretraining and Post-Training

本文表明,将持续预训练与爱沙尼亚语增强的多语言回放以及轻量化后训练对齐相结合,能够显著提升多语言大语言模型在爱沙尼亚语方面的能力,同时有效地保持其英语性能和通用推理能力。

原作者: Aleksei Dorkin, Taido Purason, Emil Kalbaliyev, Hele-Andra Kuulmets, Marii Ojastu, Mark Fišel, Tanel Alumäe, Eleri Aedmaa, Krister Kruusmaa, Kairit Sirts

发布于 2026-08-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Aleksei Dorkin, Taido Purason, Emil Kalbaliyev, Hele-Andra Kuulmets, Marii Ojastu, Mark Fišel, Tanel Alumäe, Eleri Aedmaa, Krister Kruusmaa, Kairit Sirts

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

大语言模型是当今许多最先进人工智能工具背后的引擎,它们能够编写故事、解决问题并回答问题。这些系统通过阅读数十亿个示例,从互联网的海量文本中学习人类语言的模式。然而,用于教导它们的数据在英语方面存在严重倾斜。由于英语在数字世界中占据主导地位,这些模型成为了英语专家,但在面对像爱沙尼亚语这样数字代表性较少的较小语言时,往往表现挣扎。这种不平衡意味着,虽然人工智能可以用英语写出一篇完美的论文,但如果被要求用爱沙尼亚语完成同样的工作,它可能会产生令人困惑或错误的文本。研究人员现在正致力于弥补这一差距,探讨是否有可能在不破坏现有技能的前提下,教会这些以英语为主的强大模型一种新语言。

来自爱沙尼亚的一个研究小组致力于回答这个问题,他们创建了一个专门为爱沙尼亚语定制的大语言模型的特殊版本。他们从两个现有的模型开始:一个是在英语数据上经过大量训练的模型,另一个则已经对多种语言有一定的了解。研究人员并没有从头开始构建一个新模型。相反,他们利用这些现有系统,使用特定的数据组合对其进行了专注的“再教育”。首先,他们让模型接触大量的爱沙尼亚语文本,包括文学、学术写作和网络内容,以建立语言知识的基础。为了确保模型不会忘记如何推理或理解其他主题,他们在训练阶段混合了英语文本、代码和数学问题。这个被称为“持续预训练”的过程,使得模型能够在保持通用智能完好的同时学习爱沙尼亚语。

在初始训练之后,研究人员对模型进行了精炼,使其更擅长遵循指令,这是聊天机器人和助手的一项关键技能。他们利用真实的人类对话和合成示例,教导模型如何用爱沙尼亚语和英语响应用户指令。他们过程中的一个关键步骤涉及一种称为“聊天向量合并”(chat vector merging)的技术。想象一下,一个模型就像一名学习了新语言但忘记了如何礼貌交谈或遵循复杂规则的学生。研究人员将原始英语版模型中关于“如何遵循指令”的“知识”,融入到了他们新的爱沙尼亚语训练版本中。这使得最终的产品既能说流利的爱沙尼亚语,又能保留清晰遵循指令的能力。

实验结果令人惊讶且意义重大。在训练开始前,那个已经具备多语言能力的模型在爱沙尼亚语任务上的表现优于那个以英语为主的模型。然而,在适配过程之后,情况发生了反转。那个最初拥有强大英语基础的模型在爱沙尼亚语方面展现出了更大的进步,最终超越了那个多语言模型。这表明,模型在特定语言上的起点并不一定能预测它日后学习该语言的效果。研究人员发现,适配后的模型在理解语法、翻译文本和解决爱沙尼亚语逻辑谜题方面比以前好得多。他们还在一个公共竞技场中测试了这些模型,在那里人类用户可以与它们聊天并为最佳回复投票。新的爱沙达尼亚语模型排名很高,成功地与规模更大、更复杂的系统展开了竞争。

这项研究也揭示了这些模型学习能力的局限性。研究人员测试了多次重复爱沙尼亚语训练数据是否能帮助模型学得更好,这是其他一些研究中使用过的方法。他们发现,对于这种规模的模型,第二次遍历数据并没有带来实质性的好处,纯粹是计算能力的浪费。一次训练周期就足够了。此外,研究人员发现,虽然模型变得非常擅长爱沙尼亚语,但也存在轻微的权衡:它们在英语方面遵循指令的能力略有下降。然而,聊天向量合并技术成功恢复了大部分失去的英语能力,证明了在不牺牲通用能力的前提下,实现模型针对较小语言的专业化是可能的。

这项工作为改进那些经常被忽视的语言中的人工智能提供了一条清晰的路径。通过仔细混合新的语言数据与现有知识,并使用聪明的技术来融合不同的模型行为,研究人员可以为特定社区创建强大的工具,而无需从零开始。研究结果表明,适配大语言模型最有效的方法可能不是从一个已经了解该语言的模型开始,而是采取一个在通用推理方面很强的模型,并用均衡的数据“食谱”来教它新语言。由此产生的模型现在已供他人使用,为爱沙尼亚语使用者提供了高质量、母语级的体验,同时保持了全球智能的稳健性。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →