MoganBert-TR: A Turkish Encoder Foundation Model Trained from Scratch with a CLM-to-MLM Curriculum
本文介绍了 MoganBert-TR,这是一个拥有 1.49 亿参数的土耳其语编码器基础模型,该模型通过一种新颖的从 CLM 到 MLM 的课程学习以及专门的长文本调度策略从零开始训练而成,不仅在土耳其语 NLP 基准测试中达到了最先进的性能,还产生了一个高效的嵌入模型,其得分达到了其 75.7 亿参数教师模型的 99.5%。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在人工智能的广阔领域中,计算机理解人类语言主要有两种方式。一种通常出现在新闻中,涉及生成文本的模型,它们可以从无到有地创作故事或回答问题。另一种虽然较为低调但同样至关重要,使用的是充当强大搜索引擎和分类器的模型。这些“编码器”模型通过阅读句子并将其转化为紧凑的数学摘要,使计算机能够以惊人的速度比较观点、寻找相关文档或对信息进行分类。多年来,教授这些模型的标准方法是一种特定的猜谜游戏:计算机看到一个带有部分隐藏单词的句子,然后必须预测缺失的部分。这种被称为“掩码语言建模”的方法效果很好,但研究人员长期以来一直在思考,是否有一种更好的方法来教机器理解语言结构,特别是对于像土耳其语这样具有复杂且丰富词形变化的语言。
一组研究人员现在为土耳其语理解构建了一个新的基础,他们证明了模型的教学方式与构建它的架构同样重要。他们创建了一个名为 MoganBert-TR 的模型,该模型是基于大规模土耳其语文本从零开始训练的。他们没有固守传统的猜谜游戏,而是引入了一个两阶段的学习课程。首先,模型学习从左到右阅读文本,预测序列中的下一个词,就像人类读书一样。只有在完成这个初始阶段后,他们才转向传统的隐藏单词并要求模型填空的方法。这种教学策略的转变,结合精心清洗的数据集和处理长句的新方法,使得该模型比之前的版本更擅长理解土耳其语,尤其是在大型数据库中寻找相关信息方面。
研究人员首先从互联网收集了海量文本,包括近期的网页和旧的存档,但他们并没有简单地将这些数据直接灌入训练系统。他们构建了一个复杂的流水线来过滤掉低质量内容,例如垃圾信息或重复的广告,并确保文本具有真正的实用价值。由于当时不存在自动判断土耳其语文本质量的现有工具,他们训练了一个较小的专门化模型来充当“老师”,进而教导一个更快的系统如何做出同样的质量判断。这使他们能够高效地处理数百万份文档,仅保留高质量的材料。他们还为模型创建了一个新的词典,这个词典能比以往的尝试更有效地将土耳其语单词拆分为更小的片段,这至关重要,因为土耳其语单词会根据其在句子中的角色而发生显著的形式变化。
他们的核心发现在于训练过程中操作顺序的重要性。他们测试了在切换到单词隐藏方法之前,先进行从左到右预测的方法是否会产生差异。在一次使用相同计算能力和相同数据的对照实验中,这种新的两阶段方法在检索信息方面远优于传统方法。虽然两种方法在简单的分类任务上表现相似,但在一项搜索测试中,新方法在寻找相关文档方面的表现几乎提高了四倍。研究人员发现,传统方法会导致模型的内部表示坍缩成一种狭窄且无用的形状,使得所有的含义看起来都过于相似。新的课程防止了这种坍缩,使模型能够保持更广泛、更清晰的语言意义视图。
为了进一步优化模型,研究人员在训练的最后阶段实验了计算机的学习方式。他们将过程分为两条路径:一条是模型继续使用短句进行学习,另一条是使用更长的句子进行学习。通过比较这两条路径的结果,他们发现以短句结束训练实际上比以长句结束更能提高模型的整体性能。这一发现令人惊讶,因为人们通常认为长上下文更好。他们还测试了一种称为“模型汤”(model soup)的技术,即通过平均不同训练模型的权重来试图获得两者的优点。然而,他们那仅需极少量额外运行成本的简单分支方法,产生的效果比这种复杂的平均技术更好。
最终产品 MoganBert-TR 在这项研究所采用的现代架构的土耳其语模型中取得了最高分。它在代码检索任务(即从自然语言描述中寻找正确的编程代码片段)方面表现异常出色,在该任务上显著超越了旧模型。这一成功归功于他们的新词典(该词典保留了代码的间距和结构)以及在训练数据中有意识地加入了大量的编程文本。团队还创建了一个伴随模型,专门用于创建适合搜索的文本摘要。通过教导这个较小的模型去模仿一个更庞大、更强大的老师,他们实现了一个几乎与巨型老师性能相当、但计算消耗量仅为后者五十一分之一的结果。
这项工作强调了对于土耳其语这样的语言,仅仅更新模型的结构是不够的;训练方法本身也必须重新思考。研究人员表明,一个从顺序预测转向单词掩码的两阶段课程,可以创造出更稳健的语言理解能力。他们还证明了训练的最后阶段是一个关键的设计空间,其中的微小变化(如处理文本的长度)会对性能产生可衡量的影响。尽管该模型在某些特定领域仍存在弱点,例如在某些语法测试中理解句子结构的能力,但它代表了向前迈出的重要一步。团队已将其模型、词典及构建代码向公众开放,允许他人基于这一土耳其语技术基础进行开发。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。