想象一下,互联网就像一座巨大且混乱的图书馆,其中的每一本书都用不同的语言编写而成。长期以来,图书管理员(计算机科学家)建造了一本巨大的、超高密度的百科全书,旨在帮助计算机同时理解所有语言。但当你试图在那本巨著中寻找关于某种微小且特定语言的具体事实时,信息会变得有些模糊。这就像是在拥挤的体育场里试图听清一声耳语;信号在噪音中丢失了。
为了解决这个问题,研究人员开始为单一语言构建较小的、专业化的词典。其中最著名的土耳其语词典建于2020年。这是一个良好的开端,但它是用旧工具建造的,就像是在大家都开着跑车时,你却在骑自行车。与此同时,世界其他地方已经转向了“现代”引擎,这些引擎能读得更快,记忆更长的句子,并且能更好地理解语法的转折与变化。一个大问题是:我们能否使用这些现代工具,专门为土耳其语打造一辆全新的、超快速的跑车,而不需要耗资数十亿美元的预算,也不需要一个像月球一样大的图书馆?
本文介绍了 ModernBERT-TR,这是一种旨在成为计算机终极“土耳其语大脑”的新型人工智能模型。研究人员采用了最新、最先进的架构设计(“ModernBERT”引擎),并从零开始使用土耳其语文本对其进行训练。他们不仅仅是向模型投喂海量数据;他们还精心策划了一种高质量土耳其语写作的平衡组合,并使用了一个专门针对土耳其语单词构建方式进行微调的定制化词典(分词器)。
结果非常强大。尽管这个新模型相对较小——仅包含约1.5亿个“神经元”(参数)——但它的表现优于许多更大的模型,甚至超过了一些参数量几乎是它四倍的模型。在针对11项不同土耳其语任务(如识别仇恨言论或理解电影评论)的测试中,ModernBERT-TR 的平均得分达到了 60.2%,以显著优势击败了排名第二的模型。在一次全量微调测试中,它甚至赶上了规模约为其 7倍数据量(1万亿个token对比该模型的1444亿个token)的竞争对手,证明了聪明的训练方法和更好的架构可以战胜单纯的数据量。
作者认为,其“秘密配方”不仅在于模型的大小,更在于数据的质量组合。他们发现,在训练过程中将特定的高质量土耳其语数据集重复使用五次,比调整批次大小(batch size)等其他设置要重要得多。简而言之,他们打造了一台精悍且高效的土耳其语机器,证明了你不需要规模最大就能做到最好;你只需要最现代且最专注。他们已向公众发布了所有的代码和模型本身,希望能为任何致力于开发土耳其语技术的开发者提供巨大的助力。
技术摘要:ModernBERT-TR
问题陈述
土耳其语自然语言处理(NLP)目前依赖于过时的架构或优化不足的多语言模型。主流的单语言编码器 BERTurk (2020) 使用的是原生 BERT 架构,且是在相对较小的语料库(约 45 亿个 token)上训练的。虽然多语言模型(如 mBERT、XLM-R)提供了覆盖范围,但它们会将容量稀释到多种语言中,从而限制了单语言的性能。此外,近期显著提升了英文编码器质量的架构进步——例如旋转位置嵌入(RoPE)、门控线性单元(GLU)、交替式局部-全局注意力以及序列打包训练(sequence-packed training)——尚未系统性地应用于土耳其语的单语言预训练。
方法论
作者介绍了 ModernBERT-TR,这是一个基于 ModernBERT 架构构建的 1.5 亿参数编码器模型,专门针对土耳其语从头开始进行预训练。
架构与训练配置
- 架构: 该模型遵循 ModernBERT-base 配置,包含 22 个 Transformer 层、768 个隐藏层维度和 12 个注意力头。相比原生 BERT,其关键架构改进包括:
- RoPE: 旋转位置嵌入取代了学习到的绝对位置,以提高对不同序列长度的泛化能力。
- GLU: 前馈网络中使用带有 GELU 激活函数的门控线性单元(GLU)。
- 预归一化(Pre-normalization): 在注意力层和前馈子层之前应用层归一化,以改善梯度流。
- 注意力机制: 大多数层使用 128 个 token 的滑动窗口,每 3 层应用一次全全局注意力,以平衡效率和长程依赖建模。
- 训练效率: 模型利用 Flash Attention 和序列打包训练(将变长文档拼接成固定长度的批次),以消除填充浪费。
- 分词器(Tokenizer): 从头开始在土耳其语数据上训练了一个自定义的 50K WordPiece 分词器。选择该规模是为了在压缩效率与嵌入表大小之间取得平衡,与更大的(128K)替代方案相比,实现了更高的词表效率。
- 训练数据: 语料库由 1444 亿个 token 组成(训练 2 个 epoch)。数据是以下内容的平衡混合:
- FineWeb-2 Turkish: 412 亿个 token(网页抓取)。
- BertTurk Corpus: 62 亿个 token,通过 5 倍上采样(有效 token 为 310 亿)来平衡混合比例并利用更高质量的文本。
- 超参数: 训练使用了 Decoupled StableAdamW 优化器,峰值学习率为 2×10−4,全局批次大小为 256 个序列(26.2 万个 token),并采用带有 10 亿 token 热身阶段(warmup)的余弦学习率调度。模型在 4 块 NVIDIA H100 GPU 上训练了 623 个 GPU 小时。
消融实验
研究人员对学习率、批次大小、余弦调度最终比例 (αf) 以及数据混合进行了系统的消融实验。结果表明,数据构成(特别是对 BertTurk Corpus 的 5 倍上采样)和学习率是下游性能的主要驱动因素,而批次大小和 αf 在测试范围内影响极小。
核心贡献
- ModernBERT-TR 模型: 首个公开可用的、利用 ModernBERT 架构优势(RoPE、GLU、交替注意力、无填充训练)的土耳其语编码器。
- 自定义分词器: 针对土耳其语形态学优化的 50K WordPiece 分词器,展示了卓越的词表效率。
- 精选语料库: 一个结合了 FineWeb-2 和 BertTurk Corpus 的平衡训练语料库,并提供了支持上采样高质量数据的实证证据。
- 系统性消融研究: 确定了数据混合和学习率是土耳其语单语言预训练质量的关键因素。
- 最先进的结果(SOTA): 在土耳其语 NLP 任务中取得了新的基准成绩,且模型规模显著小于领先的多语言替代模型。
- 开源发布: 公开发布了模型权重、分词器、评估代码和训练配置。
结果
冻结编码器线性探测(Frozen-Encoder Linear Probing)
在 11 个多样化的土耳其语 NLP 任务(分类、回归和标记分类)上使用冻结编码器协议进行评估:
- 整体性能: ModernBERT-TR 实现了 60.2% 的平均得分,相对于次优模型(Turkish-E5-large,5.6 亿参数)提升了 13.1%,相对于传统的 BERTurk 基准提升了 70.3%。
- 效率: 尽管仅有约 1.5 亿参数(约为 E5-large 变体大小的 1/4),ModernBERT-TR 在所有任务类别中均表现优于后者。
- 特定任务: 该模型在 11 个任务中的 5 个任务中处于领先地位,包括攻击性语言检测、仇恨言论分类、语言接受度(TrCOLA)和命名实体识别(WikiNER)。
全量微调(TabiBench)
使用全量微调在 28 个任务的 TabiBench 基准上进行评估:
- ModernBERT-TR 得分为 77.28,与同时期的 TabiBERT(在约 1 万亿个混合语言 token 上训练)差距仅为 0.30 分。
- ModernBERT-TR 在 8 个任务类别中的 5 个中领先(文本分类、语义文本相似度、NLI、学术理解、信息检索)。
- TabiBERT 在代码检索和问答方面保持优势,这归功于其在预训练中包含了代码和数学数据。
重要意义
本文证明了现代架构创新结合针对性的单语言预训练可以产生比更大规模的多语言模型更具线性可分性和更有效的表示,即使在训练 token 数量显著较少(1444 亿 vs 1 万亿)的情况下也是如此。
作者声称,对于资源受限的单语言预训练,精细的数据策展和混合(特别是高质量语料库的上采样)比单纯扩大批次大小或调整调度参数能带来更大的收益。通过发布 ModernBERT-TR,作者旨在加速土耳其语 NLP 研究,提供一个既能超越现有基准,又仅需 623 个 GPU 小时即可完成训练的基础模型。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。