NE-BERT: A Multilingual Language Model for Nine Northeast Indian Languages
该论文介绍了 NE-BERT,这是一种在涵盖九种东北印度语言和两种锚点语言的 830 万个句子基础上训练的多语言语言模型,它在困惑度(perplexity)和分词效率方面显著优于现有的 IndicBERT-V2 和 MuRIL 模型,同时解决了低资源语言中关键的词表碎片化问题。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
技术摘要:NE-BERT
问题陈述
现代自然语言处理(NLP)系统在高质量资源语言与低资源语言之间表现出显著的性能差异,这加剧了数字不平等。虽然像 mBERT 这样的通用多语言模型和像 IndicBERT-V2 这样的区域性模型提供了广泛的覆盖范围,但它们无法充分服务于印度东北部的本土语言。该地区拥有 200 多种截然不同的语言,面临着独特的挑战,包括极端的资源匮乏(某些语言的数字化句子不足 1,000 句)、黏着形态结构以及脚本多样性(拉丁字母和孟加拉-阿萨姆字母)。现有的模型在这些语境下往往遭受“词汇碎片化”的问题,即稀有词汇会被拆分为次优的子词单元,从而严重降低推理效率和语义连贯性。
方法论
作者引入了 NE-BERT,这是一个基于 ModernBERT 架构的领域特定多语言编码器模型,专门为九种印度东北部语言和两种锚点语言(印地语和英语)而设计。
1. 数据集构建
训练语料库包含约 830 万个句子,涵盖:
- 9 种印度东北部语言: 阿萨姆语、加罗语、卡西语、梅泰语、米佐语、纳加语、尼希语、普纳语和科克博罗克语。
- 2 种锚点语言: 印地语和英语。
- 来源: 数据通过政府文件、新闻档案、教育材料和文化文本进行整理。针对尼希语和科克博罗克语的特定平行语料库来源于 WMT 2025 Shared Task。
2. 加权采样策略
为了解决极端的数据不平衡问题(从 1,002 句的普纳语到 340 万句的印地语),作者在分词器训练期间采用了激进的加权采样:
- 超低资源语言(如普纳语、科克博罗克语)获得了 100 倍的上采样权重,以确保足够的词汇表示并防止字符级碎片化。
- 锚点语言被降权(印地语 0.05 倍,英语 0.2 倍),以优先考虑东北部语言的词汇,同时保持跨语言迁移能力。
- 注: 这些虚拟计数仅适用于分词器训练;实际的掩码语言模型(MLM)训练使用的是原始句子计数,以防止过拟合。
3. 分词(Tokenization)
本文使用了自定义的 SentencePiece Unigram 分词器(50,368 个 token),而非更常见的字节对编码(BPE)。
- 原理: 与 BPE 的贪婪合并策略相比,Unigram 的概率方法能更好地保留黏着型语言的语言结构。
- 配置: 分词器在加权虚拟计数上进行训练,以确保东北部语言中的常用词能够形成单个 token,从而减少序列长度并提高语义连贯性。
4. 模型架构与训练
- 基础模型: 基于 ModernBERT-base (Warner et al., 2025),拥有 1.49 亿参数(22 层,768 隐藏维度,12 个注意力头)。
- 特性: 旋转位置嵌入(RoPE)、Flash Attention 2 以及用于提高吞吐量的 unpadding 技术。
- 训练: 使用 MLM 进行训练,掩码概率为 15%,并在 10 个 epoch 内进行动态掩码。
- 效率: 模型在单块 NVIDIA A40 GPU(48GB VRAM)上训练了约 17 小时,成本为 7.31 美元。
关键结果
困惑度表现
NE-BERT 在留出的测试集(每种语言 500 句)上与 IndicBERT-V2、MuRIL 和 mBERT 进行了对比评估。
- 整体表现: NE-BERT 在 9 种东北部语言上的平均困惑度为 2.21,显著优于 IndicBERT-V2 (35.29) 和 MuRIL (16.88),并超越了 mBERT (2.76)。
- 平均提升: 在 9 种印度东北部语言中,NE-BERT 的平均困惑度分别比 IndicBERT-V2 和 MuRIL 低 15.97 倍和 7.64 倍。
- 超低资源增益: 在数据量极少的语言中观察到了最显著的改进。对于 普纳语(1,002 句)和 尼希语(55,870 句),NE-BERT 将困惑度降低至 2.92 和 4.33,而 IndicBERT-V2 则出现了灾难性的失败,困惑度分别为 66.92 和 187.20。
- 高资源表现: 在具有丰富维基百科覆盖量的语言(阿萨姆语、梅泰语)上,mBERT 仍具竞争力,但 NE-BERT 依然取得了更优或相当的结果。
分词效率
- 生育率(Fertility): NE-BERT 在东北部语言上的平均分词生育率为 1.68 tokens/word,而 IndicBERT-V2 为 2.08,MuRIL 为 2.14,mBERT 为 2.51。这比 mBERT 提升了 1.50 倍。
- 每字符比特数(BPC): NE-BERT 的平均 BPC 为 0.347,展示了比 IndicBERT-V2 (1.497) 和 MuRIL (1.271) 更优越的压缩效率。
下游评估
在卡西语、米佐语和纳加米斯语的词性标注(POS)任务中:
- NE-BERT 的平均准确率达到 82.4%,比 mBERT (73.3%) 高出 9.1 个百分点,比 IndicBERT-V2 (59.2%) 高出 23.2 个百分点。
重要性与主张
论文指出,NE-BERT 证明了具有适当分词技术的领域特定模型可以有效地服务于仅有 1,000 个训练句子的超低资源语言。
- 词汇优化优于规模: 结果挑战了“仅靠扩大模型规模即可实现低资源性能”的观点。作者认为,对于这些特定的语言语境,精细的词汇优化(通过加权 Unigram 分词)和针对性的训练数据比原始参数量更为关键。
- 成本效益: 在单块 GPU 上以低于 10 美元的成本训练出一个具有竞争力的模型,为开发代表性不足语言的模型提供了一个实用的蓝图。
- 数字包容性: 通过解决“多语言诅咒”和词汇碎片化问题,NE-BERT 旨在支持印度东北部社区的 NLP 研究和数字包容,这些社区在主流 NLP 研究中长期缺位。
作者明确根据 CC-BY-4.0 许可协议 发布了模型、分词器、训练语料库和测试集,以促进可复现性和社区驱动的应用。作者也承认了局限性,包括仅编码器架构(不适用于生成任务)以及需要在所有九种语言上进行更多下游任务评估的需求。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。