NE-BERT: A Multilingual Language Model for Nine Northeast Indian Languages
Het artikel introduceert NE-BERT, een meertalig taalmodel dat is getraind op 8,3 miljoen zinnen in negen Noordoost-Indiase talen en twee anker-talen, wat bestaande modellen zoals IndicBERT-V2 en MuRIL aanzienlijk overtreft in perplexiteit en tokenisatie-efficiëntie, terwijl het tegelijkertijd kritieke vocabulairefragmentatie in minderheidstalen aanpakt.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Technische Samenvatting: NE-BERT
Probleemstelling
Moderne systemen voor natuurlijke taalverwerking (NLP) vertonen een aanzienlijk prestatieverschil tussen hoog-resource en laag-resource talen, wat digitale ongelijkheid versterkt. Terwijl algemene meertalige modellen zoals mBERT en regionale modellen zoals IndicBERT-V2 brede dekking bieden, slagen zij er niet in om de inheemse talen van Noordoost-India adequaat te bedienen. Deze regio, die huisvest aan meer dan 200 verschillende talen, staat voor unieke uitdagingen waaronder extreme schaarste aan middelen (sommige talen hebben minder dan 1.000 gedigitaliseerde zinnen), agglutinerende morfologische structuren en scriptdiversiteit (Latijn en Bengaals-Assamees). Bestaande modellen lijden vaak aan "vocabulairefragmentatie" in deze contexten, waarbij zeldzame woorden worden opgedeeld in suboptimale subwoordeenheden, wat de inferentie-efficiëntie en semantische coherentie ernstig verslechtert.
Methodologie
De auteur introduceert NE-BERT, een domeinspecifiek meertalig encoder-model gebaseerd op de ModernBERT-architectuur, specifiek ontworpen voor negen Noord-Oost-Indiase talen en twee anker-talen (Hindi en Engels).
1. Dataset Constructie
Het trainingscorpus bestaat uit ongeveer 8,3 miljoen zinnen die het volgende beslaan:
- 9 Noord-Oost-Indiase Talen: Assamees, Garo, Khasi, Meitei, Mizo, Naga, Nyishi, Pnar en Kokborok.
- 2 Anker-talen: Hindi en Engels.
- Bronnen: De data werd gecureerd uit overheidsdocumenten, nieuwsarchieven, educatief materiaal en culturele teksten. Specifieke parallelle corpora voor Nyishi en Kokborok werden afkomstig van de WMT 2025 Shared Task.
2. Gewogen Sampling Strategie
Om de extreme data-onbalans (variërend van 1.002 zinnen voor Pnar tot 3,4 miljoen voor Hindi) aan te pakken, hanteerde de auteur agressieve gewogen sampling tijdens de training van de tokenizer:
- Ultra-laag-resource talen (bijv. Pnar, Kokborok) ontvingen een 100× upsampling-gewicht om voldoende vocabulaire-representatie te garanderen en karakter-niveau fragmentatie te voorkomen.
- Anker-talen werden gedownweighted (Hindi 0,05×, Engels 0,2×) om de vocabulaire van Noord-Oostelijke talen te prioriteren terwijl cross-linguale transfermogelijkheden behouden bleven.
- Opmerking: Deze virtuele aantallen waren alleen van toepassing op de tokenizer-training; de feitelijke Masked Language Modeling (MLM) training gebruep de ruwe zinenaantallen om overfitting te voorkomen.
3. Tokenisatie
Het artikel maakt gebruik van een aangepaste SentencePiece Unigram tokenizer (50.368 tokens) in plaats van de meer gangbare Byte-Pair Encoding (BPE).
- Rationale: De probabilistische benadering van Unigram bewaart de linguïstische structuren van agglutinerende talen beter dan de gulzige (greedy) merge-strategie van BPE.
- Configuratie: De tokenizer werd getraind op de gewogen virtuele aantallen om ervoor te zorgen dat veelvoorkomende woorden in laag-resource talen als enkele tokens worden gevormd, wat de sequentielengte vermindert en de semantische coherentie verbetert.
4. Modelarchitectuur en Training
- Basis: ModernBERT-base (Warner et al., 2025) met 149 miljoen parameters (22 lagen, 768 verborgen dimensie, 12 attention heads).
- Kenmerken: Rotary Position Embeddings (RoPE), Flash Attention 2, en unpadding voor verbetering van de doorvoer.
- Training: Getraind met MLM met een 15% masking-waarschijnlijkheid en dynamische masking over 10 epochs.
- Efficiëntie: Het model werd getraind op een enkele NVIDIA A40 GPU (48GB VRAM) gedurende ~17 uur tegen een kostenpost van $7,31.
Belangrijkste Resultaten
Perplexity Prestaties
NE-BERT werd geëvalueerd op helden-testsets (500 zinnen per taal) tegenover IndicBERT-V2, MuRIL en mBERT.
- Algemene Prestaties: NE-BERT bereikte een gemiddelde perplexiteit van 2,21 over de 9 Noord-Oost-Indiase talen, waarmee het significant presteert ten opzichte van IndicBERT-V2 (35,29) en MuRIL (16,88), en superieur is aan mBERT (2,76).
- Gemiddelde Verbetering: NE-BERT bereikte respectievelijk 15,97× en 7,64× lagere gemiddelde perplexiteit vergeleken met IndicBERT-V2 en MuRIL over de 9 Noord-Oost-Indiase talen.
- Ultra-laag-resource Winsten: De meest dramatische verbeteringen werden waargenomen in talen met minimale data. Voor Pnar (1.002 zinnen) en Nyishi (55.870 zinnen) verminderde NE-BERT de perplexiteit tot respectievelijk 2,92 en 4,33, terwijl IndicBERT-V2 catastrofaal faalde met perplexiteitsscores van 66,92 en 187,20.
- High-Resource Prestaties: Op talen met uitgebreide Wikipedia-dekking (Assamees, Meitei), bleef mBERT competitief, maar NE-BERT behaalde nog steeds superieure of vergelijkbare resultaten.
Tokenisatie Efficiëntie
- Fertiliteit: NE-BERT bereikte een gemiddelde tokenisatie-fertiliteit van 1,68 tokens/woord voor Noord-Oost-talen, vergeleken met 2,08 voor IndicBERT-V2, 2,14 voor MuRIL, en 2,51 voor mBERT. Dit vertegenwoordigt een 1,50× verbetering ten opzichte van mBERT.
- Bits Per Character (BPC): NE-BERT bereikte een gemiddelde BPC van 0,347, wat een superieure compressie-efficiëntie aantoont vergeleken met IndicBERT-V2 (1,497) en MuRIL (1,271).
Downstream Evaluatie
In Part-of-Speech (POS) tagging taken over Khasi, Mizo en Nagamese:
- NE-BERT bereikte een gemiddelde nauwkeurigheid van 82,4%, waarmee het mBERT (73,3%) met 9,1 procentpunt en IndicBERT-V2 (59,2%) met 23,2 procentpunt versloeg.
Betekenis en Claims
Het artikel stelt dat NE-BERT aantoont dat domeinspecifieke modellen met passende tokenisatie effectief kunnen dienen voor ultra-laag-resource talen met zelfs maar 1.000 trainingszinnen.
- Vocabulaire Optimalisatie boven Schaal: De resultaten dagen het idee uit dat het schalen van de modelgrootte alleen voldoende is voor laag-resource prestaties. De auteur beargumenteert dat zorgvuldige vocabulaire-optimalisatie (via gewogen Unigram tokenisatie) en gerichte trainingsdata belangrijker zijn dan het ruwe aantal parameters voor deze specifieke linguïstische contexten.
- Kosteneffectiviteit: Het succesvol trainen van een competitief model op een enkele GPU voor minder dan $10 biedt een praktisch blauwdruk voor het ontwikkelen van taalmodellen voor ondervertegenwoordigde talen wereldwijd.
- Digitale Inclusie: Door de "vloek van multilingualiteit" en vocabulairefragmentatie aan te pakken, beoogt NE-BERT de ondersteuning van NLP-onderzoek en digitale inclusie voor de gemeenschappen in Noord-Oost-India te bevorderen, die grotendeids afwezig zijn geweest in mainstream NLP-onderzoek.
De auteur stelt het model, de tokenizer, de trainingscorpus en de testsets expliciet vrij onder een CC-BY-4.0 licentie om reproduceerbaarheid en community-gestuurde toepassingen te faciliteren. Er wordt erkenning gegeven aan beperkingen, waaronder de encoder-only architectuur (ongeschikt voor generatieve taken) en de noodzaak voor verdere downstream evaluatie over diverse taken en alle negen talen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.