← Últimos artículos
💬 NLP

NE-BERT: A Multilingual Language Model for Nine Northeast Indian Languages

El artículo presenta NE-BERT, un modelo de lenguaje multilingüe entrenado con 8,3 millones de frases a través de nueve lenguas del noreste de la India y dos lenguas ancla, el cual supera significativamente a modelos existentes como IndicBERT-V2 y MuRIL en perplejidad y eficiencia de tokenización, al tiempo que aborda la fragmentación crítica del vocabulario en lenguas de bajos recursos.

Autores originales: Badal Nyalang

Publicado 2026-08-20
📖 1 min de lectura☕ Lectura para el café

Autores originales: Badal Nyalang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Resumen Técnico: NE-BERT

Planteamiento del Problema

Los sistemas modernos de Procesamiento de Lenguaje Natural (NLP) exhiben una disparidad de rendimiento significativa entre lenguas de altos recursos y de bajos recursos, lo que refuerza las inequidades digitales. Mientras que los modelos multilingües generales como mBERT y los modelos regionales como IndicBERT-V2 ofrecen una cobertura amplia, no logran servir adecuadamente a las lenguas indígenas del noreste de la India. Esta región, hogar de más de 200 lenguas distintas, enfrenta desafíos únicos que incluyen una escasez extrema de recursos (algunas lenguas cuentan con menos de 1,000 oraciones digitalizadas), estructuras morfológicas aglutinantes y diversidad de escrituras (latín y bengalí-asamesa). Los modelos existentes suelen sufrir de "fragmentación de vocabulario" en estos contextos, donde las palabras raras se dividen en unidades de subpalabras subóptimas, degradando severamente la eficiencia de la inferencia y la coherencia semántica.

Metodología

El autor introduce NE-BERT, un modelo codificador multilingüe de dominio específico basado en la arquitectura ModernBERT, diseñado específicamente para nueve lenguas del noreste de la India y dos lenguas ancla (hindi e inglés).

1. Construcción del Conjunto de Datos

El corpus de entrenamiento comprende aproximadamente 8.3 millones de oraciones que cubren:

  • 9 lenguas del noreste de la India: asames, garo, khasi, meitei, mizo, naga, nyishi, pnar y kokborok.
  • 2 lenguas ancla: hindi e inglés.
  • Fuentes: Los datos fueron curados a partir de documentos gubernamentales, archivos de noticias, materiales educativos y textos culturales. Los corpus paralelos específicos para nyishi y kokborok se obtuvieron de la Tarea Compartida WMT 2025.

2. Estrategia de Muestreo Ponderado

Para abordar el desequilibrio extremo de datos (que oscila entre 1,002 oraciones para el pnar hasta 3.4 millones para el hindi), el autor empleó un muestreo ponderado agresivo durante el entrenamiento del tokenizador:

  • Las lenguas de recursos ultra bajos (por ejemplo, pnar, kokborok) recibieron un peso de sobremuestreo de 100× para asegurar una representación adecuada del vocabulario y prevenir la fragmentación a nivel de caracteres.
  • Las lenguas ancla fueron penalizadas (hindi 0.05×, inglés 0.2×) para priorizar el vocabulario de las lenguas del noreste manteniendo la capacidad de transferencia translingüística.
  • Nota: Estos conteos virtuales se aplicaron únicamente al entrenamiento del tokenizador; el entrenamiento real de Modelado de Lenguaje Enmascarado (MLM) utilizó los conteos de oraciones reales para evitar el sobreajuste.

3. Tokenización

El artículo utiliza un tokenizador SentencePiece Unigram personalizado (50,368 tokens) en lugar del más común BPE (Byte-Pair Encoding).

  • Razón: El enfoque probabilístico de Unigram preserva mejor las estructuras lingüísticas de las lenguas aglutinantes en comparación con la estrategia de fusión codiciosa de BPE.
  • Configuración: El tokenizador fue entrenado con los conteos virtuales ponderados para asegurar que las palabras comunes en las lenguas de bajos recursos formen tokens únicos, reduciendo la longitud de la secuencia y mejorando la coherencia semántica.

4. Arquitectura del Modelo y Entrenamiento

  • Base: ModernBERT-base (Warner et al., 2025) con 149 millones de parámetros (22 capas, dimensión oculta de 768, 12 cabezales de atención).
  • Características: Incrustaciones de Posición Rotatoria (RoPE), Flash Attention 2 y unpadding para la mejora del rendimiento (throughput).
  • Entrenamiento: Entrenado mediante MLM con una probabilidad de enmascaramiento del 15% y enmascaramiento dinámico durante 10 épocas.
  • Eficiencia: El modelo fue entrenado en una única GPU NVIDIA A40 (48GB de VRAM) durante ~17 horas a un costo de $7.31.

Resultados Clave

Rendimiento de Perplejidad

NE-BERT fue evaluado en conjuntos de prueba de retención (500 oraciones por lengua) frente a IndicBERT-V2, MuRIL y mBERT.

  • Rendimiento General: NE-BERT logró una perplejidad promedio de 2.21 en las 9 lenguas del noreste de la India, superando significativamente a IndicBERT-V2 (35.29) y MuRIL (16.88), y superando a mBERT (2.76).
  • Mejora Promedio: NE-BERT logró una perplejidad promedio 15.97× y 7.64× menor respectivamente comparado con IndicBERT-V2 y MuRIL en las 9 lenguas del noreste de la India.
  • Ganancias en Recursos Ultra Bajos: Las mejoras más drásticas se observaron en las lenguas con mínimos datos. Para el pnar (1,002 oraciones) y el nyishi (55,870 oraciones), NE-BERT redujo la perplejidad a 2.92 y 4.33 respectivamente, mientras que IndicBERT-V2 exhibió un fallo catastrófico con puntuaciones de perplejidad de 66.92 y 187.20.
  • Rendimiento en Altos Recursos: En lenguas con amplia cobertura en Wikipedia (asames, meitei), mBERT se mantuvo competitivo, pero NE-BERT aun así logró resultados superiores o comparables.

Eficiencia de Tokenización

  • Fertilidad: NE-BERT logró una fertilidad de tokenización promedio de 1.68 tokens/palabra para las lenguas del noreste, comparado con 2.08 para IndicBERT-V2, 2.14 para MuRIL y 2.51 para mBERT. Esto representa una mejora de 1.50× sobre mBERT.
  • Bits por Carácter (BPC): NE-BERT logró un BPC promedio de 0.347, demostrando una eficiencia de compresión superior comparado con IndicBERT-V2 (1.497) y MuRIL (1.271).

Evaluación de Tareas Derivadas (Downstream)

En tareas de etiquetado de categorías gramaticales (POS tagging) a través de khasi, mizo y nagamese:

  • NE-BERT logró una precisión promedio del 82.4%, superando a mBERT (73.3%) por 9.1 puntos porcentuales e IndicBERT-V2 (59.2%) por 23.2 puntos porcentuales.

Significado y Reivindicaciones

El artículo postula que NE-BERT demuestra que los modelos de dominio específico con una tokenización apropiada pueden servir eficazmente a lenguas de recursos ultra bajos con tan solo 1,000 oraciones de entrenamiento.

  • Optimización de Vocabulario sobre Escala: Los resultados desafían la noción de que escalar el tamaño del modelo por sí solo es suficiente para el rendimiento en bajos recursos. El autor argumenta que la optimización cuidadosa del vocabulario (vía la tokenización Unigram ponderada) y los datos de entrenamiento dirigidos son más críticos que el recuento bruto de parámetros para estos contextos lingüísticos específicos.
  • Costo-Efectividad: El éxito en el entrenamiento de un modelo competitivo en una sola GPU por menos de $10 proporciona un plano práctico para desarrollar modelos de lenguaje para lenguas subrepresentadas en todo el mundo.
  • Inclusión Digital: Al abordar la "maldición de la multilingüalidad" y la fragmentación del vocabulario, NE-BERT busca apoyar la investigación de NLP y la inclusión digital para las comunidades del noreste de la India, que han estado mayormente ausentes en la investigación de NLP convencional.

El autor libera explícitamente el modelo, el tokenizador, el corpus de entrenamiento y los conjuntos de prueba bajo una licencia CC-BY-4.0 para facilitar la reproducibilidad y las aplicaciones impulsadas por la comunidad. Reconoce limitaciones, incluyendo la arquitectura de solo codificador (no apta para tareas de generación) y la necesidad de más evaluaciones de tareas derivadas en todas las nueve lenguas.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →