← Últimos artículos
💬 NLP

Naamah: A Large Scale Synthetic Sanskrit NER Corpus via DBpedia Seeding and LLM Generation

Este artículo presenta Naamah, un corpus sintético de reconocimiento de entidades nombradas en sánscrito a gran escala de más de 100.000 oraciones generado mediante la combinación de la extracción de entidades de DBpedia con un modelo de razonamiento híbrido de 24 mil millones de parámetros, el cual se utiliza posteriormente para evaluar arquitecturas transformer multilingües y específicas de las lenguas indias.

Autores originales: Akhil Rajeev P, Annarao Kulkarni

Publicado 2026-04-30
📖 4 min de lectura☕ Lectura para el café

Autores originales: Akhil Rajeev P, Annarao Kulkarni

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes una biblioteca masiva y antigua de libros en sánscrito. Estos libros están llenos de nombres de dioses, reyes, ciudades y organizaciones. Para enseñar a una computadora a entender estos libros, necesitas mostrarle miles de ejemplos donde estos nombres están resaltados y etiquetados (como "Esto es una persona", "Esto es un lugar").

¿El problema? Nadie ha escrito esas etiquetas aún. Leer y etiquetar manualmente estos textos antiguos es como intentar encontrar una aguja en un pajar mientras llevas vendas en los ojos; requiere años de expertos y cuesta una fortuna.

Este artículo presenta una solución llamada Naamah (nombrada así por una figura de la literatura sánscrita, aunque el artículo no explica explícitamente el significado del nombre, sirve como título del proyecto). Aquí explicamos de forma sencilla cómo lo construyeron y qué descubrieron:

1. La Receta: Cómo Crearon los Datos

En lugar de contratar humanos para etiquetar libros, los autores construyeron un "chef robot" para cocinar los datos.

  • Los Ingredientes (DBpedia): Comenzaron con una enciclopedia digital gigante llamada DBpedia. Extrajeron una lista de nombres reales: personas, lugares y organizaciones. Para asegurarse de que el robot no solo memorizara nombres famosos, mezclaron nombres extranjeros modernos (como "Giacomo Libera") escritos en escritura sánscrita. Esto obligó a la computadora a aprender las reglas de la gramática sánscrita, no solo a reconocer rostros famosos.
  • El Chef (El Modelo de IA): Utilizaron un modelo de IA muy inteligente, con 24 mil millones de parámetros (un "modelo de razonamiento híbrido") entrenado específicamente para entender idiomas indios.
  • El Proceso de Cocción: En lugar de forzar a la IA a usar plantillas de oraciones rígidas y preescritas (como "Rama fue al bosque"), pidieron a la IA que tejiera naturalmente estos nombres en oraciones. Esto permitió a la IA generar miles de oraciones únicas y gramaticalmente correctas donde los nombres aparecían en diferentes formas gramaticales (algo muy común en sánscrito).
  • El Control de Calidad: Filtraron la salida para detectar errores obvios. ¿El resultado? 102,942 oraciones de datos de "estándar plateado". "Plateado" significa que no es perfecto (como el oro), pero es de calidad suficiente para entrenar eficazmente a una computadora.

2. El Experimento: Dos Estudiantes Diferentes

Para probar si este nuevo conjunto de datos funcionaba, enseñaron a dos modelos informáticos diferentes a encontrar estos nombres:

  1. El Estudiante Multilingüe Gigante (XLM-RoBERTa): Este es un modelo masivo que habla muchos idiomas. Es como un estudiante que ha leído un poco de todo, pero no es un especialista en sánscrito.
  2. El Especialista Compacto (IndicBERTv2): Este es un modelo más pequeño y ligero diseñado específicamente para idiomas indios. Es como un estudiante que ha pasado toda su vida estudiando los dialectos y escrituras específicas de la región.

3. Los Resultados: El Tamaño No Lo Es Todo

Cuando probaron a ambos estudiantes en el nuevo conjunto de datos, el Especialista (IndicBERTv2) ganó, aunque era mucho más pequeño.

  • La Puntuación: El Especialista obtuvo una puntuación de 0.96, mientras que el Estudiante Multilingüe Gigante obtuvo 0.95.
  • La Razón Real (El Problema de la "Fractura"): El artículo encontró una razón fascinante por la que el Gigante perdió. Las palabras en sánscrito a menudo se pegan como pegamento (una característica llamada sandhi).
    • Imagina que la palabra para "en Kurukshetra" es una sola palabra larga y fusionada.
    • El Especialista vio la palabra completa y dijo correctamente: "Esto es un Lugar".
    • El Gigante intentó cortar la palabra en pedazos porque su diccionario no estaba construido para el sánscrito. Vio la primera parte como un "Lugar", pero la pequeña parte final como una palabra separada y confusa, a la que erróneamente adivinó que era una "Organización".

La Analogía: Es como intentar leer una oración donde los espacios entre las palabras han sido borrados. El Especialista conoce el idioma lo suficientemente bien como para adivinar dónde se rompen las palabras. El Gigante, acostumbrado a los espacios en inglés, se confunde y divide las palabras en los lugares incorrectos, lo que lleva a errores.

4. La Conclusión

El artículo concluye que para idiomas antiguos y complejos como el sánscrito:

  • Los datos sintéticos funcionan: Puedes usar IA para generar datos de entrenamiento si lo haces con cuidado, ahorrando la necesidad de miles de horas de etiquetado manual humano.
  • La herramienta correcta importa más que la herramienta más grande: Un modelo más pequeño que entiende la escritura y la gramática específica del idioma (IndicBERTv2) funcionó mejor que un modelo gigante y genérico (XLM-RoBERTa) porque no separó incorrectamente las palabras.

En resumen, construyeron un manual de entrenamiento masivo generado por IA para la búsqueda de nombres en sánscrito, y demostraron que un cerebro informático especializado y más pequeño es mejor para leer este idioma antiguo que uno gigante y genérico.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →