← Últimos artículos
💻 computer science

Qaamuuska-NLP: A Structured 46K-Entry Somali Lexicon Extracted from a Print Dictionary

Este artículo presenta Qaamuuska-NLP, un léxico de somalí legible por máquina de 46.314 entradas estructuradas, extraído mediante un proceso determinista basado en reglas del diccionario monolingüe *Qaamuuska Af-Soomaaliga* de 2012, el cual preserva información gramatical y léxica detallada al tiempo que conserva el texto original de las entradas para su verificación.

Autores originales: Abdullahi Mohamud Ahmed, Abdulkadir Ugas, Abdirashid Omar, Abdulhakim Ismail

Publicado 2026-09-08
📖 8 min de lectura🧠 Análisis profundo

Autores originales: Abdullahi Mohamud Ahmed, Abdulkadir Ugas, Abdirashid Omar, Abdulhakim Ismail

Artículo original bajo licencia CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

El lenguaje es más que un simple flujo de palabras; es un sistema estructurado donde cada palabra desempeña un trabajo específico, posee una historia de cómo cambia de forma y mantiene una red de relaciones con otras palabras. Para que las computadoras entiendan un lenguaje, necesitan un mapa de esta estructura. Este mapa se llama léxico, un diccionario digital que no solo enumera palabras y sus significados, sino que también registra detalles gramaticales como si un sustantivo es masculino o femenino, o cómo cambia un verbo cuando describe una acción realizada a alguien frente a una acción realizada por uno mismo. Para muchos de los idiomas del mundo, estos mapas ya son vastos y detallados, lo que permite a las computadoras traducir, buscar y analizar texto con gran precisión. Sin embargo, para el somali, un idioma hablado por millones de personas en el Cuerno de África y la diáspora, estos mapas digitales han sido incompletos. Si bien el somali cuenta con una rica tradición de diccionarios impresos, la información dentro de ellos ha permanecido encerrada en un formato diseñado para ojos humanos, lo que dificulta que las máquinas lo utilicen de manera sistemática.

Un equipo de investigadores de Ogaal Labs ha abierto ahora ese cerrojo. Han creado un nuevo recurso digital llamado Qaamuuska-NLP, una colección estructurada de 46.314 entradas extraídas directamente de un importante diccionario impreso publicado en 2012. Los investigadores no se limitaron a escanear las páginas del libro y convertir las imágenes en texto, un proceso que suele introducir errores. En su lugar, trabajaron con la capa de texto digital que ya existía dentro del archivo PDF del diccionario. Construyeron un conjunto de instrucciones precisas basadas en reglas para leer el diseño del libro, identificar dónde terminaba una entrada de palabra y comenzaba la siguiente, y extraer las pistas gramaticales específicas ocultas en el formato. El resultado es una base de datos limpia y legible por máquinas que preserva la organización del diccionario original mientras añade una capa de estructura que las computadoras pueden consultar instantáneamente. Este trabajo no reemplaza al libro original, sino que traduce su profundo conocimiento lingüístico a un nuevo lenguaje que el software puede hablar.

La fuente de este nuevo recurso es Qaamuuska Af-Soomaaliga, un diccionario monolingüe exhaustivo editado por Annarita Puglielli y Cabdalla Cumar Mansuur. A diferencia de las simples listas de palabras, este libro contiene una gran riqueza de información gramatical que es esencial para comprender cómo funciona el somali. Indica al lector el género de los sustantivos, la clase de los verbos y si un verbo requiere un objeto directo. También incluye sinónimos, referencias cruzadas a otras palabras y etiquetas que indican si una palabra pertenece a un campo específico como la medicina o el derecho. El desafío para los investigadores fue que esta información no estaba almacenada en columnas de datos ordenadas; estaba integrada en el diseño visual de la página impresa. El diccionario utiliza dos columnas de texto, abreviaturas específicas y números pequeños en superíndice para distinguir entre palabras que se ven iguales pero tienen significados diferentes. Para construir su versión digital, los investigadores escribieron un programa informático capaz de navegar este diseño sin necesidad de adivinar o aprender de ejemplos. El programa lee la columna izquierda de una página, luego la derecha, y busca los patrones repetitivos que señalan el inicio de una nueva entrada de palabra.

Una vez que el programa identificó una entrada de palabra, la descompuso en sus partes componentes. Separó la palabra principal de su definición, sus etiquetas gramaticales y sus referencias a otras palabras. El equipo encontró que el diccionario contenía 46.314 registros distintos. De estos, unos 25.000 proporcionaban definiciones reales, mientras que los 21.000 restantes eran referencias cruzadas que dirigían al lector a otra entrada. El proceso de extracción fue altamente exitoso al capturar los detalles gramaticales que hacen que el diccionario sea útil. Para las 34.726 entradas de sustantivos, el sistema identificó con éxito el género para casi todas ellas, marcándolas como masculinas, femeninas o capaces de ser ambas. Para las 11.445 entradas de verbos, el sistema capturó la clase de conjugación y si el verbo era transitivo o intransitivo para casi cada uno de ellos. Los investigadores también preservaron el texto original de cada entrada junto con los nuevos datos estructurados. Esto asegura que cualquier persona que utilice la base de datos pueda siempre verificar la fuente original para validar la información, manteniendo intacta la conexión entre el mapa digital y el libro físico.

Los investigadores probaron la calidad de su trabajo observando qué tan bien coincidían las etiquetas gramaticales del diccionario con la forma real de las palabras. Se hicieron una pregunta sencilla: si solo miras el final de una palabra en somali, ¿puedes predecir su categoría gramatical? Utilizaron un método directo que observaba las últimas letras de las palabras para adivinar su género o clase verbal. Los resultados mostraron que las etiquetas del diccionario no eran aleatorias. Para las clases de verbos, el método fue correcto el 93,5 por ciento de las veces, mucho mejor que simplemente adivinar la clase más común. Para el género de los sustantivos, el método fue correcto el 86,4 por ciento de las veces. Estas cifras sugieren que la información gramatical en el diccionario está profundamente ligada a la forma física de las palabras, confirmando que los datos extraídos reflejan patrones lingüísticos reales en lugar de elecciones arbitrarias. Sin embargo, los investigadores señalaron que esta prueba fue una herramienta diagnóstica para comprobar la consistencia interna del recurso, no una prueba completa de la capacidad de una computadora para analizar el texto en somali en el mundo real.

El nuevo recurso llena un vacío específico en el panorama de la tecnología del idioma somali. Mientras que otros proyectos han combinado múltiples diccionarios o se han centrado en generar listas de formas de palabras, este trabajo se enfoca en preservar la estructura de una fuente única y autorizada. Captura las decisiones editoriales y la forma específica en que los autores originales organizaron el idioma. La base de datos incluye 11.415 enlaces de sinónimos y 21.032 referencias cruzadas, creando una red que muestra cómo se relacionan las palabras dentro de la propia lógica del diccionario. También identifica 1.945 entradas que pertenecen a campos especializados como la medicina, la física y el derecho, proporcionando un punto de partida para la construcción de vocabulario técnico en somali. Los investigadores advierten cuidadosamente que este recurso es una representación de ese diccionario específico de 2012, no un censo completo de cada palabra utilizada en el somali actual. La cobertura y las definiciones específicas reflejan las decisiones tomadas por los editores originales.

Existen limitaciones en este enfoque, las cuales los autores reconocen abiertamente. Debido a que las reglas de extracción fueron diseñadas específicamente para el diseño de este libro en particular, no pueden aplicarse directamente a un diccionario diferente sin modificaciones. El equipo también señaló que el PDF original contenía algunas inconsistencias en cómo se escribían los apóstrofos, lo que podría afectar las coincidencias exactas entre palabras, aunque mantuvieron el texto original para permitir correcciones futuras. Además, aunque el código de extracción y los resúmenes estadísticos de los datos se están preparando para su publicación, la lista completa de 46.314 palabras y sus definiciones aún no se puede compartir libremente. Esto se debe a que el diccionario original tiene derechos de autor y los investigadores aún están trabajando para asegurar los permisos necesarios para redistribuir el contenido completo. Hasta que se conceda dicho permiso, el conjunto de datos completo sigue siendo un artefacto de investigación privado, aunque los métodos utilizados para crearlo están disponibles para que otros los estudien y adapten.

El valor de este trabajo reside en su capacidad para convertir un libro estático en una herramienta dinámica. Al convertir el diccionario en un formato estructurado, los investigadores han hecho posible que las computadoras busquen palabras por sus propiedades gramaticales, rastreen la red de sinónimos y referencias cruzadas, y analicen la distribución de términos especializados. Esto no resuelve todos los problemas del procesamiento del lenguaje somali, pero proporciona una base sólida de datos curados de alta calidad. Demuestra que el valioso conocimiento lingüístico a menudo permanece latente en libros impresos, esperando un método para desbloquearlo. El proyecto Qaamuuska-NLP muestra que, con un enfoque cuidadoso basado en reglas, es posible recuperar este conocimiento sin perder el matiz y la estructura de la fuente original, ofreciendo un nuevo recurso para investigadores, educadores y desarrolladores que trabajan para traer al somali a la era digital.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →