← Últimos artículos
💻 computer science

GLeMM: A large-scale multilingual dataset for morphological research

El artículo presenta GLeMM, un conjunto de datos de morfología derivacional multilingüe, totalmente automatizado y a gran escala que cubre siete lenguas europeas, diseñado para permitir la investigación basada en datos y las pruebas computacionales de las relaciones forma-significado en la formación de palabras.

Autores originales: Nabil Hathout, Basilio Calderone, Fiammetta Namer, Franck Sajous

Publicado 2026-09-25
📖 7 min de lectura🧠 Análisis profundo

Autores originales: Nabil Hathout, Basilio Calderone, Fiammetta Namer, Franck Sajous

Artículo original bajo licencia CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ✨ Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

El lenguaje es un sistema vivo donde las palabras evolucionan constantemente, dividiéndose y fusionándose para crear nuevos significados. Cuando tomamos una palabra como "happy" (feliz) y la convertimos en "happiness" (felicidad), o "teach" (enseñar) en "teacher" (maestro), estamos participando en un proceso llamado derivación. Así es como los seres humanos expanden su vocabulario, creando ideas complejas a partir de raíces simples. Durante décadas, los lingüistas han intentado mapear estas conexiones, preguntándose por qué algunas palabras cambian de maneras predecibles mientras que otras parecen seguir sus propias reglas únicas. Se han preguntado si la forma en que un lenguaje construye nuevas palabras es la misma en diferentes culturas, o si cada lengua tiene su propia lógica secreta. Hasta hace poco, responder a estas preguntas significaba depender de la intuición de expertos y de pequeñas listas seleccionadas a mano. Era un poco como intentar entender el clima observando una sola nube; podías captar una sensación del patrón, pero te perdías la tormenta.

Un equipo de investigadores ha construido ahora una enorme biblioteca digital para cambiar la forma en que estudiamos este proceso. Crearon un recurso llamado GLeMM, que significa una colección multilingüe a gran escala de datos de formación de palabras. En lugar de depender de listas pequeñas, recopilaron información sobre casi 1,2 millones de pares de palabras relacionadas en siete idiomas europeos: inglés, francés, alemán, italiano, polaco, ruso y español. El objetivo era ir más allá de las conjeturas y dejar que el enorme volumen de datos revelara la verdadera estructura de cómo crecen las lenguas. Al automatizar el proceso de encontrar estas conexiones, los investigadores pudieron ver patrones que antes eran invisibles, ofreciendo una imagen más clara de cómo interactúan la forma y el significado cuando creamos nuevas palabras.

Los investigadores no se sentaron a escribir manualmente cada conexión de palabras. En su lugar, recurrieron a Wiktionary, el diccionario gratuito en línea que cualquiera puede editar. Se dieron cuenta de que las definiciones que la gente escribe para las palabras a menudo contienen pistas sobre cómo se relacionan esas palabras. Por ejemplo, si la definición de "spryness" (vivacidad) dice que es "la propiedad de ser spry" (vivaz), la palabra "spry" está ahí mismo en la explicación. El equipo desarrolló un método computacional para escanear millones de estas definiciones, buscando pares de palabras donde una sea definida usando la otra. Luego verificaron si las dos palabras se parecían lo suficiente como para estar relacionadas, como compartir una raíz común. Al cruzar estos hallazgos con otras listas de palabras relacionadas, filtraron las coincidencias aleatorias y conservaron solo los pares que mostraban un patrón consistente y repetitivo. Esto les permitió construir una vasta red de familias de palabras para cada uno de los siete idiomas, capturando desde sufijos simples como "-ness" hasta cambios más complejos que involucran prefijos y múltiples pasos.

Lo que encontraron desafía algunas ideas largamente sostenidas sobre cómo funciona el lenguaje. Durante mucho tiempo, muchos lingüistas creyeron que las familias de palabras eran como redes completas, donde cada palabra en una familia estaba directamente conectada con todas las demás palabras. Si tenías una palabra para "travel" (viajar), una palabra para "traveler" (viajero) y una palabra para "traveling" (viajando), la teoría sugería que todas estaban igualmente vinculadas en un triángulo perfecto. Sin embargo, los datos de GLeMM sugieren que este rara vez es el caso. En el enorme conjunto de datos, la mayoría de las familias de palabras no son redes perfectas. En cambio, se parecen más a un núcleo central con radios, donde las nuevas palabras se ramifican desde una raíz principal pero no necesariamente se conectan de vuelta entre sí. Los investigadores encontraron que solo una pequeña fracción de los grupos de palabras forman estos triángulos perfectos. De hecho, por cada 100 pares de palabras que teóricamente podrían formar un triángulo, solo un puñado lo hace. Esto sugiere que la forma en que construimos palabras es más direccional y jerárquica de lo que se pensaba anteriormente, con un flujo claro desde una palabra base hacia sus derivadas, en lugar de una red caótica de conexiones mutuas.

El estudio también arrojó luz sobre cómo diferentes lenguas manejan los mismos conceptos. Mientras que todos los siete idiomas del estudio crean nuevas palabras, lo hacen con herramientas y frecuencias distintas. Por ejemplo, los investigadores observaron cómo los idiomas expresan la idea de "hacer algo de nuevo". En francés, encontraron un patrón específico donde se añade un prefijo a un verbo para revertir una acción, creando toda una familia de palabras que refleja la original. En inglés, existen patrones similares pero son menos uniformes. El conjunto de datos mostró que, si bien la lógica subyacente de la formación de palabras es compartida, las reglas específicas varían significativamente. Un idioma podría preferir combinar dos palabras existentes para crear una nueva, mientras que otro prefiere añadir un pequeño final a una sola palabra. Los investigadores también descubrieron que algunas formaciones de palabras son "hacia atrás". A veces, una palabra más corta es en realidad derivada de una más larga, aunque parezca que la más corta debería ser la raíz. Los datos ayudaron a identificar estos patrones inversos al mostrar que ocurren con mucha menos frecuencia que la dirección estándar, lo que permitió a los investigadores detectar estas excepciones a la regla.

A pesar de la escala masiva del proyecto, los investigadores advierten cuidadosamente que su recurso no es perfecto. Debido a que los datos fueron recopilados automáticamente de un diccionario público, contiene algunos errores e inconsistencias. Algunos pares de palabras que parecen relacionados podrían no serlo, y algunas definiciones podrían ser ligeramente incorrectas. Sin embargo, el tamaño descomunal de la colección significa que estos errores son lo suficientemente raros como para no distorsionar el panorama general. Los investigadores estiman que la precisión de los pares de palabras es muy alta, con más del 90 por ciento de las conexiones en las secciones de inglés y francés siendo correctas. El recurso está diseñado para ser un punto de partida para investigaciones posteriores, un lugar donde otros científicos puedan probar sus propias teorías contra una vasta cantidad de datos del mundo real. No es la respuesta final al misterio del lenguaje, pero es una poderosa nueva herramienta que nos permite ver el paisaje de la formación de palabras con una claridad que era imposible antes.

La creación de GLeMM representa un cambio en la forma en que estudiamos el lenguaje, pasando de ejemplos pequeños y curados a una exploración masiva impulsada por datos. Al tratar el diccionario como un corpus vivo de millones de relaciones, los investigadores han abierto una ventana a la arquitectura oculta del habla humana. Han demostrado que, si bien los lenguajes son diversos, siguen ciertos principios estructurales que pueden ser medidos y observados. Los hallazgos sugieren que la forma en que construimos palabras no es una colección aleatoria de hábitos, sino un sistema estructurado con patrones claros, excepciones y una dirección distinta. A medida que los investigadores planean expandir este trabajo para incluir más idiomas y refinar sus métodos, este recurso promete profundizar nuestra comprensión de la capacidad de la mente humana para crear significado a partir del sonido. Nos recuerda que cada palabra nueva que pronunciamos es parte de una historia vasta e interconectada, y ahora, por primera vez, tenemos un mapa lo suficientemente grande como para ver todo el territorio.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →