← Últimos artículos
💬 NLP

Similarity All The Way Up: Multilingual Generalization in LLMs Relies on Language-Level Similarity Structures

Este artículo demuestra que los Grandes Modelos de Lenguaje generalizan mejor entre idiomas cuando sus representaciones latentes capturan con precisión las estructuras de similitud jerárquica de las familias lingüísticas, como el árbol indoeuropeo, estando esta alineación estructural directamente correlacionada con un mejor rendimiento en evaluaciones multilingües como XNLI.

Autores originales: Supantho Rakshit, Adele Goldberg, Henry Conklin

Publicado 2026-08-14
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Supantho Rakshit, Adele Goldberg, Henry Conklin

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando enseñarle a un robot cómo entender el mundo. No solo le das un diccionario; dejas que lea millones de libros, sitios web e historias. Con el tiempo, el robot comienza a construir un mapa mental de cómo las cosas se relacionan entre sí. En el mundo de la informática, esto se llama un "Modelo de Lenguaje de Gran Escala" (LLM, por sus siglas en inglés). Piensa en estos modelos como cerebros digitales superinteligentes que han leído casi todo lo que hay en internet. Pero aquí está la parte difícil: la mayor parte de lo que han leído es en inglés. Cuando les pides que hablen un idioma que no han visto mucho, como el suajili o el islandés, suelen tropezar.

Los científicos se han preguntado durante mucho tiempo por qué sucede esto. Una idea clave de la psicología sugiere que nuestros cerebros (y las computadoras inteligentes) aprenden notando similitudes. Si sabes lo que es un "perro", puedes adivinar qué es un "lobo" porque se parecen y actúan de forma similar. Esto se llama "generalización". Cuanto mejor agrupe tu mapa mental las cosas similares, mejor serás para adivinar cosas nuevas. Pero, ¿se aplica esta misma regla a idiomas enteros? ¿Organizan estos cerebros digitales los idiomas de la misma manera en que un árbol genealógico organiza a los parientes? Esa es la gran pregunta que este artículo se propone responder.


La gran reunión de la familia de lenguas

Imagina una fiesta gigante e invisible donde todos los idiomas de la familia indoeuropea (un grupo enorme que incluye el inglés, el español, el hindi y el ruso) están invitados. En el mundo real, sabemos que estos idiomas están relacionados como primos, hermanos y parientes lejanos. Algunos, como el español y el italiano, son como gemelos que crecieron en la misma casa. Otros, como el inglés y el hindi, son primos lejanos que no se han visto en miles de años.

Los investigadores de este artículo querían ver si los Modelos de Lenguaje de Gran Escala (LLM) conocen secretamente este árbol genealógico. No les preguntaron a los modelos: "Oye, ¿están relacionados estos idiomas?". En su lugar, observaron los "pensamientos" de los modelos (su matemática interna) para ver cómo agrupaban los idiomas. Es como observar a un invitado en la fiesta y ver con quién se queda parado. Si el modelo pone al español y al italiano cerca, pero los mantiene lejos del hindi, está demostrando que entiende las conexiones familiares sin haber sido enseñado explícitamente.

El descubrimiento: Los modelos tienen un mapa secreto

El equipo probó 12 modelos de IA diferentes, desde los más antiguos hasta los más nuevos y potentes. Alimentaron a los modelos con miles de frases en 38 idiomas diferentes. Luego, utilizaron un truco matemático especial para mapear cómo se "sentía" cada modelo respecto a cada idioma.

El resultado fue sorprendente y deleitoso: los modelos habían construido accidentalmente un mapa que se parecía casi exactamente al verdadero árbol genealógico de las lenguas.

Al igual que un genealogista dibujando un árbol familiar, los modelos agruparon naturalmente los idiomas en las mismas subfamilias: las lenguas germánicas (como el inglés y el alemán) se amontonaron juntas; las lenguas romances (como el francés y el español) formaron su propio círculo; y las lenguas eslavas (como el ruso y el polaco) se mantuvieron en su propio grupo. Los modelos no necesitaron que un maestro les dijera: "Estas son lenguas romances". Lo descubrieron por su cuenta simplemente leyendo los datos.

Por qué algunos modelos son mejores en la fiesta

Pero aquí está el giro: no todos los modelos son igualmente buenos en esto. Los investigadores encontraron un vínculo directo entre qué tan bien organizaba un modelo su mapa de idiomas y qué tan bien se desempeñaba en una prueba difícil llamada XNLI (una prueba en la que el modelo tiene que adivinar si una oración demuestra, contradice o no tiene relación con otra oración en un idioma diferente).

Piénsalo de esta manera: si un estudiante tiene un cuaderno desordenado y revuelto donde mezcla todos sus datos de historia, tendrá dificultades para responder una pregunta de un examen. Pero si su cuaderno está perfectamente organizado por temas, puede encontrar la respuesta al instante. El artículo encontró que los modelos que organizaban su "cuaderno de idiomas" correctamente (manteniendo los idiomas similares cerca) eran mucho mejores para resolver los problemas de la prueba.

Específicamente, los modelos que fueron entrenados con datos de muchos idiomas diferentes (modelos multilingües) hicieron un trabajo mucho mejor al dibujar este árbol genealógico que los modelos entrenados principalmente en inglés. Es como si los modelos multilingües tuvieran un mapa más grande y claro, mientras que los modelos de solo inglés intentaban navegar con un boceto borroso e incompleto.

La trampa del "guion" y otras sorpresas

Uno podría suponer que los modelos simplemente agruparon los idiomas por cómo se ven en el papel (su alfabeto o guion). Por ejemplo, ¿tal vez pensaron que el hindi y el urdu eran similares solo porque ambos usan el guion devanagari? El artículo dice que no. Aunque la forma en que se escriben las palabras (ortografía) tiene un pequeño efecto, no es la razón principal. Los modelos fueron lo suficientemente inteligentes como para ver que el hindi y el urdu son primos lingüísticos, aunque usen guiones diferentes, y que el persa (que usa un guion árabe) está en realidad relacionado con las lenguas del norte de la India, no con las árabes. Los modelos estaban mirando la estructura del idioma, no solo la fuente.

Sin embargo, los modelos no eran perfectos. A veces se confundían un poco con idiomas "huérfanos" como el griego, el galés y el albanés. En algunos modelos, el griego y el galés se emparejaban extrañamente, a pesar de que no están estrechamente relacionados. Esto sugiere que, si bien los modelos son excelentes para ver el panorama general, a veces tropiezan con las ramas únicas y aisladas del árbol genealógico.

¿Cuándo aprendieron esto?

Los investigadores también observaron a los modelos mientras eran entrenados, como observar a un bebé aprender a caminar. Descubrieron que los modelos comenzaron a organizar los idiomas en estos grupos familiares muy temprano en su entrenamiento, tras solo 100 pasos de aprendizaje. Esto sugiere que descubrir "quién está relacionado con quién" es una de las primeras cosas que aprende un modelo de lenguaje inteligente, incluso antes de entrar en los detalles minuciosos de palabras específicas.

La conclusión

Este artículo sugiere que el secreto del éxito de un modelo de lenguaje no es solo memorizar más palabras; es construir un buen mapa mental de cómo se relacionan los idiomas entre sí. Cuando un modelo entiende que el español y el italiano son primos cercanos, y que el inglés y el alemán son hermanos, se vuelve mucho mejor para traducir ideas de uno a otro.

Resulta que estos cerebros digitales son sorprendentemente buenos en la historia. No necesitaron un libro de texto para aprender el árbol genealógico indoeuropeo; solo necesitaban leer el mundo, y los patrones surgieron por sí solos. Y cuanto mejor se vuelven al dibujar ese mapa, mejor se vuelven al hablar cada idioma que contiene.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →