Multilingual Large Language Models do not comprehend all natural languages to equal degrees
El estudio revela que, aunque los modelos de lenguaje grandes multilingües muestran una notable precisión en diversos idiomas, su comprensión se sitúa por debajo de los humanos en todos los casos y, contrariamente a lo esperado, el inglés no es el idioma mejor desempeñado, superado sistemáticamente por varias lenguas romances.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
¡Claro que sí! Imagina que las Inteligencias Artificiales (IA) son como chefines de cocina que han aprendido a cocinar millones de platos (idiomas) diferentes. La gente asume que el chef inglés es el mejor de todos porque tiene la cocina más grande y llena de ingredientes, mientras que los chefs de idiomas más pequeños o menos conocidos serían menos hábiles.
Este estudio es como una gran cata a ciegas donde ponen a prueba a tres de estos chefines de élite (GPT-4o, Grok-3 y DeepSeek-V3) para ver si realmente entienden lo que les piden en 12 idiomas distintos, desde el inglés y el español hasta el japonés y el árabe.
Aquí tienes los hallazgos principales, explicados con analogías sencillas:
1. El mito del "Rey Inglés"
Lo que todos pensaban: Se creía que el inglés era el idioma favorito de la IA, como si fuera el "idioma nativo" del cerebro de la máquina, y que en otros idiomas la IA simplemente "traducía" mentalmente antes de responder, cometiendo más errores.
Lo que descubrieron: ¡Falso! El inglés no es el mejor. De hecho, en varias pruebas, el inglés quedó en el medio de la tabla.
- La analogía: Imagina que el inglés es un atleta que entrena mucho, pero se cansa rápido. En cambio, idiomas como el español y el italiano (que son como primos cercanos del inglés pero con su propia personalidad) fueron los campeones. La IA los entendió mejor y respondió con más precisión que en inglés. Es como si el chef inglés se hubiera olvidado de las recetas de su propia casa, pero recordara perfectamente las de sus vecinos latinos.
2. La IA no es tan lista como un humano (todavía)
El resultado: En casi todos los idiomas, los humanos ganaron a las máquinas.
- La analogía: Si le das a un humano y a una IA un acertijo lógico corto, el humano suele acertar casi siempre. La IA, aunque es muy rápida, a veces se pierde en los detalles o "alucina". Solo hubo dos excepciones donde la IA empató con los humanos: GPT-4o en español y DeepSeek-V3 en italiano. Pero en general, la IA aún no tiene la misma comprensión profunda que un ser humano, incluso en idiomas donde tiene mucha información.
3. El problema de la "Lectura" (Tokenización)
¿Por qué pasa esto? Los investigadores descubrieron que no es solo cuestión de cuántos libros hay en la biblioteca de la IA, sino de cómo lee esos libros.
- La analogía: Imagina que leer es como cortar una pizza.
- En idiomas como el inglés o el español, la IA corta la pizza en trozos perfectos y fáciles de digerir.
- En idiomas como el japonés o el griego, la IA a veces corta la pizza en trozos demasiado grandes o demasiado pequeños, haciendo que le cueste más entender el sabor (el significado).
- Además, si el idioma usa un alfabeto diferente al latino (como el árabe o el chino), la IA necesita muchísimos más ingredientes (datos de entrenamiento) para cocinar tan bien como en los idiomas latinos.
4. La estabilidad: ¿Quién no se equivoca dos veces?
El estudio midió dos cosas:
- Precisión: ¿Dio la respuesta correcta? (Aquí ganaron los humanos).
- Estabilidad: Si le preguntas lo mismo tres veces, ¿te da la misma respuesta?
- La sorpresa: Aquí las máquinas ganaron a los humanos. Los humanos a veces se distraen, se cansan o cambian de opinión. Pero las IAs, una vez que "piensan" algo, son máquinas de precisión: si les preguntas lo mismo 100 veces, te darán la misma respuesta 100 veces (aunque esa respuesta a veces sea incorrecta). Grok-3 fue el más consistente de todos.
5. El peligro de la "Burbuja WEIRD"
El estudio advierte que la IA está entrenada principalmente con datos de comunidades "WEIRD" (Occidentales, Educadas, Industrializadas, Ricas y Democráticas).
- La analogía: Es como si un mapa del mundo solo tuviera dibujadas las calles de Nueva York y Londres, y todo lo demás fuera un bosque misterioso.
- El riesgo: Esto significa que las personas que hablan idiomas minoritarios o usan alfabetos no latinos (como muchas culturas no occidentales) tienen más probabilidades de recibir información confusa o errónea de la IA. No es que la IA sea "racista", es que su "dieta" de datos ha sido muy desequilibrada.
En resumen
Este estudio nos dice que:
- No confíes ciegamente en que la IA es perfecta en inglés. A veces, el español o el italiano son sus mejores lenguas.
- La IA no "entiende" como nosotros. Es muy buena imitando patrones, pero falla en la comprensión profunda.
- El alfabeto importa. Si tu idioma no usa letras latinas, la IA tiene más dificultades para entenderlo.
- Necesitamos más diversidad. Para que la IA sea justa y útil para todos, necesitamos entrenarla con más datos de todas las culturas, no solo de las ricas y occidentales.
Es como decir: "Oye, el chef estrella no es el que tiene el restaurante más grande, sino el que sabe cocinar con los ingredientes que realmente tiene a mano, y necesitamos enseñarle a cocinar con ingredientes de todo el mundo".
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.