← Últimos artículos
💬 NLP

MGSM-Pro: A Simple Strategy for Robust Multilingual Mathematical Reasoning Evaluation

Este artículo presenta MGSM-Pro, una extensión multilingüe del benchmark GSM-Symbolic que evalúa la robustez del razonamiento matemático en nueve idiomas mediante la generación de múltiples instancias con variaciones de dígitos, revelando caídas significativas en el rendimiento en idiomas de recursos limitados y una resiliencia variable de los modelos ante dichas perturbaciones.

Autores originales: Tianyi Xu, Kosei Uemura, Alfred Malengo Kondoro, Tadesse Destaw Belay, Catherine Nana Nyaah Essuman, Ifeoma Okoh, Ganiyat Afolabi, Ayodele Awokoya, David Ifeoluwa Adelani

Publicado 2026-04-29
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Tianyi Xu, Kosei Uemura, Alfred Malengo Kondoro, Tadesse Destaw Belay, Catherine Nana Nyaah Essuman, Ifeoma Okoh, Ganiyat Afolabi, Ayodele Awokoya, David Ifeoluwa Adelani

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que eres un profesor dando un examen de matemáticas a una clase de estudiantes de diferentes países. Quieres ver quién es realmente bueno en matemáticas y quién solo está memorizando las respuestas de un libro de ejercicios.

Este artículo presenta una nueva y más rigurosa forma de evaluar los Modelos de Lenguaje Grandes (IA) en problemas de matemáticas, llamada MGSM-Pro. Aquí está la historia de lo que descubrieron, explicada de manera sencilla.

El Problema: La Trampa del "Libro de Ejercicios"

Durante mucho tiempo, los modelos de IA han ido mejorando en la resolución de problemas de matemáticas verbales. Pero los investigadores notaron algo sospechoso: la IA podría no estar realmente "pensando" a través de las matemáticas. En cambio, podría estar memorizando detalles específicos de las preguntas del examen que vio durante el entrenamiento.

Piénsalo como un estudiante que memoriza la respuesta a un problema verbal específico: "Si Juan tiene 5 manzanas y compra 3 más...". El estudiante sabe que la respuesta es 8. Pero si cambias la pregunta a "Si Sara tiene 5 naranjas y compra 3 más...", el estudiante que solo memorizó la primera podría confundirse.

Recientemente, los investigadores descubrieron que incluso en inglés, si cambias ligeramente los nombres o los números en un problema de matemáticas, muchos modelos de IA fallan. Se dieron cuenta de que las pruebas antiguas eran demasiado fáciles porque no verificaban si la IA podía manejar estos pequeños cambios.

La Solución: MGSM-Pro (La Prueba de "Barajar")

Los autores crearon un nuevo conjunto de datos llamado MGSM-Pro. Tomaron 250 problemas de matemáticas y los convirtieron en 1,240 problemas (5 versiones de cada uno).

Lo hicieron barajando la baraja:

  1. Cambiar Nombres: Sustituir "Juan" por "Zainabu" o "Carla".
  2. Cambiar Números: Sustituir "5 manzanas" por "7 manzanas".
  3. Añadir Distracciones: Añadir una frase que suena importante pero que en realidad es sin sentido (como "El cielo es azul, así que Juan compró 5 manzanas").

Lo hicieron en nueve idiomas diferentes, que van desde los más hablados como el inglés y el chino hasta idiomas con menos recursos digitales como el suajili, el yoruba y el igbo.

El Gran Descubrimiento: La Lucha de los "Bajos Recursos"

Cuando realizaron las pruebas, encontraron una brecha masiva entre los idiomas de "Altos Recursos" (como el inglés) y los idiomas de "Bajos Recursos" (como el twi o el igbo).

  • Los Estudiantes de Altos Recursos: Cuando cambiaron los nombres o los números en inglés o chino, los modelos de IA bajaron un poco su puntuación, pero se mantuvieron mayormente en la pista. Eran como un estudiante que realmente entendía el concepto matemático.
  • Los Estudiantes de Bajos Recursos: Cuando hicieron el mismo barajado para idiomas como el twi o el igbo, los modelos de IA colapsaron. Sus puntuaciones se desplomaron. Fue como si el estudiante de repente olvidara cómo contar porque el profesor usó un nombre diferente para la fruta.

La Analogía: Imagina un estudiante que es genial en matemáticas en inglés pero terrible en matemáticas en su idioma nativo. Cuando el profesor hace una pregunta en inglés con un giro, el estudiante la resuelve. Pero cuando el profesor hace la exacta misma pregunta con giro en el idioma nativo del estudiante, el estudiante se congela. El artículo descubrió que los modelos de IA hacen lo mismo: son mucho menos "robustos" (confiables) en idiomas para los cuales no han visto tantos datos.

¿Quién Aprobó y Quién Reprobó?

El artículo probó muchos modelos de IA diferentes (algunos creados por grandes empresas tecnológicas, otros de código abierto).

  • Los Robustos: Modelos más nuevos e inteligentes como Gemini 3.0 Pro y GPT-OSS 120B manejaron bien los cambios. No entraron en pánico cuando cambiaron los números o los nombres.
  • Los Frágiles: Modelos más antiguos o más pequeños (como Gemma 3 4B o Llama 3) se desmoronaron. No pudieron manejar el "giro".
  • El Mito del Tamaño: Podrías pensar que un cerebro más grande (más parámetros) siempre significa un estudiante más inteligente. El artículo descubrió que esto no es cierto. A veces un modelo enorme falló miserablemente, mientras que uno ligeramente más pequeño tuvo éxito. No se trata solo del tamaño; se trata de cómo se entrenó el modelo.

La Lección: No Solo Evaluar Una Vez

La conclusión más importante es sobre cómo deberíamos evaluar la IA en el futuro.

Actualmente, muchas tablas de clasificación (rankings de las mejores IAs) evalúan un modelo en solo una versión de un problema. Los autores dicen que esto es como darle a un estudiante una sola pregunta de práctica y llamarlo genio si la responde correctamente.

Su Recomendación: Para saber realmente si una IA es buena en matemáticas, debes evaluarla en al menos cinco versiones diferentes del mismo problema (cambiando los nombres y los números). Si la IA acierta las cinco, entonces es realmente inteligente. Si solo acierta la primera, solo está memorizando.

Resumen

El artículo argumenta que debemos dejar de tratar a la IA como si fuera perfecta solo porque pasa las pruebas fáciles. Al barajar los nombres y los números en problemas de matemáticas a través de diferentes idiomas, demostraron que:

  1. La IA es mucho más débil en idiomas con menos datos digitales.
  2. Muchas clasificaciones actuales son engañosas porque no prueban este "barajado".
  3. Para obtener una imagen real de las habilidades matemáticas de una IA, debemos evaluarla en múltiples variaciones del mismo problema, no solo en una.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →