← Últimos artículos
💬 NLP

M3Kang: Evaluating Multilingual Multimodal Mathematical Reasoning in Vision-Language Models

Este artículo presenta M3Kang, el primer conjunto de datos de razonamiento matemático masivamente multilingüe y multimodal derivado de la Competencia de Matemáticas Kangaroo, el cual evalúa los modelos de visión y lenguaje de vanguardia frente al desempeño humano y revela sus limitaciones actuales en matemáticas básicas y razonamiento basado en diagramas en 108 idiomas.

Autores originales: Aleix Torres-Camps, Nathaniel Mitrani Hadida, Víctor Conchello Vendrell, Àlex Batlle Casellas, Arnau Padrés Masdemont, Jordi Ros-Giralt

Publicado 2026-01-26
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Aleix Torres-Camps, Nathaniel Mitrani Hadida, Víctor Conchello Vendrell, Àlex Batlle Casellas, Arnau Padrés Masdemont, Jordi Ros-Giralt

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina un concurso de matemáticas gigante y global llamado "Kangaroo Math Competition" (Competencia de Matemáticas Canguro). Cada año, más de seis millones de niños menores de 18 años de más de 90 países participan. Ellos resuelven acertijos matemáticos complicados, algunos de los cuales son solo palabras, pero muchos requieren mirar diagramas, formas y dibujos para descubrir la respuesta.

Ahora, imagina que un equipo de investigadores de Qualcomm AI Research decidió convertir este concurso en una prueba masiva para la Inteligencia Artificial. Construyeron una nueva herramienta llamada M3Kang. Piensa en M3Kang como un "traductor universal y profesor de matemáticas" todo en uno en forma de conjunto de datos.

Aquí tienes el desgón de lo que hicieron y lo que descubrieron:

1. El Gran Proyecto: Construyendo la Prueba Definitiva de Matemáticas

Los investigadores tomaron los problemas matemáticos originales (que estaban mayormente en catalán e inglés) y los tradujeron a 108 idiomas diferentes.

  • La Escala: No solo tradujeron las palabras; mantuvieron las imágenes y diagramas adjuntos a las preguntas. Esto resultó en más de 111,000 problemas matemáticos únicos.
  • El Objetivo: Querían ver si los modelos de IA (los "cerebros" detrás de los chatbots y generadores de imágenes) podían resolver problemas matemáticos en otros idiomas además del inglés, y si realmente podían "ver" y entender los diagramas, no solo leer el texto.

2. Cómo lo Construyeron (La Línea de Ensamblaje)

Crear un conjunto de datos de este tamaño es como construir una línea de ensamblaje de una fábrica.

  • Paso 1: Tomaron los PDF originales del concurso de matemáticas y los convirtieron en imágenes limpias con texto.
  • Paso 2: Usaron IA para traducir las preguntas al inglés primero, verificando dos veces que la traducción no rompiera la lógica matemática.
  • Paso 3: Usaron un truco ingenioso de "traducción inversa" para verificar los otros 108 idiomas. Imagina traducir una frase del español al inglés, y luego traducirla inmediatamente de vuelta al español. Si el resultado se ve diferente al original, la traducción es mala. Usaron este método para filtrar automáticamente las malas traducciones.

3. Los Resultados: ¿Cómo le fue a la IA?

Probaron los modelos de IA más inteligentes disponibles (tanto los gratuitos/abiertos como los costosos/cerrados) contra esta nueva prueba. Aquí es donde descubrieron lo siguiente:

  • La "Ventaja del Inglés" es Real: Al igual que un estudiante que solo estudia en inglés podría tener dificultades en un aula de francés, los modelos de IA fueron mucho mejores resolviendo problemas matemáticos en inglés. A medida que el idioma era menos común en internet (como el suajili o el maltés), el rendimiento de la IA caía significamente. Es como si la IA olvidara cómo hacer matemáticas cuando cambia el idioma.
  • El Tamaño Importa (Pero No para Todo): Los modelos de IA más grandes generalmente lo hicieron mejor. Sin embargo, incluso los modelos más grandes y brillantes tuvieron dificultades con la lógica básica y los diagramas.
  • El Problema de la "Ceguera": Este fue el hallazgo más sorprendente. Cuando los humanos toman la prueba, de hecho encuentran los problemas con imágenes más fáciles que los que solo tienen texto. ¡Pero para la IA, es lo contrario! Los modelos de IA se volvieron significativamente peores cuando había una imagen involucrada. Es como un estudiante que es bueno leyendo un problema de texto pero se bloquea cuando tiene que mirar un gráfico. La IA parece tener problemas para conectar los puntos entre el texto y la imagen.
  • IA vs. Humanos: Compararon las puntuaciones de la IA con las puntuaciones reales de 68,000 estudiantes humanos.
    • La mejor IA (Gemini-2.5-Pro) se desempeñó como un estudiante de alto nivel en inglés, pero su rendimiento cayó a "promedio" o "por debajo del promedio" en idiomas de bajos recursos.
    • Curiosamente, la IA no mejoró a medida que las matemáticas se volvían más difíciles de la misma manera que los humanos. A veces, la IA resolvía perfectamente los problemas más difíciles pero fallaba en los más fáciles, lo que sugiere que está "adivinando" o utilizando un tipo de razonamiento diferente al de un niño humano.

4. ¿Podemos Arreglarlo?

Los investigadores probaron algunos "trucos de entrenamiento" para ayudar a la IA a hablar mejor otros idiomas.

  • El Truco del "Traductor": Descubrieron que si le decían a la IA: "Primero, traduce esta pregunta al inglés en tu mente, resuélvela y luego da la respuesta", la IA mejoraba mucho al resolver problemas en otros idiomas. Es como darle a un estudiante un diccionario justo antes del examen.
  • El Truco de "Direccionamiento": Intentaron guiar el proceso de pensamiento interno de la IA para que fuera más "parecido al inglés", incluso cuando hablaba otros idiomas. Esto ayudó un poco, pero el truco del "Traductor" fue el ganador.

La Conclusión Final

El artículo concluye que, aunque la IA se está volviendo increíblemente inteligente, todavía tiene un punto ciego importante: le cuesta combinar la lectura, la visión y el pensamiento a través de diferentes idiomas.

Los investigadores hicieron públicos todos sus datos y código (open-source) para que otros científicos puedan usar esta "Prueba Kangaroo" para construir una IA mejor e inclusiva que no solo hable inglés, sino que pueda hacer matemáticas en cualquier idioma, con o sin una imagen. Esperan que esto ayude a crear una IA que sea verdaderamente global y justa para todos.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →