← Últimos artículos
💬 NLP

MATH-PT: A Math Reasoning Benchmark for European and Brazilian Portuguese

Este artículo presenta Math-PT, un nuevo conjunto de datos de referencia compuesto por 1.729 problemas matemáticos en portugués europeo y brasileño obtenidos de competiciones y exámenes nativos, que revela que, aunque los modelos de lenguaje de última generación (LLM) obtienen buenos resultados en preguntas de opción múltiple, sus capacidades disminuyen en tareas visuales y de respuesta abierta.

Autores originales: Tiago Teixeira, Ana Carolina Erthal, Juan Belieni, Beatriz Canaverde, Diego Mesquita, Miguel Faria, Eliezer de Souza da Silva, André F. T. Martins

Publicado 2026-04-30
📖 4 min de lectura☕ Lectura para el café

Autores originales: Tiago Teixeira, Ana Carolina Erthal, Juan Belieni, Beatriz Canaverde, Diego Mesquita, Miguel Faria, Eliezer de Souza da Silva, André F. T. Martins

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que los Modelos de Lenguaje Grande (LLMs) son como estudiantes brillantes que han leído casi todos los libros de la biblioteca mundial. Durante años, hemos estado probando sus habilidades matemáticas utilizando exámenes escritos enteramente en inglés. Es como darle a un estudiante una prueba de manejo solo en inglés y luego asumir que puede conducir perfectamente en cualquier idioma simplemente porque aprobó esa única prueba.

El artículo MATH-PT argumenta que este enfoque tiene un gran punto ciego. Introduce una nueva "prueba de manejo" escrita específicamente en portugués (tanto la variedad europea como la brasileña) para ver si estos estudiantes de IA pueden realmente manejar las matemáticas cuando cambia el idioma.

Aquí está el desglose de sus hallazgos utilizando analogías simples:

1. El Problema: La Biblioteca "Solo en Inglés"

La mayoría de las evaluaciones matemáticas (como MATH o MathVista) son como una biblioteca donde cada libro está en inglés. Incluso cuando los investigadores intentan probar otros idiomas, simplemente traducen los libros en inglés. Los autores dicen que esto es injusto porque no nos dice si la IA realmente comprende los conceptos matemáticos o si simplemente está memorizando patrones en inglés. Quisieron construir una biblioteca de problemas matemáticos que hubieran nacido en portugués, extraídos de olimpiadas matemáticas reales y exámenes escolares de Portugal y Brasil.

2. La Nueva Prueba: MATH-PT

El equipo creó un conjunto de datos llamado MATH-PT con 1.729 problemas.

  • La Fuente: No solo tradujeron; excavaron en los archivos originales de competiciones como las Olimpíadas Portuguesas da Matemática y la OBMEP de Brasil.
  • La Variedad: La prueba abarca desde acertijos de quinto grado hasta desafíos preuniversitarios.
  • El Formato: Incluye preguntas de opción múltiple (como una hoja de respuestas) y preguntas de respuesta abierta (donde debes escribir la respuesta desde cero). Crucialmente, muchas preguntas incluyen diagramas y figuras (como formas geométricas), que el equipo preservó cuidadosamente mediante código para que la IA pudiera "verlos".

3. Los Resultados: El "Inteligente" vs. El "Que Lucha"

Probaron 13 modelos de IA diferentes, desde los modelos "de vanguardia" más poderosos (los supergenios) hasta modelos de código abierto más pequeños (los estudiantes promedio).

  • La Ventaja de la Opción Múltiple: Piensa en las preguntas de opción múltiple como un juego de "Encuentra la Diferencia". Los modelos de IA eran muy buenos en esto. Incluso los modelos más pequeños podían adivinar a menudo la letra correcta (A, B, C, D o E) correctamente.
  • La Lucha de la Respuesta Abierta: Cuando la prueba cambió a preguntas de respuesta abierta (donde la IA debe generar la respuesta por sí misma), las puntuaciones cayeron significativamente. Es la diferencia entre reconocer una cara en una fila y dibujar esa cara de memoria. La IA tuvo más dificultades cuando tuvo que "pensar" y escribir la respuesta por sí misma en lugar de simplemente elegir una.
  • El Problema de la "Imagen": Este fue el mayor obstáculo. Cuando una pregunta incluía un diagrama (una imagen), el rendimiento de la IA se desplomó. Incluso los modelos más inteligentes se confundieron cuando tuvieron que interpretar una forma visual junto con el texto. Es como pedirle a un estudiante que resuelva un problema de geometría mientras lleva vendas en los ojos; pueden leer las palabras, pero no pueden "ver" la forma.

4. Los Ganadores y Perdedores

  • Los Campeones: Los modelos "de vanguardia" (como GPT-5 y Qwen3-235B) fueron los claros ganadores. Manejaron bien las matemáticas en portugués, especialmente las preguntas de opción múltiple.
  • Los Que Luchan: Los modelos de código abierto más pequeños (como Llama-3 y Gemma-3) encontraron las matemáticas mucho más difíciles. Su precisión cayó drásticamente a medida que las preguntas se volvían más difíciles o incluían imágenes.
  • El Efecto de Escala: El artículo encontró que para la familia de modelos Qwen, hacer el modelo más grande (añadiendo más "potencia cerebral") ayudó mucho. Es como actualizar de una bicicleta a un coche deportivo; los modelos más grandes manejaron las tareas de razonamiento complejo mucho mejor que los más pequeños.

La Conclusión

El artículo concluye que, aunque la IA está mejorando mucho en matemáticas, todavía tiene un "sesgo lingüístico" y lucha cuando la prueba se vuelve más difícil (respuesta abierta) o visual (diagramas). Al publicar este conjunto de datos en portugués, los autores están entregando a los investigadores una nueva regla más justa para medir qué tan bien la IA puede realmente pensar en idiomas distintos al inglés. No están diciendo que la IA sea perfecta todavía; están diciendo: "Aquí hay una nueva prueba para mostrarnos exactamente dónde la IA todavía está aprendiendo".

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →