← Últimos artículos
💬 NLP

Assessment of Evolving Large Language Models in Upper Secondary Mathematics

Este estudio demuestra que los modelos de lenguaje extensos en evolución han avanzado rápidamente en su competencia matemática, progresando desde un rendimiento moderado hasta alcanzar puntuaciones casi perfectas en el examen de matriculación de la educación secundaria superior de Finlandia, destacando así su potencial como poderosas herramientas para apoyar la educación matemática.

Autores originales: Mika Setälä, Pieta Sikström, Ville Heilala, Tommi Kärkkäinen

Publicado 2026-06-18
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Mika Setälä, Pieta Sikström, Ville Heilala, Tommi Kärkkäinen

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás viendo una carrera donde los corredores no son humanos, sino diferentes versiones de "supercerebros" (Modelos de Lenguaje Extensos o LLM). La pista en la que corren es el Examen de Matemáticas de la Escuela Secundaria de Finlandia, una prueba notoriamente difícil que determina si los estudiantes pueden ingresar a la universidad.

Aquí está la historia de cómo estos corredores digitales evolucionaron de principiantes torpes a campeones perfectos, basada en el artículo de investigación.

La línea de salida: La fase de "bebé" (agosto de 2023)

Al principio de la carrera, los corredores de IA eran como estudiantes que acababan de empezar a aprender álgebra.

  • El Corredor: Una versión temprana del GPT-4 de OpenAI.
  • El Resultado: Obtuvo una puntuación de 64 de 120. En el sistema de calificación finlandés, esta es una nota aprobatoria, pero baja (Calificación "E"). Era como un estudiante que aprobó la clase, pero apenas logró pasar raspando.
  • El Competidor: El "Bard" de Google estaba aún más atrás, obteniendo un 34 (Calificación "C"), lo que es como si un estudiante hubiera reprobado el examen.

En esta etapa, el artículo señala que estos modelos de IA eran buenos en cosas simples, pero tenían dificultades con la lógica compleja necesaria para las matemáticas de la escuela secundaria. Eran como calculadoras que a veces olvidaban cómo multiplicar.

El montaje de entrenamiento: Volviéndose más inteligentes (finales de 2023 – principios de 2024)

Los investigadores volvieron a revisar unos meses después. Los corredores de IA se habían estado "entrenando" duro.

  • La Mejora: La IA aprendió a usar herramientas, específicamente un lenguaje de programación llamado Python. Piensa en esto como si al corredor de repente se le permitiera usar una bicicleta de alta tecnología en lugar de solo correr a pie.
  • El Resultado: Para finales de 2023, el corredor GPT-4 salió disparado hacia un 93 de 120, obteniendo la calificación máxima ("L"). Ahora podía resolver complicados problemas de geometría que involucran el espacio 3D, algo que antes le resultaba imposible.
  • La Brecha: Sin embargo, no todos los corredores mejoraron a la misma velocidad. A principios de 2024, una versión gratuita de la IA de Google seguía estancada en la mitad de la tabla, mientras que las versiones de pago de la IA de OpenAI y Microsoft lideraban la carrera.

La línea de meta: La era "Superhumana" (enero de 2025)

Para cuando los investigadores realizaron la prueba final a principios de 2025, la carrera había cambiado por completo. Los corredores de IA no solo estaban compitiendo; estaban rompiendo el marcador.

  • Los Nuevos Campeones: Dos nuevos corredores, DeepSeek R1 y el o3 de OpenAI, cruzaron la línea de meta con una puntuación perfecta de 120 de 120.
  • El Significado: Estos modelos no solo pasaron el examen; obtuvieron una puntuación más alta de la que casi cualquier estudiante humano ha obtenido jamás. De hecho, si estos modelos de IA fueran estudiantes reales postulando a las universidades finlandesas hoy, serían aceptados en los programas más competitivos (como medicina o ingeniería) y probablemente estarían clasificados en la cima del grupo de aspirantes.

¿Cómo se volvieron tan rápidos? (La receta secreta)

El artículo explica que estos modelos no solo "memorizaron" más matemáticas. Cambiaron cómo piensan.

  • Cadena de Pensamiento (Chain of Thought): Imagina a un humano resolviendo un rompecabezas difícil. No solo adivina la respuesta; hace una pausa, piensa paso a paso, revisa su trabajo y corrige sus errores si se queda atascado. Los nuevos modelos de IA (como el "o1" y "o3" de OpenAI) hacen lo mismo. Simulan un "proceso de pensamiento" antes de responder, lo que les permite detectar sus propios errores.
  • Autocorrección: Los modelos antiguos eran como un estudiante que escribe una respuesta y la entrega inmediatamente. Los nuevos modelos son como un estudiante que escribe un borrador, se da cuenta de un error, reescribe la solución y luego la entrega. Este pensamiento "deliberativo" es lo que les permitió obtener puntuaciones perfectas.

La conclusión

El artículo concluye que el "cerebro matemático" de estas herramientas de IA ha evolucionado increíblemente rápido en solo un par de años.

  • Lo que pueden hacer: Ahora pueden resolver exámenes de matemáticas difíciles y de alto nivel mejor que el estudiante humano promedio, logrando a menudo puntuaciones perfectas.
  • Lo que el artículo pregunta después: El artículo no afirma que estas IA estén listas para ser profesores todavía. Pregunta: Solo porque puedan resolver el problema perfectamente, ¿pueden realmente explicarlo a un estudiante confundido de una manera útil? El artículo sugiere que, si bien la parte de "resolver" ha sido dominada, la parte de "enseñar" es el próximo gran desafío.

En resumen: La IA pasó de ser un estudiante con dificultades a un genio de las matemáticas en tiempo récord, pero la pregunta ahora es si puede ser un buen tutor.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →