← Últimos artículos
🤖 AI

Exploring Agentic Workflows for Generating High Quality Math Visual Aids

Este artículo introduce un flujo de trabajo agéntico que permite a los Modelos de Lenguaje Extensos y a los Modelos de Lenguaje y Visión generar y refinar iterativamente diagramas matemáticos de alta calidad y pedagógicamente sólidos para la educación K-12 mediante el uso de preguntas de control de calidad autogeneradas y retroalimentación visual para superar las limitaciones actuales en el razonamiento espacial y la precisión.

Autores originales: Rizwaan Malik, Ashna Khetan, Isabel Sieh, Samin Khan

Publicado 2026-07-14
📖 4 min de lectura☕ Lectura para el café

Autores originales: Rizwaan Malik, Ashna Khetan, Isabel Sieh, Samin Khan

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando enseñarle a un robot a dibujar un mapa perfecto de una isla del tesoro para una clase de matemáticas de secundaria. Le das al robot una descripción detallada: "Dibuja una flor hecha de hexágonos amarillos, trapecios rojos y triángulos verdes". Pero cuando el robot te entrega el dibujo, los pétalos están aplastados, los colores son incorrectos o faltan las formas por completo. Es como pedir un pastel personalizado y recibir un ladrillo ladeado.

Este es exactamente el problema que los investigadores Rizwaan Malik, Ashna Khetan, Isabel Sieh y Samin Khan están abordando. Descubrieron que incluso las herramientas de IA más inteligentes (llamadas Modelos de Lenguaje Extensos, o LLM) son todavía bastante torpes al dibujar estos diagramas matemáticos. De hecho, al ser probadas con problemas de matemáticas de secundaria, la mejor IA solo acertó el 73.9% de las veces. Es una nota de aprobado, claro, pero no es suficiente si quieres que cada estudiante aprenda perfectamente.

Así que el equipo probó un nuevo truco: construyeron un "equipo de robots de auto-mejora". En lugar de solo pedirle a la IA que dibuje una vez y esperar lo mejor, crearon un bucle donde la IA actúa como un estricto profesor de arte, un detective y un pintor, todo a la vez.

Así es como funciona su "flujo de trabajo agéntico" (un término elegante para un equipo de agentes de IA trabajando juntos):

  1. El Pintor: Primero, una IA dibuja el diagrama basado en tu descripción.
  2. El Maestro de Trivia: Después, una segunda IA (el Generador de QA) observa el dibujo y escribe un conjunto de cuatro preguntas abiertas para ponerlo a prueba. En lugar de hacer preguntas simples de "Sí/No" como "¿Es esto rojo?", hace preguntas más profundas como: "¿Cómo aseguró el código que la barra del colgador fuera perfectamente horizontal?".
  3. El Detective: Luego, una IA revisa el código de computadora utilizado para dibujar la imagen contra esas preguntas. Los investigadores descubrieron que las IA de "visión" estándar son bastante malas analizando diagramas complejos (a menudo cuentan mal los elementos o se confunden con el espacio), por lo que cambiaron a hacer que la IA leyera las instrucciones del código en su lugar, lo cual es mucho más confiable para detectar errores.
  4. El Reparador: Si el dibujo falla la trivia, la IA recibe la retroalimentación e intenta redibujarlo. Continúa el bucle de este proceso hasta que el dibujo pasa todas las pruebas o se queda sin intentos.

El equipo probó esta idea y encontró cosas interesantes. Cuando dejaron que el "Detective" mirara tanto la imagen final como el código de computadora utilizado para dibujarla, los expertos humanos estuvieron de acuerdo con la calificación de la IA el 97% de las veces. Esto es un gran salto desde mirar solo la imagen (68%) o solo el código (81%). Resulta que, ver el plano ayuda a detectar los errores mejor.

También descubrieron que hacer preguntas abiertas funcionaba mucho mejor que las preguntas simples de sí o no. Es como pedirle a un estudiante que "explique su razonamiento" en lugar de solo preguntar "¿lo hiciste?".

Sin embargo, el equipo tiene cuidado en decir que esto no es una varita mágica que lo resolvió todo. En sus experimentos, incluso después de que la IA intentó arreglar el dibujo una vez, el 70% de los diagramas todavía necesitaban otra ronda de corrección. E incluso después de dos rondas de correcciones, la puntuación humana promedio para los dibujos solo subió de 3.4 a 3.7 en una escala de 5 puntos.

El equipo chocó con algunos muros específicos. Por ejemplo, al intentar dibujar un "colgador equilibrado" (una herramienta matemática clásica), la IA seguía espaciando las cajas colgantes de manera desigual, incluso después de que se le ordenara arreglarlo. La IA podía ver el error, pero no podía descifrar cómo arreglar el código para que el espaciado fuera perfecto. Del mismo modo, la IA a veces tenía dificultades para contar el número exacto de formas o verificar si las medidas eran correctas, porque todavía es algo mala en el "razonamiento espacial" (entender cómo las cosas encajan entre sí en el espacio).

Los investigadores sugieren que, si bien este "bucle de auto-mejora" es un comienzo prometedor, aún no está listo para reemplazar a los profesores humanos. Argumentan que los sistemas futuros necesitan mejores formas de hacer las preguntas correctas y mejores "ojos" para entender las relaciones espaciales. Pero por ahora, este enfoque muestra que si le das a la IA la oportunidad de revisar su propio trabajo e intentarlo de nuevo, puede mejorar un poco en el dibujo de los mapas que los estudiantes necesitan para encontrar su camino a través de las matemáticas.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →