APE-Bench: Evaluating Automated Proof Engineering for Formal Math Libraries
Este artículo presenta APE-Bench, el primer marco y banco de pruebas sistemático para evaluar la ingeniería de pruebas automatizada en bibliotecas de matemáticas formales mediante la extracción de tareas del mundo real a escala de repositorio y la provisión de un entorno unificado para validar tanto la compilación sintáctica como la corrección semántica a través de diversas implementaciones de agentes.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que estás intentando enseñarle a un robot cómo ser un maestro bibliotecario para una enorme y viva biblioteca de pruebas matemáticas. Esta biblioteca, llamada Mathlib, contiene millones de páginas. No es solo un libro estático; se está reescribiendo, expandiendo y corrigiendo constantemente por expertos humanos.
Durante mucho tiempo, los investigadores probaron a los robots en su capacidad para resolver acertijos matemáticos aislados y únicos (como "Demostrar que 2+2=4"). Pero en el mundo real, ser matemático no es solo resolver un acertijo aislado; se trata de ingeniería de pruebas. Esto significa navegar por toda la biblioteca, encontrar las herramientas adecuadas, arreglar páginas rotas y asegurarse de que tus nuevas adiciones encajen perfectamente con los millones de páginas ya existentes sin romper nada más.
Este artículo presenta una nueva forma de probar a los robots en estas habilidades del mundo real. Aquí está el desglose utilizando analogías sencillas:
1. El Proble Problema: El "Acertijo Aislado" frente a la "Biblioteca Viva"
- La forma antigua (miniF2F): Imagina probar a un chef dándole una única tarjeta de receta y pidiéndole que cocine un plato. Si el plato sabe bien, aprueba. Esto no te dice si puede gestionar la cocina de todo un restaurante, pedir ingredientes o arreglar un horno roto.
- La realidad: El trabajo matemático real es como gestionar ese restaurante. Tienes que coordinarte con otros chefs, usar herramientas específicas y asegurar que tu nuevo plato no arruine el menú.
- La brecha: Las pruebas existentes solo comprobaban si el robot podía cocinar ese único plato. No comprobaban si el robot podía lidiar con el caos de una cocina real.
2. La Solución: APE-Bench (La prueba de la "Biblioteca Viva")
Los autores crearon APE-Bench, un nuevo campo de pruebas que imita el mantenimiento de una biblioteca de la vida real.
- Cómo funciona: En lugar de darle al robot un acertijo falso, el sistema observa la historia real de la biblioteca Mathlib. Encuentra un momento en el que un experto humano realizó un cambio (un "commit"), oculta ese cambio y le pregunta al robot: "Aquí está la biblioteca antes del cambio. Aquí hay una nota que dice lo que el humano quería hacer. ¿Puedes realizar ese cambio?"
- El giro: El robot no solo es calificado por si el código "funciona" (sintaxis). Es calificado por dos cosas:
- Compilación: ¿Realmente compiló el código sin errores? (¿Se quemó el plato?)
- Verificación Semántica: ¿Realmente hizo el robot lo que se le pidió? (¿Arregló el problema correcto, o simplemente cambió líneas al azar?)
3. La Infraestructura: APE-Harness (La "Cocina Universal")
Para ejecutar estas pruebas de manera justa, construyeron un sistema llamado APE-Harness. Piensa en esto como un simulador de cocina universal.
- El "Contrato": Cada prueba viene con un contrato estricto. Dice: "Estás en esta versión específica de la biblioteca. Solo puedes tocar estos archivos. Debes demostrar que hiciste el trabajo".
- Los "Andamios": El sistema está diseñado para que puedas conectar diferentes robots (como Claude Code, Codex o su propio APE-Agent) en la misma cocina. Debido a que las reglas de la cocina (el contrato) son las mismas para todos, puedes comparar justamente quién es realmente el mejor chef, en lugar de solo ver quién tuvo suerte con las instrucciones.
- El truco del "Viaje en el Tiempo": La biblioteca tiene 67 versiones diferentes (como 67 ediciones distintas de un libro). Almacenar todas ellas tomaría una cantidad masiva de espacio. Los autores construyeron un ingenioso sistema de "deduplicación". Si una página es igual en la Versión 1 y en la Versión 67, el sistema la almacena una sola vez y simplemente apunta a ella. Esto les ahorró un 85% del espacio de almacenamiento y un 98% del dinero necesario para procesar los datos.
4. Los Resultados: ¿Quién pasó la prueba?
Probaron tres modelos de IA de alto nivel (GPT-5.2, Gemini 3 Pro y Gemini 3 Flash) en este nuevo y más difícil test.
- La dificultad: El nuevo test fue mucho más difícil que los antiguos tests de "acertijo único".
- En los tests antiguos, los robots obtenían un 80–90% de aciertos.
- En el nuevo test de "Mantenimiento de Biblioteca", el mejor robot solo obtuvo un 47% de aciertos.
- El ganador: Gemini 3 Flash fue el más eficiente. Resolvió la mayoría de los problemas con el menor costo. Los otros modelos intentaron esforzarse más (más turnos de conversación), pero se quedaron sin su "presupuesto" antes de terminar.
- La lección: Los robots son excelentes resolviendo problemas matemáticos aislados, pero todavía luchan con la tarea desordenada y compleja de gestionar un código base enorme y en evolución.
5. Por qué esto es importante
El artículo afirma que esta es la primera vez que tenemos una forma sistemática y automatizada de probar si una IA puede realizar "ingeniería de software para pruebas".
- Cambia el objetivo de "¿Puede la IA resolver un problema matemático?" a "¿Puede la IA trabajar como un matemático profesional en un entorno de equipo?".
- Proporciona un campo de juego justo donde diferentes sistemas de IA pueden ser comparados utilizando exactamente las mismas reglas y herramientas.
En resumen: Los autores construyeron una simulación realista de una biblioteca matemática gigante y desordenada, junto con un conjunto de reglas para probar si la IA puede arreglarla. Descubrieron que, aunque la IA está mejorando, todavía tiene un largo camino por recorrer antes de poder gestionar de forma fiable proyectos matemáticos complejos en el mundo real por sí sola.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.