← Últimos artículos
🤖 AI

ProofCouncil: An LLM Agent for Solving Open Mathematical Problems

Este artículo presenta ProofCouncil, un agente de LLM de código abierto que utiliza una arquitectura de autor-crítico y que alcanzó el estado del arte en el desafío FirstProof al resolver autónomamente seis de diez problemas matemáticos del mundo real y demostrar un progreso significativo en un conjunto más amplio de problemas abiertos.

Autores originales: Johannes Schmitt, Tim Gehrunger, Jasper Dekoninck, Gergely Bérczi, Uri Kreitner, Liam Price, David Holmes

Publicado 2026-07-13
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Johannes Schmitt, Tim Gehrunger, Jasper Dekoninck, Gergely Bérczi, Uri Kreitner, Liam Price, David Holmes

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que le has entregado a un robot nuevo y superinteligente una pila de los acertijos matemáticos más desconcertantes del mundo. No son los típicos acertijos de "encuentra el número faltante"; son problemas abiertos en los que matemáticos reales llevan años rompiéndose la cabeza y nadie conoce la respuesta todavía.

Entra en escena ProofCouncil. Piensa en esto no como un solo robot, sino como un pequeño taller de matemáticas de alto nivel.

El equipo del taller: Autor, Crítico y la Escuadra

El corazón de este sistema es un ingenioso juego de "la papa caliente" jugado por dos personajes principales: el Autor y el Crítico.

  • El Autor es el soñador. Es una IA que se sienta a intentar escribir una prueba perfecta (un argumento matemático paso a paso) para un problema. Tiene un cuaderno mágico donde garabatea ideas, prueba código e incluso busca pistas en la web.
  • El Crítico es el editor estricto. Lee lo que el Autor escribió y dice: "Espera, este paso no tiene sentido", o "¡Olvidaste demostrar esta parte!". No se limita a decir que está mal; da comentarios específicos sobre cómo solucionar las lagunas.

El giro es que el Autor no escribe solo una vez. Escribe, recibe críticas, vuelve a escribir, recibe más críticas y sigue adelante. Es como un escritor y un editor encerrados en una habitación, puliendo una historia hasta que sea perfecta.

Pero a veces, el Autor se queda atascado. Es entonces cuando llama al Consejo y al Nodo de Cómputo.

  • El Consejo es un panel de otras IAs superinteligentes (como un equipo de expertos invitados). El Autor les pregunta: "Oye, estoy atascado en esta parte específica; ¿hay una forma diferente de ver esto?".
  • El Nodo de Cómputo es el que hace el trabajo pesado. Si el problema requiere un cálculo masivo o una herramienta de software matemático especializada que el Autor no puede ejecutar por sí solo, este nodo realiza el trabajo pesado, ejecutando código y procesando números para verificar si una corazonada es cierta.

Cada pocos ciclos, el Crítico se toma un "descanso mental" y comienza de nuevo con un lienzo en blanco. Esto es crucial porque, si el Crítico se acostumbra demasiado a los errores del Autor, podría dejar de verlos. Un par de ojos frescos asegura que la prueba sea realmente sólida.

La gran prueba: El desafío FirstProof

El equipo puso a prueba a ProofCouncil con un desafío llamado FirstProof. Las reglas eran simples pero brutales: resolver 10 problemas matemáticos reales y no resueltos en 24 horas, utilizando únicamente herramientas públicas.

¿Los resultados? ProofCouncil fue la estrella del espectáculo. De los 10 problemas, logró producir soluciones para 6 de ellos que los revisores humanos juzgaron como correctas (solo necesitando pequeños y menores ajustes). Este fue el mejor desempeño de cualquier equipo en la competición.

También lo probaron con 30 otros problemas abiertos enviados por matemáticos reales. De los 21 problemas de los que recibieron comentarios:

  • 5 fueron juzgados como soluciones completamente correctas.
  • 2 fueron vistos como muy prometedores, solo esperando una revisión final.
  • 8 hicieron progresos útiles, aunque no terminaron el trabajo.
  • 4 no tenían errores, pero no aportaron mucho al avance.
  • 2 malinterpretaron la pregunta y resolvieron una versión más fácil de la misma.

Es importante destacar que ningún experto dijo que los resultados fueran matemáticamente erróneos de una manera que rompiera la lógica. El principal fallo no fue una mala matemática; a veces era malinterpretar el enunciado del problema.

El costo del genio

Aquí está el truco: ser así de inteligente es caro. Ejecutar ProofCouncil en un solo problema costó aproximadamente $350 en tiempo de computación y llamadas a modelos. Compara esto con un intento de IA de un solo paso más simple, que costó solo $12 pero resolvió menos problemas. El artículo sugiere que, si bien el "enfoque de equipo" funciona mejor, actualmente es un artículo de lujo. Los autores admiten que aún no han intentado hacer que sea más barato, dejando eso como un trabajo para futuros investigadores.

Lo que no hizo (Y lo que no pretendía)

Es importante saber lo que este robot no hizo.

  • No resolvió los 10 problemas del desafío (falló en 4).
  • No produjo un artículo de investigación pulido y listo para publicar. Los matemáticos que revisaron el trabajo señalaron que la redacción era densa y necesitaba edición humana para ser legible para no expertos.
  • No "demostró" que la IA pueda resolver cualquier problema matemático. Mostró que, para algunos problemas difíciles, un equipo de IAs trabajando juntas es mejor que una sola IA trabajando sola.

La conclusión

ProofCouncil sugiere que, si quieres resolver un problema matemático abierto y realmente difícil, no deberías simplemente pedirle a una IA que "lo resuelva". En su lugar, necesitas un sistema donde una IA escriba, otra la desmonte, una tercera ofrezca perspectivas frescas y una cuarta realice los cálculos matemáticos pesados.

En el mundo del desafío FirstProof, este equipo de "Autor-Crítico-Consejo" fue la estrategia más exitosa probada hasta ahora. No conquistó la montaña entera, pero escaló más alto que cualquier otro, demostiendo que cuando los agentes de IA trabajan juntos como un equipo de investigación humano, pueden abordar problemas que antes se consideraban fuera de su alcance.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →