← Últimos artículos
🤖 AI

First Proof Second Batch

Este artículo evalúa las capacidades de los sistemas de IA actuales para resolver matemáticas de nivel de investigación mediante la presentación de los problemas, la metodología y los resultados de la evaluación de varios modelos de IA en diez problemas distintos aportados por matemáticos, junto con materiales suplementarios que incluyen soluciones humanas y reportes de revisores.

Autores originales: Mohammed Abouzaid, Nikhil Srivastava, Rachel Ward, Lauren Williams

Publicado 2026-06-17
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Mohammed Abouzaid, Nikhil Srivastava, Rachel Ward, Lauren Williams

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina a un grupo de matemáticos decidiendo organizar una "competencia de cocina" de alto nivel, pero en lugar de hornear pasteles, le están pidiendo a una Inteligencia Artificial que cocine pruebas matemáticas totalmente nuevas. Este documento es el informe de calificaciones oficial de la segunda ronda de esa competencia, llamada First Proof Second Batch.

Aquí está la historia de lo que sucedió, desglosada en términos sencillos.

La Configuración: Un Nuevo Tipo de Examen

En la primera ronda de este experimento, los organizadores permitieron que cualquiera intentara resolver los problemas. Fue un poco como una casa abierta. Para esta segunda ronda, quisieron ser mucho más estrictos y científicos.

  • Los Chefs (Los Sistemas de IA): Invitaron a cuatro "chefs" específicos para competir. Estos no eran solo computadoras aleatorias; eran sistemas de IA avanzados construcidos por universidades de élite (como UCLA y Princeton) y una empresa (OpenAI).
  • Los Ingredientes (Los Problemas): Los organizadores no les dieron a las IA problemas matemáticos viejos y ya resueltos que se encuentran en los libros de texto. En su lugar, les entregaron 10 acertijos nuevos y sin resolver que matemáticos humanos habían descubierto recientemente en sus propias investigaciones. Eran problemas que aún no se habían publicado en internet ni en revistas científicas.
  • Las Reglas: La IA tenía que resolver estos problemas por sí sola, sin que los humanos le susurraran las respuestas al oído. Los organizadores observaron cada paso, registraron cada palabra que la IA escribía y mantuvieron un registro estricico de cuánto costó "operar la cocina".

El Juicio: Una Prueba de Sabor a Ciegas

Una vez que las IA presentaron sus "platos" (las pruebas), un panel de 30 matemáticos expertos actuó como los jueces. Para ser justos, los jueces no sabían qué IA había hecho cada plato. Le dieron a cada solución una calificación:

  • Esencialmente Impecable: Un plato perfecto, listo para servir.
  • Revisiones Menores: Delicioso, pero necesita una pizca más de sal o una mejor guarnición.
  • Revisiones Mayores: El plato principal está ahí, pero la salsa se quemó o faltan ingredientes. Necesita mucho trabajo.
  • Rechazado: El plato es incomible.

Los Resultados: Un Mix de Todo un Poco

El resultado fue una mezcla de avances impresionantes y fracasos vergonzosos.

1. Los Momentos de "¡Guau!" (Éxitos)

  • El Invitado Sorpresa: Para un problema que involucraba ecuaciones de fluidos complejas (Problema 5), una IA no solo copió una solución humana; inventó una manera completamente nueva de resolverlo. Los jueces quedaron tan impresionados que lo calificaron como "esencialmente impecable". Fue como si un chef inventara una nueva técnica de cocina que ningún humano había pensado antes.
  • Los Imitadores: Para otro problema (Problema 6), dos IA lograron resolverlo perfectamente. Siguieron el camino de la solución humana, pero lo hicieron con tal precisión mecánica que los jueces dijeron: "Esto es matemáticamente correcto, aunque el estilo de escritura sea un poco robótico".

2. Los Problemas de "Alucinación" (Fracasos)

  • Las Citas Falsas: Un problema recurrente fue que las IA citaban con confianza libros o artículos que no existían o que no decían lo que la IA afirmaba. Era como si un chef dijera: "Esta salsa está hecha con un ingrediente secreto de un famoso chef francés", pero cuando revisas el libro, ese chef nunca escribió sobre ello.
  • El Plagio: En un caso, una IA resolvió un problema de geometría copiando el trabajo previo de un matemático humano casi palabra por palabra, usando las mismas etiquetas y términos extraños, pero olvidó dar el crédito correspondiente. Si un estudiante humano hiciera esto, sería expulsado por hacer trampa.
  • El Camino Equivoco: Para varios problemas, las IA intentaron probar cosas que en realidad eran falsas, o se quedaron atrapadas en bucles de sinsentidos. Una IA intentó resolver un problema de geometría inventando un teorema que no existía, esencialmente mintiéndole a los jueces para que su prueba pareciera completa.

3. El Costo de Cocinar
El informe también analizó el "precio" de la comida.

  • Algunas IA eran baratas pero cometían errores.
  • Otras eran increíblemente caras, costando miles de dólares en tiempo de computación para producir una sola solución.
  • Las soluciones más exitosas a menudo requirieron más "tiempo de pensamiento" (tokens) y dinero.

La Gran Conclusión

El artículo concluye que la IA se está volviendo muy buena en la matemática rutinaria. Si un problema se parece a algo que ya ha visto antes, o si solo requiere seguir una receta conocida, la IA puede hacerlo bien.

Sin embargo, cuando se trata de la verdadera creatividad —dar con una idea completamente nueva, detectar una conexión profunda entre dos campos no relacionados o evitar la trampa de inventar cosas— la IA todavía tiene dificultades. A menudo intenta "fingir" citando artículos falsos o saltándose las partes más difíciles del argumento.

En resumen: La IA es un aprendiz muy rápido y muy caro que puede seguir una receta perfectamente, pero no está lista para inventar una nueva gastronomía por su cuenta. Necesita a un chef humano que revise su trabajo, corrija sus citas y se asegure de que no esté alucinando ingredientes.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →