← Últimos artículos
💻 computer science

AI-Assisted Completion of CertiGC Proofs: An Experience Report

Este informe de experiencia detalla cómo se utilizaron herramientas asistidas por IA (Codex) para estabilizar y completar la prueba del recolector de basura generacional verificado CertiGC en Rocq, reorganizando la verificación en torno a un nuevo invariante de borde retrocedido registrado para manejar actualizaciones mutables, mientras que los expertos humanos se centraron en adjudicar invariantes y auditar la ruta de la prueba para asegurar la corrección.

Autores originales: Shengyi Wang

Publicado 2026-07-09
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Shengyi Wang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que eres el arquitecto jefe de una enorme biblioteca mágica llamada CertiGC. Esta biblioteca no solo almacena libros; es un sistema vivo y palpitante que limpia automáticamente los libros viejos y sin uso para hacer espacio a los nuevos. Durante años, la biblioteca funcionó con una regla simple: "Una vez que un libro se coloca en un estante, nadie lo mueve ni escribe una nota señalando a un libro más nuevo". Esta regla hacía que el trabajo del equipo de limpieza fuera fácil. Podían barrer los estantes sabiendo que ningún libro viejo apuntaría de repente a uno completamente nuevo.

Pero entonces, la biblioteca decidió volverse emocionante. Querían permitir actualizaciones mutables: dejar que los bibliotecarios escribieran nuevas notas en los libros viejos que apuntaran a llegadas mucho más recientes. De repente, la vieja regla ("no hay libros viejos apuntando a los nuevos") se rompió. El mapa del equipo de limpieza ahora era erróneo. Si seguían barriendo basándose en el antiguo mapa, pasarían por alto los nuevos libros a los que las notas viejas apuntaban, ¡y esos libros serían desechados por error!

Esta es la historia de un equipo que utilizó un asistente de IA superinteligente, llamado Codex, para arreglar el mapa de limpieza de la biblioteca. Pero aquí está el giro: Codex no inventó mágicamente un nuevo mapa de la nada. En su lugar, Codex actuó como un pasante incansable y hiperorganizado que podía leer miles de páginas, probar nuevas ideas y ejecutar la "simulación de limpieza" una y otra vez, mientras un experto humano permanecía al lado para decir: "Sí, esa idea funciona" o "No, eso rompe las reglas".

El Gran Problema: El Mapa Roto

El mapa original dependía de una regla de "No-Retroceso-de-Aristas" (No-Backward-Edge). Piensa en ello como un sistema de calles de un solo sentido donde solo puedes conducir hacia adelante en el tiempo. Pero con las nuevas actualizaciones "mutables", de repente podías conducir hacia atrás desde un vecindario viejo a uno nuevo. El viejo mapa decía: "¡Esto es imposible!". La nueva realidad decía: "¡Sucede todo el tiempo!".

Si el equipo intentaba forzar el viejo mapa para que funcionara, tendrían que fingir que los viajes hacia atrás nunca ocurrieron. Eso significaría que la biblioteca solo sería "correcta" para una versión aburrida de sí misma que no hiciera las cosas geniales y nuevas. Ese no era el objetivo. Necesitaban una nueva regla que admitiera que los viajes hacia atrás eran posibles, pero solo si se registraban en un libro de registro especial.

El Rol de la IA: El Pasante Incansable

El experto humano sabía que necesitaban una nueva regla: "Cada vez que un libro viejo apunte a uno nuevo, debe escribirse en el libro de registro 'Conjunto Recordado' (Remembered Set)".

Le pidieron a Codex que ayudara a construir la prueba de que esta nueva regla mantendría la biblioteca segura. Codex no se limitó a escribir la respuesta final. Actuó como un detective que:

  1. Leyó el código: Escaneó los planos de la biblioteca.
  2. Propuso la regla: Sugirió el concepto de "Arista-Retroactiva-Registrada" (Recorded-Backward-Edge) (la idea del libro de registro).
  3. Probó la regla: Ejecutó la simulación de limpieza de la biblioteca (el "núcleo de Rocq") miles de veces.
  4. Corrigió los errores: Cuando la simulación fallaba, Codex ajustaba los scripts de la prueba, probaba un ángulo diferente y la ejecutaba de nuevo.

El trabajo del experto humano era la parte más crítica: El Juez. Codex podía sugerir una regla, pero el humano tenía que decidir si esa regla realmente coincidía con el comportamiento del mundo real de la biblioteca. Por ejemplo, Codex podría haber sugerido: "Simplemente pretendamos que el libro de registro no existe para el informe final". El humano dijo: "¡No! El libro de registro es real. No podemos ocultarlo".

Los Resultados: Una Biblioteca Limpia

Después de mucho trabajo, el equipo tuvo éxito.

  • La Solución: Reemplazaron la rota regla de "No-Retroceso-de-Aristas" con la nueva regla de "Arista-Retroactiva-Registrada".
  • La Prueba: Se demostró que el proceso de limpieza de la biblioteca es seguro, incluso con las nuevas actualizaciones. El teorema final (el "Gran Certificado") seguía pareciendo igual para el mundo exterior: "La biblioteca está limpia y organizada". Pero debajo, la lógica era mucho más inteligente.
  • La Limpieza: Incluso después de que la prueba principal fuera aceptada, el equipo no se detuvo. Pasaron tiempo extra (del 1 al 3 de mayo) auditando las reglas para asegurarse de que ninguna suposición vieja y rota se escondiera en el código. Eliminaron una condición "obsoleta" que había quedado de la versión vieja y aburrida de la biblioteca.

Lo Que Esto Nos Dice

El artículo sugiere que las herramientas de IA como Codex son increíbles para la manutención y reparación. Pueden ser el compañero perfecto para un experto humano cuando el trabajo implica:

  • Propagar Invariantes: Tomar una nueva regla y asegurarse de que funcione en cada rincón de un código base masivo.
  • Limpiar: Corregir scripts de prueba desordenados y eliminar código viejo e inútil.
  • Probar: Ejecutar la "simulación" (el compilador) una y otra vez para ver si un pequeño cambio rompe algo.

Sin embargo, el artículo es muy claro sobre lo que la IA no puede hacer por sí sola.

  • No descubrió la solución completa: El humano tuvo que entender la semántica de la biblioteca y decidir cuál debía ser la nueva regla.
  • No reemplazó al juez humano: La IA podía proponer una regla, pero el humano tenía que verificar que la regla no debilitara accidentalmente las garantías de seguridad de la biblioteca.
  • No fue una "varita mágica": La IA no escribió toda la prueba de un solo golpe. Fue un proceso "supervisado y dirigido por un verificador". El humano siempre estuvo en el bucle, guiando a la IA, rechazando malas ideas y asegurando que el resultado final fuera realmente correcto.

Los Números

El equipo trabajó en esto durante un tiempo. La "fase asistida por Codex" (cuando la IA estaba haciendo el trabajo pesado) ocurrió entre el 22 de abril y el 3 de mayo de 2026.

  • Durante este tiempo, hubo 51 commits de git (actualizaciones del código).
  • La IA realizó 13,305 llamadas a herramientas (acciones como leer archivos, ejecutar pruebas o editar código).
  • El humano dio 415 prompts (instrucciones a la IA).
  • La IA pasó 59.3 horas activas trabajando en el problema.

El artículo enfatiza que esto no fue un "problema resuelto" donde la IA lo hizo todo sola. En cambio, fue una colaboración exitosa donde la IA se encargó de la tarea tediosa y repetitiva de verificar y corregir, mientras que el humano proporcionó la comprensión profunda y la última palabra sobre lo que es verdad. El resultado es una biblioteca que es segura, verificada y lista para el futuro.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →