CodeRescue: Budget-Calibrated Recovery Routing for Coding Agents
Este artículo presenta CodeRescue, un marco de enrutamiento de recuperación calibrado por presupuesto que aprovecha la retroalimentación de ejecución y el Control de Riesgo Conforme para decidir dinámicamente entre la autorrecuperación económica y la escalada al modelo para agentes de codificación, logrando tasas de resolución superiores a costos significativamente menores en comparación con las líneas base existentes.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Resumen Técnico: CodeRescue: Enrutamiento de Recuperación Calibrado por Presupuesto para Agentes de Codificación
1. Formulación del Problema
El artículo aborda el desafío de despliegue de los agentes de codificación que operan en entornos ejecutables donde los intentos fallidos generan retroalimentación accionable (por ejemplo, errores de compilación, pruebas fallidas, trazas de stderr) en lugar de solo salidas incorrectas. Los sistemas actuales conscientes del costo suelen tratar los fallos del modelo como una decisión binaria: escalar inmediatamente a un modelo más fuerte y costoso.
Los autores argumentan que este enfoque es subóptimo para la codificación porque la retroalimentación de ejecución puede hacer que nuevos intentos por parte de un modelo económico valgan la pena. Esto crea una pregunta de despliegue presupuestado: cuando un agente falla, ¿debe gastar más cómputo económico para reparar la solución (reflexionar) o replanificar, o debería escalar a un modelo más fuerte?
El problema se formula como enrutamiento de recuperación post-fallo. Dado un intento inicial fallido de un modelo económico, el sistema debe elegir entre tres acciones heterogéneas:
- Reflexionar (Reflect): Revisar la solución existente utilizando la retroalimentación de ejecución.
- Replanificar (Replan): Generar una solución fresca desde un plan diferente utilizando el modelo económico.
- Escalar (Escalate): Delegar el problema (con la retroalimentación) a un modelo más fuerte y costoso.
El objetivo es maximizar la tasa de resolución sujeto a un presupuesto medio de recuperación () especificado por el usuario, sin tener que reentrenar la política para cada nueva restricción de presupuesto.
2. Metodología
2.1 Enrutador de Recuperación Supervisado
El componente central es un enrutador supervisado entrenado en ejecuciones (rollouts) offline.
- Entrada: Un contexto de recuperación , que consiste en el enunciado del problema, el veredicto de ejecución y la traza de stderr.
- Etiquetado: Para cada instancia fallida, la etiqueta "oráculo" se define como la acción exitosa más económica () entre el conjunto de acciones que resuelven la instancia (). Las instancias donde ninguna acción tiene éxito son excluidas.
- Entrenamiento: Un modelo de lenguaje (por ejemplo, Qwen3.5-4B) es ajustado mediante entropía cruzada para predecir la acción exitosa más económica. El enrutador puntúa las acciones basándose en las probabilidades logarítmicas y las normaliza mediante softmax.
2.2 Política Regularizada por Costo
Para permitir el despliegue bajo diversos presupuestos sin reentrenamiento, los autores introducen una penalización de costo . La política selecciona la acción que maximiza:
donde es la puntuación del enrutador y es el costo de despliegue estimado.
- A medida que aumenta, la política se desplaza hacia acciones más económicas (reflexión/replanificación).
- Esto crea un conjunto discreto de puntos de operación (una frontera de costo-calidad) derivado de un único enrutador entrenado.
2.3 Calibración de Presupuesto Conforme (CRC)
Para seleccionar el apropiado para un presupuesto de usuario específico con garantías estadísticas, los autores aplican Control de Riesgo Conforme (CRC).
- Mecanismo: Utilizando un conjunto de calibración de instancias fallidas, el sistema calcula el costo medio empírico para varios valores de .
- Regla de Selección: Selecciona la penalización menos restrictiva tal que la restricción de presupuesto de muestra finita se cumpla:
donde es un tope de costo conocido y el término aditivo proporciona una corrección conforme de dejar uno fuera (leave-one-out). - Garantía: Bajo el supuesto de intercambiabilidad, este procedimiento garantiza que el costo medio de recuperación esperado de la política desplegada en datos de prueba futuros no exceda . Crucialmente, esta garantía se aplica al costo, no a la tasa de resolución, lo que permite patrones de éxito no monotónicos a través de las acciones.
3. Contribuciones Clave
- Enrutamiento de Recuperación Post-Fallo: El artículo formula la recuperación de agentes de codificación como un problema de enrutamiento sobre acciones heterogéneas (reflexión, replanificación, escalada) en lugar de un simple cascada hacia un modelo más fuerte.
- Despliegue Controlable por Presupuesto: Introduce un enrutador con penalización de costo calibrado por CRC que permite que un único enrutador entrenado opere en múltiples puntos presupuestados con control marginal del costo esperado, eliminando la necesidad de reentrenar para diferentes restricciones de presupuesto.
- Compensaciones Empíricas de Recuperación: El estudio proporciona evidencia empírica de que la recuperación económica y la escalada de modelos exhiben patrones de éxito complementarios (es decir, algunos fallos solo son resolubles mediante acciones económicas, otros solo mediante escalada, y algunos por ambos), formando una frontera discreta de costo-calidad.
4. Resultados Experimentales
El sistema fue evaluado en cinco benchmarks de codificación (APPS, TACO, BigCodeBench, LiveCodeBench, CodeContests) utilizando GPT-5.4-NANO como el modelo económico y GPT-5.4 como el modelo fuerte.
- Eficacia del Enrutador: Un enrutador aprendido supera significativamente a las líneas base de acción fija. El enrutador aprendido sin restricciones logró una tasa de resolución del 81.7% con un costo medio de 5.51 m$, comparado con el 68.6% de "siempre escalar" con 7.22 m$.
- Complementariedad: El análisis de las acciones exitosas más económicas ("oráculo") reveló que el 28% de los fallos eran resolubles solo por acciones económicas, el 45% solo por escalada, y el 27% por ambos. Esta heterogeneidad justifica la necesidad de un enrutador sobre una cascada fija.
- Calibración de Presupuesto: La frontera calibrada por CRC demostró que, con un presupuesto de 2.56 m$, el sistema logró una tasa de resolución del 71.7%. Esto superó la línea base de "siempre escalar" (68.6%) utilizando solo el 35% del costo medio de la estrategia de siempre escalar.
- Líneas Base: El enrutador aprendido superó a los enrutadores basados solo en prompts (LLMs zero-shot actuando como enrutadores) y a las líneas base de cascada binaria, confirmando que la señal de enrutamiento requiere aprender de las ejecuciones (rollouts) en lugar de solo ingeniería de prompts.
5. Significado y Reivindicaciones
El artículo sostiene que tratar los fallos de codificación como un problema de reparación diagnosticable, en lugar de una simple brecha de capacidad, permite una asignación de recursos más eficiente. Al desacoplar el entrenamiento del enrutador del presupuesto de despliegue mediante CRC, el sistema ofrece un mecanismo práctico para la inferencia controlada por presupuesto.
Los autores enfatizan que su enfoque no pretende controlar la tasa de resolución de forma conforme; más bien, proporciona una garantía de costo, mientras que las mejoras en la tasa de resolución son observaciones empíricas. El trabajo sugiere que para los agentes de codificación, el "paso siguiente útil más económico" no es a menudo el modelo más fuerte, sino una acción de recuperación específica adaptada al modo de fallo, y que esta decisión puede tomarse dinámicamente bajo restricciones de presupuesto estrictas.
Limitaciones señaladas por los autores:
- La recuperación se modela como una única decisión post-fallo, mientras que los agentes reales pueden iterar sobre múltiples rondas.
- La etiqueta "el más económico exitoso" es un proxy y no una estimación de probabilidad calibrada.
- CRC controla el costo esperado, no la tasa de resolución, lo que significa que las mejoras en la calidad siguen siendo observaciones empíricas.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.