← Últimos artículos
💻 computer science

ReProAgent: Tool-Augmented Multi-Stage Agentic Generation of Bug Reproduction Tests from Issue Reports

ReProAgent es un marco de agentes de múltiples etapas y aumentado con herramientas que supera a los enfoques basados en prompts existentes al descomponer la generación de pruebas de reproducción de errores en etapas localizadas de identificación de errores, análisis de la causa raíz, planificación y generación, logrando tasas de éxito significativamente más altas en diversos benchmarks.

Autores originales: Quanjun Zhang, Yi Zheng, Ye Shang, Weifeng Sun, Haichuan Hu, Chunrong Fang, Zhenyu Chen, Liang Xiao

Publicado 2026-07-13
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Quanjun Zhang, Yi Zheng, Ye Shang, Weifeng Sun, Haichuan Hu, Chunrong Fang, Zhenyu Chen, Liang Xiao

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que eres un detective intentando resolver un misterio, pero la única pista que tienes es una nota escrita a mano y borrosa de un testigo que dice: "¡Algo raro pasó en la cocina!". En el mundo del software, esta nota es un informe de error (issue report). Por lo general, los desarrolladores tienen que adivinar qué salió mal, escribir una prueba para demostrarlo y luego intentar arreglarlo. Pero a menudo, no tienen una prueba, lo que hace que todo el proceso sea lento y frustrante.

Durante un tiempo, programas informáticos inteligentes (llamados Modelos de Lenguaje Grande o LLM) intentaron escribir estas pruebas automáticamente. Eran como detectives que simplemente leían la nota e inmediatamente gritaban: "¡Creo que el culpable es la tostadora!". Tomaban algunas pistas cercanas (texto del código) y adivinaban la respuesta. Pero el artículo argumenta que este enfoque es demasiado simple. Es como intentar resolver un complejo misterio de asesinato mirando solo la foto de la escena del crimen sin haber interrogado nunca a los sospechosos o verificado sus coartadas. Estos métodos antiguos a menudo pasaban por alto el problema real porque no entendían cómo estaban conectados los diferentes componentes del código (la "cocina", la "sala de estar" y el "sótano").

Entra ReProAgent: El Equipo de Súper Detectives

Los autores de este artículo construyeron un nuevo sistema llamado ReProAgent. En lugar de un solo detective adivinando la respuesta, ReProAgent es un equipo de agentes especializados que trabajan en un proceso de investigación estricto de cuatro pasos. No solo adivinan; investigan, analizan, planean y luego actúan.

Así es como funciona su "flujo de trabajo de detective":

  1. La Búsqueda (Localización de Errores): Primero, el equipo no mira todo el edificio. Utilizan herramientas especiales para buscar a través del código como un bibliotecario buscando un libro específico. Buscan palabras clave y siguen las "migas de pan" (dependencias) para encontrar exactamente qué archivo y línea de código está fallando.
  2. El Interrogatorio (Análisis de la Causa Raíz): Una vez que encuentran al sospechoso, no lo arrestan de inmediato. Rastrean la ruta exacta que tomó el error. Preguntan: "¿Cómo viajó el error desde la puerta principal hasta la ventana trasera?". Construyen un mapa de la ruta de ejecución para entender por qué ocurrió el error, no solo dónde.
  3. El Diseño de la Trampa (Planificación de Pruebas): Antes de tender una trampa, la planifican. Determinan exactamente qué condiciones deben cumplirse para que el error aparezca de nuevo. Es como configurar un escenario específico donde el sospechoso debe revelar su crimen.
  4. La Operación Encubierta (Generación y Revisión de Pruebas): Finalmente, escriben la prueba (la trampa) y la ejecutan en un entorno aislado y seguro (un arenero digital). Pero lo más genial es que, si la prueba no logra atrapar el error, o si atrapa algo equivocado, el equipo no se rinde; revisan el resultado, preguntan: "¿Atrapamos al criminal correcto?" y luego perfeccionan su prueba. Continúan este ciclo hasta que la prueba reproduce perfectamente el error.

Los Resultados: ¿Funcionó?

El equipo probó ReProAgent en dos grandes conjuntos de problemas de software del mundo real (llamados SWT-bench-lite y SWT-bench-verified). Los resultados fueron impresionantes.

  • En el conjunto más pequeño (SWT-bench-lite), ReProAgent recreó con éxito el error en el 58.43% de los casos.
  • En el conjunto más difícil y verificado (SWT-bench-verified), tuvo éxito en el 70.30% de los casos.

Para poner esto en perspectiva, el siguiente mejor método (un sistema llamado AssertFlip) solo logró resolver alrededor del 38.0% de los problemas en el conjunto más pequeño. ReProAgent no solo venció a la competencia; los dejó atrás, resolviendo aproximadamente 20 puntos porcentuales más casos que el siguiente mejor sistema utilizando el mismo "cerebro" (un modelo llamado GPT-5-mini).

El artículo también comprobó si este equipo funcionaba con diferentes "cerebros" (otros modelos de IA como Qwen3-Coder y DeepSeek-V3.2). ¡Y lo hizo! El sistema funcionó bien con todos ellos, lo que sugiere que el proceso de ser un detective es más importante que simplemente tener al detective más inteligente.

Lo que NO es

El artículo es muy claro sobre lo que ReProAgent no es. No es una varita mágica que arregla los errores por sí misma. Su función es estrictamente escribir la prueba que demuestra que el error existe. Sin embargo, los autores descubrieron que cuando entregaban estas pruebas a otros sistemas que arreglan errores, esos sistemas mejoraban. Por ejemplo, cuando las pruebas de ReProAgent se usaron para ayudar a un sistema llamado SWE-agent, el número de problemas resueltos con éxito pasó de 143 a 153.

El Costo

Ser un súper detective cuesta un poco de dinero. El artículo calculó que ejecutar ReProAgent cuesta aproximadamente $0.14 por caso. Esto es ligeramente más caro que algunos métodos más simples (que cuestan alrededor de $0.11), pero el artículo argumenta que vale la pena el gasto extra de unos pocos centavos porque realmente resuelve el problema con mucha más frecuencia. La mayoría de las veces, el sistema solo necesitó ejecutar su "operación encubierta" unas 1.29 veces en promedio antes de lograrlo correctamente.

La Conclusión

El artículo sugiere que para resolver misterios complejos de software, no puedes confiar solo en una suposición rápida basada en unas pocas palabras. Necesitas una investigación estructurada de múltiples etapas que observe el panorama completo, rastree la ruta del error y verifique la evidencia. ReProAgent demuestra que cuando les das a los agentes de IA un flujo de trabajo adecuado para seguir, pueden volverse increíblemente efectivos para encontrar y probar errores de software, convirtiendo una nota de testigo borrosa en un expediente de caso cristalino.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →