← Últimos artículos
🤖 AI

A Unified Issue Resolution Benchmark for Requirement Clarification, Planning, and Code Generation for Coding Agents

Este artículo presenta SWE-RPG, un benchmark unificado para agentes de codificación que evalúa no solo el éxito del parche final, sino también los pasos de razonamiento intermedio como la aclaración de requisitos y la planificación de la implementación, revelando que la recuperación implícita de requisitos es el principal cuello de botella que limita el rendimiento de los agentes actuales en tareas a nivel de repositorio.

Autores originales: Xin Zhou, Chun Yong Chong, Kisub Kim, Yun Peng, Rui Shu, Zihan Wu, Xu Han, Guowen Yuan, Zeyang Zhuang, Jounghoon Kim, Jeongjin Ju, Seongmin Ju, Taein Yoon, David Lo

Publicado 2026-08-11
📖 3 min de lectura☕ Lectura para el café

Autores originales: Xin Zhou, Chun Yong Chong, Kisub Kim, Yun Peng, Rui Shu, Zihan Wu, Xu Han, Guowen Yuan, Zeyang Zhuang, Jounghoon Kim, Jeongjin Ju, Seongmin Ju, Taein Yoon, David Lo

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina un mundo donde tienes un asistente robótico súper inteligente que puede escribir código de computadora. Le das una instrucción simple como: "Corrige el error en este juego" o "Añade un nuevo nivel", y se pone a trabajar. Este es el sueño de los agentes de codificación de IA. Durante mucho tiempo, los científicos han estado probando estos robots dándoles una tarea y viendo si el resultado final funciona. Si el juego se ejecuta sin cerrarse inesperadamente, el robot recibe una estrella dorada. Si el juego falla, el robot recibe una X roja.

Pero aquí está el problema: una X roja no te dice por qué el robot falló. ¿Malinterpretó tus instrucciones? ¿Se le ocurrió un mal plan? ¿O simplemente escribió el código incorrecto? Es como un estudiante que reprueba un examen de matemáticas y solo recibe una calificación de "0/10" sin ver las notas del profesor sobre dónde se equivocó. Para hacer que estos robots sean realmente mejores, necesitamos ver su proceso de pensamiento, no solo la respuesta final. Esta es la gran pregunta que aborda el artículo: ¿Cómo dejamos de solo calificar el parche final y empezamos a diagnosticar el cerebro del robot?

Entra en escena SWE-RPG, una prueba nueva y súper detallada diseñada para mirar dentro de la mente del robot. Los investigadores construyeron un benchmark (una prueba estandarizada) utilizando 163 tareas de codificación del mundo real de 31 proyectos de software diferentes. En lugar de solo verificar si el código funciona al final, crearon referencias de "Verdad de Oro" (Gold Truth) para cada uno de los pasos del viaje del robot. Piensa en ello como tener el libro de recetas de un maestro chef que no solo muestra el plato final, sino que también enumera cada ingrediente oculto que el chef tuvo que adivinar, cada paso del plan de cocina y el momento exacto en que el robot podría haberse desviado del camino.

Los investigadores sometieron a prueba a tres agentes de codificación populares (llamados Claude Code, Codex y OpenCode), combinándolos con seis modelos de "cerebro" (LLM) diferentes. Los resultados fueron un golpe de realidad. Incluso los mejores robots solo resolvieron aproximadamente el 31.5% de las tareas. ¡Eso significa que fallaron casi dos tercios de las veces! Pero la verdadera magia de SWE-RPG fue descubrir dónde fallaron. El estudio encontró que el mayor cuello de botella no era en realidad escribir el código; era comprender las reglas ocultas. Entre el 24.5% y el 46.0% de los fallos ocurrieron porque los robots no pudieron descifrar los "requisitos implícitos": las cosas que no dijiste pero que el robot necesitaba saber para hacer bien el trabajo.

Por ejemplo, si le pidieras a un robot que "corrija la importación de TSV", podría corregir el código pero accidentalmente romper la importación de CSV porque no se dio cuenta de que ambos estaban relacionados. El estudio sugiere que, para que estos agentes sean realmente útiles, debemos dejar de enfocarnos solo en hacer que escriban código más rápido y empezar a enseñarles a ser mejores detectives, capaces de leer entre líneas en la petición de un usuario. El artículo concluye que, si bien estos agentes son impresionantes, todavía luchan con el lado desordenado y humano del desarrollo de software, y SWE-RPG es el nuevo mapa que necesitamos para ayudarlos a navegar por esos complicados requisitos ocultos.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →