Agent Retrieval Bench: Evaluating Repository Context Retrieval for Coding Agents
Este artículo presenta Agent Retrieval Bench, un benchmark exhaustivo a nivel de archivo para evaluar la recuperación de contexto en agentes de codificación utilizando señales de flujo de trabajo reales, el cual revela que ningún método de recuperación individual predomina en diversas tareas y destaca brechas significativas en la capacidad de los agentes actuales para identificar los archivos necesarios del repositorio.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que eres un detective intentando resolver un misterio en una biblioteca enorme y caótica. Tienes una pista —una página rasgada, un susurro o un ruido extraño— pero para resolver el caso, primero necesitas encontrar el libro adecuado en el estante. En el mundo de la informática, esta "biblioteca" es el código de un proyecto de software, y los "detectives" son agentes de IA diseñados para escribir y reparar código. Durante mucho tiempo, la hemos juzgado principalmente por si finalmente escribía la solución perfecta. Pero este artículo argumenta que, antes de que una IA pueda siquiera pensar en escribir una solución, tiene que jugar con éxito a un juego de "¿Dónde está Waldo?" dentro del código. Si agarra el libro equivocado, nunca resolverá el misterio, sin importar lo inteligente que sea su razonamiento. Este nuevo estudio, llamado Agent Retrieval Bench, es una prueba gigante diseñada específicamente para ver qué tan buenos son estos detectives de IA encontrando los archivos correctos en un repositorio antes de empezar a teclear.
Los investigadores construyeron un campo de pruebas riguroso utilizando 427 escenarios de codificación del mundo real extraídos de 25 proyectos de software diferentes. Crearon cinco tipos distintos de "pistas" para ver cómo reacciona la IA. A veces la pista es la descripción de una nueva funcionalidad (pidiendo a la IA que encuentre las pruebas relacionadas); a veces es el comentario de un revisor sobre un archivo específico (pidiendo a la IA que encuentre otros archivos necesarios para entender dicho comentario); a veces es un informe de error o caída (pidiendo a la IA que encuentre el código de la causa raíz); y a veces es un pequeño cambio (pidiendo a la IA que encuentre todos los demás archivos que podrían romperse debido a él). Incluso hubo un grupo de pistas complicadas donde la respuesta no estaba en la biblioteca en absoluto, probando si la IA sabía decir: "No puedo encontrar esto aquí".
Los resultados fueron un poco impactantes para la idea de que "más grande es siempre mejor" o que un tipo de herramienta de búsqueda gana siempre. El estudio encontró que ningún método es el campeón indiscutible. Es como intentar encontrar una aguja en un pajar: a veces un imán (búsqueda semántica, que busca el significado) funciona mejor; otras veces, un mapa del diseño de la biblioteca (búsqueda estructural, que observa cómo se conectan los archivos) es la única forma de encontrar la aguja. De hecho, la "mejor" herramienta cambiaba dependiendo del tipo específico de pista y de cuánto "espacio de lectura" (presupuesto de contexto) tenía la IA.
Uno de los descubrimientos más interesantes fue que, incluso cuando se les permite a los detectives de IA pedir más ayuda y explorar de forma interactiva, todavía fallan en encontrar los archivos correctos en aproximadamente entre el 27% y el 35% de los casos. Resulta que solo porque una IA pueda buscar, no significa que sepa dónde buscar. El artículo también mostró que si le das a la IA una "pista" (una lista de archivos preseleccionados) basada en una búsqueda inteligente, resuelve los problemas más rápido y con menos esfuerzo desperdiciado que si simplemente le lanzas archivos al azar. Sin embargo, el estudio también descartó una idea esperanzadora: las puntuaciones de confianza simples no son suficientes para decirle a la IA cuándo dejar de buscar y admitir: "Esto no está en esta biblioteca".
En última instancia, el artículo sugiere que construir una IA de codificación verdaderamente útil no consiste en encontrar un motor de búsqueda mágico. En cambio, se trata de mezclar diferentes estrategias —como usar tanto un mapa semántico como un mapa estructural juntos— para asegurar que la IA encuentre el contexto adecuado antes de intentar reparar el código. Los autores señalan cuidadosamente que, si bien esto ayuda a la IA a encontrar los archivos correctos, no garantiza que la IA escribirá la solución perfecta, pero sin encontrar los archivos correctos, una solución es imposible.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.