← Últimos artículos
💻 computer science

SWE-QA: Can Language Models Answer Repository-level Code Questions?

Este artículo presenta SWE-QA, un conjunto de referencia para la respuesta a preguntas sobre código a nivel de repositorio derivado de 77.100 problemas de GitHub que aborda las limitaciones de los conjuntos de datos basados en fragmentos existentes al evaluar los modelos de lenguaje grandes en tareas de razonamiento complejas y multiarchivo mediante un conjunto curado de 576 preguntas y un marco de trabajo agente asociado.

Autores originales: Weihan Peng, Yuling Shi, Yuhang Wang, Xinyun Zhang, Beijun Shen, Xiaodong Gu

Publicado 2026-04-28
📖 4 min de lectura☕ Lectura para el café

Autores originales: Weihan Peng, Yuling Shi, Yuhang Wang, Xinyun Zhang, Beijun Shen, Xiaodong Gu

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando entender cómo funciona una biblioteca masiva de 10 pisos.

El Problema: La Trampa del "Fragmento"
Hasta ahora, la mayoría de las pruebas para los "cerebros de código" de la IA han sido como mostrarles una sola página aislada de un libro y preguntarles: "¿Qué significa esta oración?". Aunque la IA podría acertar, el software del mundo real no son páginas sueltas. Es toda la biblioteca. Para responder a una pregunta como: "¿Por qué se bloquea automáticamente la puerta principal cuando se pone el sol?", necesitas caminar por el sótano, revisar el cableado en el ático y leer los planos en la oficina del gerente. Tienes que conectar puntos a través de muchos archivos diferentes.

Las pruebas anteriores de IA fallaron porque no obligaban a la IA a realizar este "paseo por la biblioteca". Solo probaban si la IA podía leer una sola página.

La Solución: SWE-QA (El Recorrido por la Biblioteca)
Los autores de este artículo construyeron una nueva prueba llamada SWE-QA. Piénsalo como un examen riguroso de "recorrido por la biblioteca" para la IA.

  • El Material de Fuente: No solo inventaron preguntas. Entraron en 15 "bibliotecas" de software reales y populares (repositorios de GitHub) y examinaron 77.000 preguntas reales que los desarrolladores humanos se hacían entre sí.
  • La Taxonomía (El Mapa): Organizaron estas preguntas en un mapa. Preguntaron: ¿Estamos preguntando qué es esto? ¿Por qué se construyó de esta manera? ¿Dónde se esconde el código? o ¿Cómo funciona?
  • La Construcción: Crearon 720 preguntas de alta calidad. Para responderlas, la IA no puede solo adivinar. Tiene que:
    1. Encontrar el archivo correcto (como encontrar el estante adecuado).
    2. Leer el código en ese archivo.
    3. Saltar a un archivo diferente para ver cómo se conectan (razonamiento de múltiples saltos).
    4. Sintetizar una respuesta que explique todo el sistema.

El Experimento: Probando a los Bibliotecarios de IA
Los investigadores tomaron seis de los modelos de IA más inteligentes disponibles (como GPT-5.1, Gemini y otros) y les dieron este examen de "recorrido por la biblioteca". Los probaron de tres maneras diferentes:

  1. El "Memorizador" (Prompting Directo): Simplemente le hicieron la pregunta a la IA sin darle los libros de la biblioteca.
    • Resultado: La IA falló miserablemente. Fue como pedirle a alguien que describa una biblioteca que nunca ha visitado.
  2. El "Buscador de Índices" (RAG): Le dieron a la IA una herramienta para buscar páginas relevantes antes de responder.
    • Resultado: ¡Mucho mejor! La IA podía encontrar las páginas correctas, pero a veces se perdía las conexiones entre ellas.
  3. El "Agente Detective" (Frameworks de Agentes): Le dieron a la IA un "kit de detective" (herramientas como OpenHands) que le permitía pensar, buscar, leer, buscar de nuevo y conectar los puntos por sí misma.
    • Resultado: Este fue el ganador. La IA que actuó como un detective, explorando activamente la base de código, obtuvo las puntuaciones más altas (alrededor de 70 sobre 100).

Los Hallazgos: Lo que la IA Puede y No Puede Hacer

  • La Buena Noticia: La IA se está volviendo muy buena explicando por qué se construyen las cosas de cierta manera (Racionalidad de Diseño) o cómo funciona una característica específica, especialmente si la explicación está escrita claramente en los comentarios del código.
  • La Mala Noticia: La IA todavía lucha con las preguntas de "Dónde" (encontrar exactamente dónde se define una variable específica a través de 10 archivos) y las preguntas complejas de "Qué" que requieren rastrear una larga cadena de dependencias. Es como si la IA pudiera entender la historia de la biblioteca, pero a veces se pierde intentando encontrar la llave específica de la puerta trasera.
  • El Costo: El enfoque de "Detective" funciona mejor, pero es costoso. Utiliza 100 veces más potencia de computación (tokens) que simplemente adivinar. Es la diferencia entre una mirada rápida y una investigación forense completa.

La Conclusión
Este artículo introduce una nueva prueba, más difícil y más realista para la IA. Muestra que, aunque la IA es prometedora para entender el software, aún necesita ayuda para navegar la naturaleza compleja e interconectada del código del mundo real. Los mejores resultados provienen de agentes de IA que pueden "caminar" activamente a través de los archivos de código en lugar de solo leer un fragmento.

En resumen: Construimos una prueba más difícil para ver si la IA puede realmente entender un proyecto de software completo, no solo un pequeño trozo de él. La IA está mejorando, pero aún necesita un buen mapa y una mentalidad de detective para resolver los acertijos más difíciles.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →