SWE-INTERACT: Reimagining SWE Benchmarks as User-Driven Long-Horizon Coding Sessions
El artículo presenta SWE-Interact, un nuevo referente que evalúa a los agentes de programación en tareas de ingeniería de software realistas, de múltiples turnos y dirigidas por el usuario, revelando que un alto rendimiento en los referentes tradicionales de un solo turno no se traduce de manera fiable en los flujos de trabajo interactivos e iterativos requeridos para el desarrollo efectivo en el mundo real.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que estás contratando a un arquitecto brillante pero sin experiencia para construir una casa.
La vieja forma (Benchmarks tradicionales)
En el pasado, los investigadores probaban a estos "arquitectos" de IA entregándoles un plano completo de 50 páginas desde el primer día. El plano detallaba cada detalle: el tipo de madera, el tono exacto de la pintura, la ubicación de cada toma de corriente y la marca del grifo. El trabajo de la IA era simplemente leer el plan y construir la casa perfectamente.
- El problema: Esto no refleja cómo funciona la construcción en el mundo real. En el mundo real, los clientes rara vez tienen un plano perfecto listo. Normalmente dicen: "Quiero una casa acogedora con una cocina grande", y luego cambian de opinión a medida que ven el progreso.
La nueva forma (SWE-INTERACT)
El artículo presenta SWE-INTERACT, una nueva prueba que simula un proyecto de construcción de la vida real.
- La configuración: En lugar de un plano perfecto, la IA comienza con una petición vaga: "Constrúyeme una casa".
- El cliente (El simulador): Un programa informático actúa como el "cliente". No se queda simplemente sentado; camina activamente por la obra.
- Mira los cimientos y dice: "Oye, no me había dado cuenta de que quería un sótano".
- Mira la cocina y dice: "En realidad, quiero la estufa aquí, no allá".
- Revisa el cableado y dice: "Espera, necesito más enchufes".
- El objetivo: La IA tiene que descubrir lo que el cliente realmente quiere escuchando sus comentarios evolutivos, corrigiendo sus errores y construyendo la casa pieza por pieza, todo mientras el cliente sigue añadiendo nuevos requisitos.
El gran descubrimiento
Los investigadores probaron los modelos de codificación de IA más inteligentes del mundo en ambos escenarios. He aquí lo que descubrieron:
- Buenos leyendo, malos escuchando: Los modelos que eran excelentes construyendo casas a partir de planos perfectos (la prueba de "un solo turno") tuvieron dificultades significativas cuando el cliente cambiaba de opinión constantemente. Su tasa de éxito cayó de aproximadamente un 50% a un 25%.
- El error de la "excesiva confianza": Los mejores modelos (como GPT-5.5 y Opus 4.8) fueron lo suficientemente valientes como para empezar a construir incluso con instrucciones vagas. Podían recuperarse y arreglar las cosas cuando el cliente los corregía. Sin embargo, a menudo olvidaban instrucciones anteriores o cometían errores técnicos al intentar ser demasiado ingeniosos.
- El error de "rendirse": Los modelos más débiles se confundían ante el inicio vago, se rendían demasiado pronto o ignoraban por completo las nuevas instrucciones del cliente.
Por qué esto es importante
Piénsalo como un videojuego. Las pruebas antiguas eran como un nivel donde sabes exactamente dónde están los enemigos y cómo es el jefe. La nueva prueba es como un juego de rol en vivo donde el "Director de Juego" (el cliente) cambia la historia a medida que juegas.
El artículo concluye que ser un buen programador no es solo saber escribir código (el plano); es tener la paciencia y la habilidad para trabajar con un humano que no sabe exactamente lo que quiere hasta que lo ve. Los modelos de IA actuales están mejorando en esto, pero aún les queda un largo camino por recorrer antes de que puedan reemplazar verdaderamente a un desarrollador humano en un entorno real, desordenado y colaborativo.
En resumen: El artículo construyó un nuevo "gimnasio" para entrenar a los programadores de IA no solo para seguir órdenes, sino para colaborar realmente con humanos que están descubriendo las cosas sobre la marcha.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.