SWE-Together: Evaluating Coding Agents in Interactive User Sessions
Este artículo presenta SWE-Together, un benchmark de múltiples turnos derivado de sesiones de codificación reales entre usuario y agente que utiliza un simulador de usuario reactivo basado en LLM para evaluar agentes de codificación tanto en función de la corrección final del repositorio como del número de turnos de retroalimentación correctiva requeridos, revelando que los agentes más fuertes logran mayores tasas de éxito con menos intervenciones.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que estás contratando a un nuevo ingeniero de software. En el pasado, para ponerlo a prueba, le entregabas un manual de instrucciones de 10 páginas perfectamente escrito y le decías: "Construye esta función". Esperabas a que terminara, revisabas el código final y le dabas una calificación. Si el código funcionaba, obtenía una A. Si no funcionaba, obtenía una F.
El Problema: La vida real no es así. En un trabajo real, no tienes un manual perfecto. Empiezas con una idea vaga, el ingeniero construye algo, te das cuenta de que olvidaste mencionar un detalle crucial, corriges un error que cometió y aclaras tu objetivo a mitad del proceso. Las pruebas antiguas no medían qué tan bien un ingeniero maneja esta conversación desordenada de ida y vuelta. Solo medían el producto final, ignorando cuánto acompañamiento necesitó el ingeniero para llegar allí.
La Solución: SWE-Together
Los autores de este artículo crearon un nuevo campo de pruebas llamado SWE-Together. Piensa en esto como un "videojuego reproducible" para agentes de codificación (programadores de IA).
Así es como funciona, desglosado en partes simples:
1. El Material de Origen: Metraje de la Vida Real
En lugar de inventar preguntas de examen falsas, los investigadores fueron a pescar al mundo real. Buscaron en 11,260 conversaciones reales entre humanos y asistentes de codificación de IA. De este enorme montón, seleccionaron cuidadosamente 109 tareas específicas que eran perfectas para una prueba.
- El Filtro: Desecharon las conversaciones que eran demasiado desordenadas, que no tenían un objetivo claro o que no podían reproducirse. Conservaron solo aquellas donde el humano tenía un objetivo claro, la IA realizaba un trabajo real y el resultado podía ser verificado.
2. El Simulador de "Usuario Robot"
Esta es la parte más ingeniosa. Para probar una nueva IA, no pueden simplemente reproducir los mensajes del humano original, porque la nueva IA podría tomar un camino diferente. Si la nueva IA comete un error distinto, el siguiente mensaje del humano original podría no tener sentido.
Por eso, construyeron un Usuario Robot Inteligente.
- Cómo funciona: Imagina a un director viendo una obra de teatro. El director sabe exactamente lo que el humano original quería lograr. Mientras el nuevo actor de IA actúa, el Usuario Robot observa. Si la IA se desvía del camino o pierde un punto que el humano original habría notado, el Usuario Robot interviene y dice: "Espera, en realidad quería X", o "Olvidaste Y".
- El Objetivo: El Usuario Robot actúa exactamente como lo habría hecho el humano original, pero adapta su ritmo al desempeño de la nueva IA. Esto asegura que cada IA sea probada contra el mismo "intento", incluso si toman rutas diferentes.
3. La Nueva Ficha de Calificación
En las pruebas antiguas, solo obtenías una puntuación: ¿Funcionó el código?
En SWE-Together, utilizan una ficha de calificación de dos partes:
- Parte A: La Calificación Final (Corrección): ¿Logró la IA construir finalmente lo que se le pidió?
- Parte B: La Puntuación de "Acompañamiento" (Corrección del Usuario): Esta es la gran innovación. Cuentan cuántas veces el Usuario Robot tuvo que corregir a la IA.
- Analogía: Imagina a dos estudiantes tomando un examen de matemáticas. Ambos obtienen la respuesta correcta.
- El Estudiante A lo resolvió por su cuenta.
- El Estudiante B obtuvo la respuesta correcta, pero solo después de que el profesor tuvo que guiarlo tres veces y corregir un error importante.
- En SWE-Together, el Estudiante A obtiene una mejor puntuación porque requirió menos intervención. El artículo llama a esto "Corrección del Usuario".
- Analogía: Imagina a dos estudiantes tomando un examen de matemáticas. Ambos obtienen la respuesta correcta.
Lo Que Encontraron
Los investigadores probaron siete de los modelos de IA más inteligentes disponibles. Esto fue lo que sucedió:
- La IA más inteligente necesita menos ayuda: Hubo un patrón claro. Los modelos de IA "más inteligentes" (como Claude Opus 4.8) obtuvieron puntuaciones finales más altas y requirieron menos correcciones del Usuario Robot. Los modelos "más débiles" obtuvieron puntuaciones más bajas y necesitaron que el Usuario Robot los guiara y corrigiera constantemente.
- El Usuario Robot es convincente: Probaron si los humanos podían notar la diferencia entre el Usuario Robot y un humano real. No pudieron. La simulación era tan buena que los humanos no pudieron distinguirlos de manera confiable.
{% %} 3. Eficiencia: Algunos modelos fueron más rápidos y utilizaron menos "tokens" (palabras/capacidad de cómputo) para completar la tarea, mientras que otros fueron más lentos pero más precisos.
La Conclusión
El artículo argumenta que debemos dejar de probar a los codificadores de IA como si estuvieran tomando un examen escrito con una clave de respuestas perfecta. Necesitamos probarlos como si estuvieran trabajando en una oficina real.
SWE-Together demuestra que los mejores agentes de codificación no son solo aquellos que eventualmente pueden arreglar el código; son aquellos que pueden escuchar, entender instrucciones vagas y corregir sus propios errores sin necesidad de que un humano intervenga constantemente para decir: "No, eso no es lo que quería decir".
En resumen: Es un benchmark que recompensa a la IA por ser un buen colaborador, no solo un buen generador de código.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.