Comparing AI Coding Agents: A Task-Stratified Analysis of Pull Request Acceptance
Este estudio empírico analiza 7.156 solicitudes de extracción para revelar que, aunque Devin muestra una tendencia temporal positiva única en la aceptación, el tipo de tarea es el factor dominante que influye en las tasas de éxito, con OpenAI Codex demostrando el rendimiento alto más consistente a través de diversas categorías, a pesar de que ningún agente individual sobresale en todos los tipos de tarea.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que eres el gerente de una obra de construcción muy concurrida. En lugar de trabajadores humanos, tienes cinco robots de IA diferentes (OpenAI Codex, GitHub Copilot, Devin, Cursor y Claude Code) que pueden escribir código, corregir errores y redactar documentación. Tu objetivo es ver qué robot es el mejor para obtener la aprobación de los inspectores de la obra (la "Tasa de Aceptación de Solicitudes de Extracción").
Este artículo es como un boletín de calificaciones detallado que compara estos cinco robots durante varios meses. Aquí está lo que descubrieron, explicado de forma sencilla:
1. El "Tipo de Trabajo" Importa Más Que el Robot
La mayor sorpresa no fue qué robot era el más rápido, sino qué tipo de trabajo estaban realizando.
- La Analogía: Imagina pedirle a un robot que "escriba un poema" en lugar de "construir un puente". Escribir un poema suele ser más fácil de aprobar que construir un puente.
- El Hallazgo: El artículo encontró que el tipo de tarea es el factor más importante.
- Cuando se pidió a los robots que hicieran documentación (como escribir manuales o comentarios), fueron aprobados el 82% de las veces.
- Cuando se les pidió construir nuevas funciones (como añadir una nueva habitación a una casa), solo fueron aprobados el 66% de las veces.
- La Lección: Si juzgas a un robot solo por su puntuación general, podrías ser engañado. Un robot que principalmente realiza tareas fáciles de "escribir poemas" parecerá una superestrella, incluso si es terrible en "construir puentes".
2. Ningún Robot Solo Gana en Todas las Categorías
No hay un "mejor robot" para todo. Cada uno tiene una superpoder específico.
- OpenAI Codex: Este es el todo terreno confiable. Rindió consistentemente bien en casi todo tipo de trabajo, sin bajar nunca de una puntuación decente.
- Claude Code: Este es el Especialista en Documentación. Fue el mejor escribiendo manuales y creando nuevas funciones, pero debemos tener cuidado porque no realizó muchas otras tareas en este estudio.
- Cursor: Este es el Corregidor de Errores. Cuando se trataba de arreglar cosas rotas, fue el mejor rendimiento.
- Devin: Este robot comenzó lento pero mejoró con el tiempo. Fue el único que mostró una tendencia clara de mejora semana tras semana, subiendo de una aprobación de aproximadamente el 60% al 80%.
3. El Tiempo Cambia las Cosas (Pero No Para Todos)
Los investigadores observaron a estos robots durante meses para ver si aprendían o mejoraban.
- La Analogía: Piensa en ello como un estudiante que realiza un examen cada semana.
- Devin es como el estudiante que estudia duro y sigue obteniendo puntuaciones más altas cada semana.
- Los demás son como estudiantes que ya son inteligentes; comienzan altos y se mantienen altos, pero no muestran mucha mejora con el tiempo. Simplemente se mantienen consistentes.
4. Por Qué la "Puntuación Global" es Engañosa
El artículo advierte contra mirar una sola "puntuación promedio" para un robot.
- La Analogía: Imagina dos chefs. El Chef A solo cocina ensaladas simples (que a todos les encantan). El Chef B solo cocina guisos complejos y picantes (que son más difíciles de hacer bien). Si solo miras la "puntuación promedio de los clientes", el Chef A podría parecer mejor. Pero eso no significa que el Chef A sea un chef mejor; solo significa que se le dieron ingredientes más fáciles.
- El Hallazgo: Los investigadores tuvieron que separar a los robots por el tipo de trabajo que hacían para obtener una comparación justa. Una vez que lo hicieron, descubrieron que el robot "mejor" cambiaba dependiendo de si el trabajo era corregir un error, escribir una prueba o actualizar un documento.
Resumen
Si quieres contratar un asistente de codificación con IA, no preguntes solo: "¿Quién es el mejor?".
- Si necesitas corrección de errores, mira a Cursor o OpenAI Codex.
- Si necesitas nuevas funciones o documentación, Claude Code o OpenAI Codex podrían ser tu mejor opción.
- Si quieres un robot que parezca estar aprendiendo y mejorando con el tiempo, Devin es el que debes vigilar.
La conclusión principal es que el contexto es el rey. No puedes juzgar una herramienta sin saber exactamente qué trabajo se le está pidiendo hacer.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.