← Últimos artículos
🤖 AI

Where Do AI Coding Agents Fail? An Empirical Study of Failed Agentic Pull Requests in GitHub

Este artículo presenta un estudio empírico a gran escala de 33.000 pull requests generados por IA en GitHub, combinando el análisis cuantitativo y la taxonomía cualitativa para revelar que, si bien las tareas de documentación y de integración continua (CI) tienen más éxito, los fallos agénticos están impulsados por factores como cambios de código extensos, fallos de CI y la falta de alineación con las expectativas del revisor humano.

Autores originales: Ramtin Ehsani, Sakshi Pathak, Shriya Rawal, Abdullah Al Mujahid, Mia Mohammad Imran, Preetha Chatterjee

Publicado 2026-01-22
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Ramtin Ehsani, Sakshi Pathak, Shriya Rawal, Abdullah Al Mujahid, Mia Mohammad Imran, Preetha Chatterjee

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina un bullicioso sitio de construcción donde arquitectos e ingenieros humanos están construyendo software. Recientemente, ha llegado una nueva cuadrilla de robots de IA (llamados "agentes de codificación"). Estos robots no solo susurran sugerencias a los humanos; ahora están construyendo habitaciones enteras, pintando paredes e incluso presentando sus propios planos (llamados "Pull Requests" o PRs) para ser añadidos al edificio.

El artículo que proporcionaste es como una investigación forense sobre por qué algunas habitaciones construidas por robots son aprobadas y añadidas al edificio, mientras que otras son rechazadas y demolidas. Los investigadores analizaron más de 33,000 planos presentados por cinco diferentes cuadrillas de robots en GitHub para descubrir dónde se están equivocando los robots.

Aquí está el desglose de sus hallazgos, utilizando analogías simples:

1. Las "Victorias Fáciles" vs. Los "Esfuerzos Difíciles"

Los investigadores descubrieron que los robots son excelentes realizando tareas rutinarias y sencillas, pero tienen dificultades con las tareas complejas y de alto riesgo.

  • El Superpoder de los Robots: Son como expertos jardineros cuando se trata de documentación, arreglar el horario de construcción (CI/Build) y actualizar las reglas. Estas tareas se aprueban aproximadamente el 80-90% de las veces. Es como si los robots fueran perfectamente capaces de barrer el suelo o repintar la cerca.
  • La Debilidad de los Robots: Son terribles para arreglar motores averiados (corrección de errores/bug fixes) o hacer que el edificio funcione más rápido (rendimiento/performance). Estas tareas son las que se rechazan con mayor frecuencia. Es como si los robots intentaran arreglar una tubería con fuga pero terminan inundando el sótano.

2. El Problema de "Demasiado Grande para Manejar"

Cuando un robot presenta un plano que es rechazado, a menudo es porque intentó hacer demasiadas cosas a la vez.

  • La Analogía: Imagina que le pides a un robot que "arregle la cocina". Si regresa con un plan para reconstruir toda la casa, mover los cimientos y rediseñar el techo, el arquitecto humano dirá: "De ninguna manera, eso es demasiado".
  • El Hallazgo: Los planos rechazados involucraban más líneas de código y afectaban a más archivos que los aceptados. Los robots tienden a ser "sobreentusiastas" y realizan cambios masivos que abruman a los revisores humanos.

3. La Alarma del "Test Roto"

Antes de que un arquitecto humano vea un plano, el sistema de seguridad automatizado del edificio realiza una verificación.

  • El Hallazgo: Los planos rechazados frecuentemente fallaban estas verificaciones de seguridad automatizadas (construcciones CI). Es como si el robot presentara un plan que no pasó la inspección de seguridad contra incendios. Si el código del robot rompe las pruebas, los humanos generalmente ni siquiera se molestan en mirarlo de cerca.

4. ¿Por qué dicen "No" los humanos? (Las 4 Razones)

Los investigadores profundizaron en 600 planos rechazados para descubrir por qué los humanos dijeron que no. Encontraron cuatro razones principales, ordenadas de la más común a la menos común:

  • Razón #1: El "Pueblo Fantasma" (38%)

    • Qué pasó: El robot presentó un plano, y ningún humano lo miró nunca. Los humanos estaban demasiado ocupados, o el robot fue ignorado, y la solicitud simplemente se quedó ahí hasta que se cerró automáticamente.
    • Analogía: El robot dejó una nota en el escritorio del arquitecto, pero el arquitecto estaba de vacaciones y la nota terminó siendo tirada a la basura.
  • Razón #2: La "Doble Reserva" (31%)

    • Qué pasó: El robot intentó arreglar un problema que alguien más ya había arreglado en un plano diferente.
    • Analogía: El robot presentó un plan para construir un nuevo puente, sin darse cuenta de que otro equipo ya había comenzado a construir ese mismo puente ayer.
  • Razón #3: El "Plano Roto" (22%)

    • Qué pasó: El código en sí estaba roto, falló las pruebas o no resolvió realmente el problema.
    • Analogía: El robot construyó una puerta, pero la puerta no abre, o está hecha de un vidrio que se hace añicos cuando lo tocas.
  • Razón #4: Las "Instrucciones Incorrectas" (2%)

    • Qué pasó: El robot ignoró lo que el humano pidió o violó reglas legales (como derechos de autor).
    • Analogía: El humano le pidió al robot que "pintara la pared de azul", pero el robot la pintó de rojo y usó una pintura que el seguro del edificio no permite.

La Gran Conclusión

El artículo concluye que, si bien estos robots de IA están mejorando en la escritura de código, todavía son malos leyendo el ambiente.

No saben cuándo detenerse (hacen cambios demasiado grandes), no saben qué se ha hecho ya (duplican el trabajo) y luchan por seguir instrucciones humanas complejas. Para que estos robots tengan éxito en el futuro, necesitan aprender a ser más pequeños, más enfocados y mejores en verificar si su trabajo es realmente necesario antes de pedir permiso a los humanos para construir.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →