← Últimos artículos
💻 computer science

Do These Violent Delights Have Violent Ends? Measuring the Post-Merge Fate of Agentic Code

Este estudio longitudinal de 182 repositorios revela que, si bien las contribuciones de código agénticas alcanzan tasas de fusión comparables a las del código humano, posteriormente incurren en cargas de mantenimiento correctivo significativamente mayores e introducen más vulnerabilidades de seguridad, particularmente en proyectos con bajas tasas de revisión.

Autores originales: Chunqiu Steven Xia, Courtney Miller

Publicado 2026-07-14✓ Author reviewed
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Chunqiu Steven Xia, Courtney Miller

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que acabas de contratar una flota de asistentes robóticos superrápidos e incansables para ayudarte a construir una ciudad masiva y extensa de código. Estos robots, impulsados por la última IA "agéntica", pueden crear vecindarios enteros de software en un abrir y cerrar de ojos. Los gigantes tecnológicos están celebrando, diciendo que los robots están escribiendo del 30% al 75% del código en sus ciudades. Las métricas se ven increíbles: los robots están produciendo solicitudes de extracción (permisos de construcción) más rápido de lo que nadie puede contar, y la mayoría de ellas son aprobadas e integradas en el plan de la ciudad.

Pero aquí está el giro: ¿Qué pasa después de que se firma el permiso y el edificio pasa a ser oficialmente parte de la ciudad?

Eso es exactamente lo que este estudio investigó. En lugar de solo contar cuántos edificios construyeron los robots, los investigadores siguieron el código durante un año completo (de mayo de 2025 a mayo de 2026) a través de 182 proyectos del mundo real. Rastrearon cada línea de código como un detective siguiendo a un sospechoso, preguntándose: ¿Esta línea sobrevive, o es demolida y reconstruida? ¿Quién la arregla cuando se rompe? ¿Y esconde trampas peligrosas?

La gran sorpresa: No se trata de "cuánto", sino de "qué tan mal"

Podrías esperar que el código construido por robots fuera un desastre total, desmoronándose inmediatamente. O podrías pensar que es perfecto. La verdad es un poco más sutil.

El estudio encontró que, en general, el código de los robots no se "demuele" (termina) a una tasa significativamente diferente que el código humano. Si solo miras los números brutos de cuánto tiempo dura una pieza de código, los robots y los humanos parecen estar en igualdad de condiciones.

Sin embargo, una vez que miras más de cerca por qué ese código es modificado, la imagen cambia drásticamente.

  • El imán de "corrección de errores": El código de los robots es un imán para las correcciones. El estudio encontró que el código agéntico recibe un 46% más de mantenimiento correctivo (arreglar cosas que están rotas) que el código humano.
  • Los detalles de la "corrección de errores": Específicamente, el código de los robots recibe un 45% más de correcciones de errores (bug fixes). Aunque el código humano también recibe muchas correcciones, los robots parecen estar introduciendo más de ellas.
  • El factor "trampa": El código de los robots también tiene más probabilidades de introducir debilidades de seguridad y dependencias peligrosas. El estudio midió esto usando herramientas como Semgrep y OSV-Scanner. El código de los robots introdujo hallazgos de seguridad a una tasa de 1.14 veces la del código humano, y hallazgos de alta severidad (realmente malos) a una tasa de 1.51 veces la del código humano.

Piénsalo de esta manera: Los robots son buenos construyendo las paredes, pero a menudo olvidan instalar las alarmas contra incendios o usan pintura inflamable. El edificio se mantiene en pie, pero necesita muchas más inspecciones de seguridad contra incendios y reparaciones más tarde.

La zona de peligro del "Sin Revisión"

Uno de los hallazgos más críticos tiene que ver con cómo se aprueba el código. Los investigadores observaron qué sucede cuando los proyectos integran código sin que un humano lo revise primero.

Encontraron un vínculo directo: Cuanto más código integra un proyecto sin revisión humana, más pesada se vuelve la carga de mantenimiento.

  • Específicamente, por cada incremento de 10 puntos porcentuales en la "tasa de no revisión" de un proyecto, la carga de mantenimiento del código agéntico aumenta aproximadamente un 6%.

Esto sugiere que los robots no solo están cometiendo errores; están cometiendo errores que solo un revisor humano habría detectado. Cuando te saltas la revisión, estás dejando que los robots corran libres, y la factura por arreglar sus errores llega después.

El problema de la "Asimetría de Velocidad"

El artículo argumenta que hemos creado un desequilibrio peligroso, que llaman una "asimetría de generación-revisión".

  • Generación (Escritura): Los robots pueden escribir código infinitamente rápido, sin estar limitados por la fatiga humana.
  • Revisión (Verificación): Los humanos siguen siendo quienes verifican el trabajo. Se cansan, se ocupan y solo pueden leer a cierta velocidad.

El estudio sugiere que intentar solucionar esto simplemente "revisando más rápido" o "automatizando la revisión" no es la respuesta. Si dejas que los robots escriban código más rápido de lo que los humanos pueden revisarlo, eventualmente acumularás una enorme lista de defectos ocultos. El artículo argumenta que la solución no es estirar más el proceso de revisión, sino arreglar las herramientas mismas para que produzcan código que sea realmente seguro y mantenible desde el principio.

Lo que el artículo descarta

Es importante saber también lo que este estudio no encontró:

  • NO encontró que el código de los robots sea universalmente "peor" en todos los sentidos. La tasa de supervivencia general (cuánto tiempo dura el código antes de ser cambiado) es estadísticamente similar a la del código humano. La diferencia está en el tipo de cambios (más correcciones de errores, no más adiciones de funciones).
  • NO encontró que el problema sea aleatorio. La carga de mantenimiento no es solo mala suerte; está ligada a características específicas del proyecto, como cuánto código se integra sin revisión.
  • NO probó que los robots sean "malvados" o "inútiles". Simplemente midió que actualmente introducen más errores y brechas de seguridad que requieren limpieza humana.

La conclusión final

El estudio concluye que, si bien los robots son impresionantes al crear código, actualmente son menos confiables al mantener el código. El "éxito" de estas herramientas no debería medirse por cuánto código generan o cuántas solicitudes de extracción se integran. En su lugar, la verdadera prueba es: ¿Se mantiene el código seguro y estable después de ser integrado?

El artículo sugiere que, a medida que dependamos más de estos agentes, debemos dejar de celebrar la velocidad de generación y empezar a preocuparnos por el costo de la limpieza. Los robots son rápidos, pero si dejan un rastro de errores y brechas de seguridad, los humanos que tengan que limpiarlos trabajarán horas extras. El objetivo no debe ser construir una ciudad que luzca genial el primer día; debe ser construir una ciudad que no necesite reparaciones de emergencia constantes un año después.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →