← Últimos artículos
🤖 AI

Don't Blame the Large Language Model: How Agent Harness Evolution Shapes Coding Agent Quality

Este artículo presenta el primer estudio longitudinal controlado que demuestra que la rápida evolución de los arneses de agentes, en lugar de los modelos de lenguaje extensos subyacentes, es un motor principal de las fluctuaciones de calidad en los agentes de codificación, como lo evidencia un análisis profundo de 35 lanzamientos secuenciales de la CLI de Qwen Code.

Autores originales: Oussama Ben Sghaier, Hao Li, Bram Adams, Ahmed E. Hassan

Publicado 2026-07-22
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Oussama Ben Sghaier, Hao Li, Bram Adams, Ahmed E. Hassan

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina un mundo donde tu computadora no solo espera a que escribas comandos, sino que realmente hace el trabajo por ti. Esta es la era de los "agentes de codificación": programas inteligentes y autónomos que pueden leer código, corregir errores e incluso escribir nuevo software por sí solos. Pero aquí está el ingrediente secreto: estos agentes no son solo el cerebro (el modelo de IA gigante); también necesitan un cuerpo y un sistema nervioso para funcionar. Este cuerpo se llama "arnés de agente" (agent harness). Piensa en el modelo de IA como un genio brillante pero perezoso que necesita un gerente que le entregue las herramientas adecuadas, le recuerde las reglas y organice sus pensamientos. El arnés es ese gerente. Decide qué herramientas puede usar la IA, cuánta información mostrarle y cómo volver atrás e intentarlo de nuevo si el primer intento falla. Todo el mundo asume que si sigues contratando mejores gerentes y actualizando la oficina, el genio se volverá más inteligente y trabajará más rápido. Pero, ¿qué pasa si el gerente en realidad está empeorando las cosas al añadir demasiadas reglas o instrucciones confusas? Esa es la gran pregunta que este artículo plantea: a medida que estos sistemas "gerentes" se actualizan constantemente, ¿están realmente ayudando a la IA a hacer un mejor trabajo, o solo la están volviendo más lenta y costosa?

Los autores de este artículo decidieron jugar a ser detectives para resolver un misterio del que los desarrolladores de software se han estado quejando. Notaron que cada vez que estos agentes de codificación recibían una actualización, a menudo empezaban a cometer más errores o tardaban mucho más en completar las tareas. La gente solía culpar al propio cerebro de la IA, pensando que el modelo se había vuelto más tonto. Pero los investigadores sospechaban que el verdadero culpable era el "gerente" (el arnés) cambiando de opinión con demasiada frecuencia. Para demostrarlo, montaron un experimento muy estricto. Eligieron un modelo de IA específico y lo encerraron en una jaula para que no pudiera cambiar en absoluto. Luego, tomaron el software del "gerente" (específicamente el Qwen Code CLI) y lo sometieron a 35 versiones diferentes, desde su primera versión hasta la más reciente. Para cada versión, le dieron al agente 5 vez 50 acertijos de programación del mundo real para resolver, utilizando exactamente el mismo cerebro de IA en cada ocasión.

Los resultados fueron sorprendentes y un poco divertidos. A pesar de que el software del "gerente" se actualizaba constantemente —a veces lanzando nuevas versiones más de dos veces al día—, la capacidad de la IA para resolver realmente los acertijos no mejoró en nada. De hecho, la tasa de éxito se mantuvo aproximadamente igual, rondando el 30%, sin importar cuántas veces actualizaran el software. Las primeras versiones eran tan buenas corrigiendo errores como las versiones sofisticadas y nuevas. Sin embargo, había un gran inconveniente: las versiones más recientes eran increíblemente derrochadoras. Las últimas versiones del gerente hacían que la IA utilizara casi el doble de "tokens" (que son como el combustible o la moneda que la IA consume para pensar) y realizara el doble de llamadas a herramientas que las versiones antiguas. Era como actualizar el motor de un coche a una versión supercompleja que usa el doble de gasolina pero no hace que el coche vaya más rápido.

Los investigadores profundizaron para descubrir por qué estaba sucediendo esto. Examinaron los cambios de código en el software del gerente y descubrieron que cuando los desarrolladores añadían muchas funciones nuevas o intentaban arreglar muchos errores pequeños a la vez, la IA se confundía y desperdiciaba más energía. También descubrieron que ciertas partes del "cuerpo" del gerente eran peligrosas de tocar. Cambiar la forma en que la IA habla con su cerebro (la capa de "Proveedor de LLM") o cómo recuerda las cosas (la capa de "Gestión de Contexto") a menudo causaba que el agente tropezara y fallara. Por otro lado, corregir brechas de seguridad o añadir extensiones simples parecía seguro. ¿Lo más impactante? El equipo de software no tenía forma de saber que estos problemas estaban ocurriendo. Sus pruebas automáticas solo comprobaban si el software fallaba, no si la IA estaba haciendo un buen trabajo o gastando dinero. Era como una fábrica que solo comprueba si la línea de montaje se mueve, pero nunca comprueba si los coches que salen de la línea tienen ruedas.

Al final, el artículo sugiere que debemos dejar de culpar al cerebro de la IA por estos errores. El problema real es que el software "gerente" está evolucionando demasiado rápido sin un control de calidad adecuado. Los desarrolladores están añadiendo tantas funciones y cambios que la IA se queda estancada, utilizando más recursos para lograr exactamente los mismos resultados que antes. Los autores piden un nuevo tipo de "aseguramiento de calidad" que verifique específicamente si el agente sigue siendo eficiente y efectivo después de cada actualización, en lugar de simplemente comprobar si todavía se enciende. Hasta entonces, actualizar estos agentes de codificación podría ser simplemente pagar más por el mismo rendimiento.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →