← Últimos artículos
🤖 AI

When Does Restricting a Coding Agent to execute_code Help? A Regime ×\times Agent-Design Ablation

Este artículo demuestra que restringir a los agentes de codificación a una única herramienta `execute_code` es a menudo tan efectivo como y frecuentemente más económico que utilizar entornos ricos en herramientas, revelando que la superficie de herramientas óptima está determinada conjuntamente por la interacción entre los regímenes de tareas y los diseños de agentes específicos, en lugar de por cualquiera de los dos factores por sí solo.

Autores originales: Hong Yang, Qi Yu, Travis Desell

Publicado 2026-07-14
📖 7 min de lectura🧠 Análisis profundo

Autores originales: Hong Yang, Qi Yu, Travis Desell

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes un asistente robot superinteligente cuyo trabajo es arreglar código roto o resolver acertijos matemáticos. Ahora mismo, hay un gran debate en el mundo tecnológico sobre cómo este robot debería hablar con la computadora para lograr su objetivo.

Algunos dicen: "¡Dale una caja de herramientas completa con botones especiales para cada tarea!" (Como un IDE sofisticado).
Otros dicen: "¡Solo dale una línea de comandos y deja que escriba comandos de shell!" (Como un hacker en una película).
Un tercer grupo dice: "¡No! ¡Simplemente deja que el robot escriba un script de Python y lo ejecute todo de una vez!" (El enfoque execute_code).

Este artículo es como un juez gigante y justo que organiza una carrera para ver qué método realmente ahorra dinero y logra el trabajo. No solo adivinaron; corrieron exactamente el mismo robot (dos modelos diferentes: Claude y Codex) en las mismas tareas, pero cambiaron solo las herramientas que se les permitía usar.

Aquí está lo que encontraron, desglosado en historias simples.

El Descubrimiento Principal: Depende del Robot y del Trabajo

¿La mayor sorpresa? No existe una única "mejor" herramienta. El ganador cambia dependiendo de quién es el robot y qué está haciendo.

Piénsalo así:

  • El Trabajo de "Acertijo Matemático" (Tareas de Artifact): Si el robot está haciendo cálculos o procesamiento de datos, el método de "escribir un script y ejecutarlo" (code_only) es el claro ganador. Es como contratar a un chef que simplemente escribe una receta perfecta y cocina toda la comida de un tirón.

    • Para el robot Claude, este método ahorró un 24.6% en costos.
    • Para el robot Codex, ahorró aproximadamente un 6.7% (aunque el artículo dice que este resultado es un poco inestable, como el lanzamiento de una moneda).
    • Veredicto: Para matemáticas y datos, el método del script es más barato y tan bueno como el otro para resolver el problema.
  • El Trabajo de "Arreglar un Código Desordenado" (Tareas de SWE-bench): Esto es donde se pone complicado. Estas tareas implican editar muchos archivos en un proyecto complejo.

    • Si usas el robot Codex: ¡El método del script sigue siendo el campeón! Ahorró un 19.9% en costos. ¿Por qué? Porque el método del script permite al robot agrupar muchas solicitudes pequeñas en un solo paquete grande, como un camión de reparto que transporta 50 paquetes en lugar de una persona caminando 50 veces.
    • Si usas el robot Claude: ¡Oh, no! El método del script fue en realidad más caro (un 14.4% más), aunque el artículo señala que esta no fue una diferencia estadísticamente "probada", solo una tendencia fuerte. ¿Por qué? Porque para Claude, escribir un script para editar un archivo es como intentar cambiar una llanta construyendo primero un auto nuevo. Requiere demasiadas palabras (tokens) para explicar la edición en código, creando "fricción de edición".

Lo que el Artículo Descarta

El artículo argumenta explícitamente en contra de la idea de que una superficie de herramienta sea siempre mejor para todos.

  • Descarta: "Los botones de un IDE especial son siempre requeridos". (Porque el método del script ganó en Codex).
  • Descarta: "Los comandos Bash son siempre suficientes". (Porque el método del script fue más barato para Claude en tareas de matemáticas).
  • Descarta: "La ejecución de código es siempre la más barata". (Porque fue más cara para Claude en correcciones de código complejas).

Los autores son muy claros: No puedes elegir una herramienta basándote solo en la herramienta misma. Tienes que mirar la combinación del cerebro del robot y el tipo de trabajo.

La Sorpresa de la "Tasa de Aprobación"

Aquí está la parte más importante: El costo cambió, pero la tasa de éxito no.

Imagina a dos corredores. Uno corre con botas pesadas (herramientas caras) y otro corre con zapatillas (herramientas baratas). El artículo encontró que ambos corredores terminaron la carrera exactamente a la misma velocidad.

  • Ya fuera que el robot usara la caja de herramientas elegante, los comandos bash o el método del script, el porcentaje de tareas que resolvieron correctamente fue casi idéntico (dentro de un margen de 3 puntos porcentuales).
  • El método del "script" no hizo al robot más inteligente o más tonto; solo cambió cómo caminaba hacia la meta. A veces ese caminar fue un sprint (barato), y otras veces fue un tropezón (caro).

¿Por qué Cambiaron los Costos?

El artículo investiga por qué el método del script fue más barato o más caro.

  1. El Impuesto de la "Fricción de Edición" (Para Claude): Cuando Claude tenía que usar el método del script para arreglar un archivo, tenía que escribir un largo script de Python solo para decir "cambia la línea 5". Esto consumió muchos "tokens de salida" (palabras que el robot tenía que escribir). Fue como pagar un peaje cada vez que querías pasar una página. Esto sucedió principalmente en las tareas donde el robot fallaba o tenía dificultades, haciendo que esas ejecuciones específicas fueran muy caras.
  2. El Bono de "Agrupación" (Para Codex): Cuando Codex usó el método del script, pudo empaquetar muchos comandos pequeños en un solo script. En lugar de pedirle a la computadora "Lee el archivo A", luego "Lee el archivo B", luego "Lee el archivo C" (tres viajes separados), le pidió "Lee A, B y C" de una sola vez. Esto ahorró muchísimos "tokens de entrada" (palabras que el robot tenía que leer).
  3. El Efecto de la "Ejecución Condenada": El costo adicional para Claude en las tareas de corrección de código ocurrió principalmente cuando el robot ya iba a fallar. Fue como un auto quedándose sin gasolina mientras conduce en círculos. El método del script no causó el fallo; solo hizo que el intento fallido costara más dinero.

¿Qué tan Seguros Estamos?

Los autores están muy seguros de los resultados en las tareas matemáticas y del robot Codex. Corrieron estas pruebas en 93 tareas matemáticas y 100 de corrección de código, usando tres "semillas" (puntos de partida aleatorios) diferentes para cada una para asegurar que los resultados no fueran solo suerte. Los ahorros para Codex en las tareas de corrección de código fueron estadísticamente significativos (una caída del 19.9% con un p-valor de 2.0 × 10⁻⁹, que es básicamente cero probabilidad de ser al azar).

Sin embargo, para el robot Claude en las tareas de corrección de código, el resultado es un poco más difuso. El costo aumentó un 14.4%, pero la prueba estadística dijo que esto no fue una prueba "contundente" (p-valor de 0.12). Los autores lo llaman "direccional", lo que significa que la tendencia está ahí, pero necesitarían realizar las pruebas más veces para estar 100% seguros de que no es una casualidad.

La Conclusión Final

Si estás construyendo un agente de programación:

  • No adivines. La "mejor" herramienta depende de tu robot específico y de tu trabajo específico.
  • Para Matemáticas/Datos: Prueba el método de "escribir un script". Es más barato y funciona igual de bien.
  • Para Corrección de Código: Depende. Si usas Codex, el método del script es genial. Si usas Claude, es posible que quieras mantener las herramientas de edición estándar, especialmente para problemas difíciles, porque el método del script podría estancarse en la "fricción de edición".
  • No te preocupes por la inteligencia: Cambiar las herramientas no hará a tu robot más inteligente o más tonto; solo cambia el precio del viaje.

El artículo concluye que la forma "más barata" de ejecutar un agente no es una regla universal; es un rompecabezas donde tienes que hacer coincidir la herramienta con el robot y la tarea.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →