When Does Restricting a Coding Agent to execute_code Help? A Regime Agent-Design Ablation
Este artigo demonstra que restringir agentes de codificação a uma única ferramenta `execute_code` é frequentemente tão eficaz quanto e, com frequência, mais barato do que usar ambientes ricos em ferramentas, revelando que a superfície de ferramentas ideal é determinada conjuntamente pela interação entre os regimes de tarefas e designs de agentes específicos, em vez de ser determinada por apenas um desses fatores.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine que você tem um assistente robô superinteligente cujo trabalho é consertar códigos quebrados ou resolver enigmas matemáticos. Agora, há um grande debate no mundo da tecnologia sobre como esse robô deve falar com o computador para realizar o trabalho.
Alguns dizem: "Dê a ele uma caixa de ferramentas completa com botões especiais para cada tarefa!" (Como uma IDE sofisticada).
Outros dizem: "Apenas dê a ele uma linha de comando e deixe-o digitar comandos de shell!" (Como um hacker em um filme).
Um terceiro grupo diz: "Não! Apenas deixe o robô escrever um script Python e executá-lo de uma só vez!" (A abordagem execute_code).
Este artigo é como um juiz gigante e justo que organiza uma corrida para ver qual método realmente economiza dinheiro e realiza o trabalho. Eles não apenas adivinharam; eles rodaram exatamente o mesmo robô (dois modelos diferentes: Claude e Codex) nas exatas mesmas tarefas, mas mudaram apenas as ferramentas que ele tinha permissão para usar.
Aqui está o que eles descobriram, dividido em histórias simples.
A Descoberta Principal: Depende do Robô e do Trabalho
A maior surpresa? Não existe uma ferramenta única que seja a "melhor". O vencedor muda dependendo de quem é o robô e o que ele está fazendo.
Pense nisso como:
O Trabalho de "Enigma Matemático" (Tarefas de Artefato): Se o robô estiver fazendo cálculos ou processamento de dados, o método "escrever um script e executar" (
code_only) é o vencedor claro. É como contratar um chef que apenas escreve uma receita perfeita e cozinha toda a refeição de uma só vez.- Para o robô Claude, este método economizou 24,6% nos custos.
- Para o robô Codex, economizou cerca de 6,7% (embora o artigo diga que este resultado é um pouco instável, como um cara ou coroa).
- Veredito: Para matemática e dados, o método do script é mais barato e tão bom quanto para resolver o problema.
O Trabalho de "Consertar um Código Bagunçado" (Tarefas SWE-bench): É aqui que as coisas ficam complicadas. Essas tarefas envolvem editar muitos arquivos em um projeto complexo.
- Se você usar o robô Codex: O método do script ainda é o campeão! Ele economizou 19,9% nos custos. Por quê? Porque o método do script permite que o robô agrupe muitas solicitações pequenas em um único pacote grande, como um caminhão de entrega carregando 50 pacotes em vez de uma pessoa caminhando 50 vezes.
- Se você usar o robô Claude: Opa. O método do script tornou-se na verdade mais caro (em 14,4%), embora o artigo observe que isso não foi uma diferença estatisticamente "provada", apenas uma tendência forte. Por quê? Porque para o Claude, escrever um script para editar um arquivo é como tentar trocar um pneu construindo um carro novo primeiro. Exige palavras demais (tokens) para explicar a edição em código, criando "atrito de edição".
O Que o Artigo Descarta
O artigo argumenta explicitamente contra a ideia de que uma superfície de ferramenta é sempre melhor para todos.
- Ele descarta: "Botões de IDE especiais são sempre necessários." (Porque o método do script venceu no Codex).
- Ele descarta: "Comandos Bash são sempre suficientes." (Porque o método do script foi mais barato para o Claude em tarefas de matemática).
- Ele descarta: "A execução de código é sempre a mais barata." (Porque foi mais cara para o Claude em correções de código complexas).
Os autores são muito claros: Você não pode simplesmente escolher uma ferramenta baseada na ferramenta em si. Você tem que olhar para a combinação do cérebro do robô e o tipo de trabalho.
A Surpresa da "Taxa de Aprovação"
Aqui está a parte mais importante: O custo mudou, mas a taxa de sucesso não.
Imagine dois corredores. Um corre com botas pesadas (ferramentas caras) e outro corre de tênis (ferramentas baratas). O artigo descobriu que ambos os corredores terminaram a corrida exatamente na mesma velocidade.
- Quer o robô tenha usado a caixa de ferramentas sofisticada, os comandos bash ou o método do script, a porcentagem de tarefas que eles resolveram corretamente foi quase idêntica (dentro de 3 pontos percentuais).
- O método do "script" não tornou o robô mais inteligente ou mais burro; ele apenas mudou como ele caminhou até a linha de chegada. Às vezes essa caminhada foi um sprint (barato), e às vezes foi um tropeço (caro).
Por Que os Custos Mudaram?
O artigo investiga por que o método do script foi mais barato ou mais caro.
- A Taxa de "Atrito de Edição" (Para o Claude): Quando o Claude teve que usar o método do script para corrigir um arquivo, ele teve que escrever um script Python longo apenas para dizer "mude a linha 5". Isso consumiu muitos "tokens de saída" (palavras que o robô teve que digitar). Foi como pagar um pedágio toda vez que você queria virar uma página. Isso aconteceu principalmente em tarefas onde o robô falhou ou teve dificuldades, tornando essas execuções específicas muito caras.
- O Bônus de "Agrupamento" (Para o Codex): Quando o Codex usou o método do script, ele pôde empacotar muitos comandos pequenos em um único script. Em vez de perguntar ao computador "Leia o arquivo A", depois "Leia o arquivo B", depois "Leia o arquivo C" (três viagens separadas), ele perguntou "Leia A, B e C" de uma só vez. Isso economizou muitos "tokens de entrada" (palavras que o robô teve que ler).
- O Efeito da "Execução Maldita": O custo extra para o Claude nas tarefas de correção de código aconteceu principalmente quando o robô já ia falhar. Foi como um carro ficando sem combustível enquanto dirige em círculos. O método do script não causou a falha; ele apenas tornou a tentativa falha mais cara.
O Quão Certos Estamos?
Os autores estão muito confiantes nos resultados das tarefas matemáticas e do robô Codex. Eles rodaram esses testes em 93 tarefas de matemática e 100 de correção de código, usando três "seeds" (pontos de partida aleatórios) diferentes para cada uma, para garantir que os resultados não fossem apenas sorte. As economias para o Codex em tarefas de correção de código foram estatisticamente significativas (uma queda de 19,9% com um p-valor de 2,0 × 10⁻⁹, que é basicamente zero de chance de ser aleatório).
No entanto, para o robô Claude em tarefas de correção de código, o resultado é um pouco mais nebuloso. O custo aumentou em 14,4%, mas o teste estatístico disse que isso não foi uma prova "irrefutável" (p-valor de 0,12). Os autores chamam isso de "direcional", o que significa que a tendência está lá, mas eles precisariam rodar os testes mais vezes para ter 100% de certeza de que não é um acaso.
A Conclusão Final
Se você está construindo um agente de codificação:
- Não adivinhe. A "melhor" ferramenta depende do seu robô específico e do seu trabalho específico.
- Para Matemática/Dados: Tente o método de "escrever um script". É mais barato e funciona tão bem quanto.
- Para Correção de Código: Depende. Se você usa o Codex, o método do script é ótimo. Se você usa o Claude, talvez queira manter as ferramentas de edição padrão, especialmente para problemas difíceis, porque o método do script pode ficar preso no "atrito de edição".
- Não se preocupe com a inteligência: Mudar as ferramentas não tornará seu robô mais inteligente ou mais burro; apenas altera o preço da jornada.
O artigo conclui que a maneira "mais barata" de rodar um agente não é uma regra universal; é um quebra-cabeça onde você tem que combinar a ferramenta ao robô e à tarefa.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.