← Últimos artigos
💻 computer science

Can your AI agent be cheaper? Investigating the effects of task specifications on token spend in agentic coding tasks

Este artigo investiga como as especificações de tarefas impactam o consumo de tokens em fluxos de trabalho de codificação de agentes, demonstrando que prompts excessivamente breves aumentam significativamente os custos, ao mesmo tempo em que introduz um método preditivo para estimar o gasto de tokens em diferentes configurações com alta precisão.

Autores originais: Jakub Smékal

Publicado 2026-08-27
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Jakub Smékal

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

No mundo moderno do desenvolvimento de software, um novo tipo de trabalhador surgiu: o agente de inteligência artificial. Diferente de um simples chatbot que responde a uma única pergunta, esses agentes são projetados para lidar com tarefas complexas e de múltiplas etapas, como corrigir um erro em um programa de computador ou construir um novo recurso do zero. Eles fazem isso lendo uma descrição de tarefa, pensando sobre o problema, usando ferramentas digitais para escrever e testar código, e repetindo o processo até que o trabalho seja concluído. No entanto, essa autonomia vem com um preço. Cada vez que a IA pensa, lê ou escreve, ela consome recursos digitais medidos em "tokens", que são as unidades básicas de texto que o modelo processa. Esses tokens traduzem-se diretamente em dinheiro. À medida que esses agentes se tornam mais comuns em sistemas do mundo real, os engenheiros enfrentam uma questão premente: quanto custará deixar uma IA resolver um problema e pode esse custo ser controlado?

A resposta não é tão simples quanto escolher um modelo de computador mais barato. Estudos recentes mostraram que, mesmo quando uma IA recebe exatamente as mesmas instruções, o valor que ela gasta pode variar drasticamente de uma tentativa para a outra. Às vezes, duas execuções idênticas da mesma tarefa podem diferir em custo por um fator de trinta. Essa imprevisibilidade torna o orçamento difícil. Além disso, embora pesquisadores tenham analisado como diferentes modelos de IA performam, eles ignoraram amplamente como a maneira como um humano descreve a tarefa em si altera o preço. Um engenheiro sênior pode escrever uma especificação detalhada e estruturada para uma correção de software, enquanto um engenheiro júnior pode colar uma mensagem de erro bruta. Essas diferentes descrições levam a custos diferentes, ou a IA apenas faz a mesma quantidade de trabalho independentemente de como o pedido é formulado?

Para descobrir, um pesquisador da Universidade de Stanford conduziu um experimento em larga escala usando um modelo de IA específico conhecido como Kimi K3. A equipe selecionou cinco tarefas distintas de reparo de software de um conjunto de testes padrão usado por desenvolvedores. Para cada tarefa, eles criaram uma grande variedade de instruções, variando de um documento completo e altamente estruturado contendo todos os detalhes possíveis até uma descrição básica com quase nenhuma informação. Eles também testaram três níveis diferentes de "esforço de pensamento", que essencialmente controla o quão arduamente a IA tenta raciocinar sobre o problema antes de agir. No total, eles executaram o sistema 2.700 vezes, rastreando cuidadosamente quanto dinheiro foi gasto em cada tentativa e quantas vezes o agente teve que recorrer ao computador para realizar as tarefas.

Os resultados revelaram um padrão claro e surpreendente. A forma como uma tarefa é descrita tem um impacto massivo no custo médio. Quando os pesquisadores reduziram uma especificação completa e detalhada para uma história simples em linguagem comum sobre o que o usuário deseja, o custo de resolver o problema saltou quase trinta por cento. Isso aconteceu consistentemente em todas as tarefas testadas. Parece que, quando a IA não recebe detalhes específicos suficientes, ela precisa gastar mais tempo e dinheiro para descobrir as partes ausentes por conta própria. No entanto, o estudo também descobriu que as instruções não alteraram a imprevisibilidade do custo. Não importava o quão detalhado ou vago fosse o prompt, a diferença entre uma execução e outra permanecia aproximadamente a mesma. O custo de uma única tentativa é inerentemente instável, e a única maneira de tornar a conta total mais previsível é tornar as tentativas individuais mais baras.

Outra descoberta fundamental foi que o nível de detalhe nas instruções importa mais quando a IA recebe um orçamento limitado para pensar. Quando a IA tem permissão para pensar profunda e extensivamente, a diferença de custo entre um prompt detalhado e um vago diminui. Isso sugere que, se você der à IA tempo suficiente para raciocinar, ela pode preencher as lacunas de uma descrição ruim por conta própria, mas se você restringir seu tempo de pensamento, um prompt claro e detalhado torna-se essencial para economizar dinheiro. Os pesquisadores também descobriram que remover seções específicas de uma descrição de tarefa, como a lista de casos de borda ou os critérios de sucesso, teve um efeito pequeno por si só, mas remover toda a história do usuário ou os cenários de teste causou um salto dramático no custo.

Talvez a descoberta mais prática para qualquer pessoa que utilize essas ferramentas seja um método para prever custos em novas tarefas. A equipe mostrou que você não precisa executar uma tarefa dezenas de vezes para saber quanto ela custará. Ao realizar um único teste barato em um novo problema, eles puderam prever o custo desse mesmo problema sob muitos estilos de instrução e configurações de pensamento com precisão razoável. Sem esse teste único, qualquer estimativa sobre o custo de uma nova tarefa provavelmente estaria errada por mais de cem por cento. Com apenas uma pequena medição, o erro caiu para cerca de trinta e seis por cento. Isso significa que os engenheiros podem avaliar rapidamente o impacto financeiro de suas escolhas sem desperdiçar recursos com extensos testes de tentativa e erro.

O estudo conclui que, embora o comportamento da IA seja naturalmente imprevisível, o custo de seu trabalho é fortemente influenciado pela forma como os humanos estruturam o pedido. Uma descrição de tarefa bem estruturada e detalhada pode reduzir significamente o dinheiro gasto, especialmente quando a IA não tem tempo ilimitado para pensar. A pesquisa sugere que a maneira mais eficaz de gerenciar esses custos não é tentar eliminar a aleatoriedade da IA, mas sim projetar as instruções das tarefas cuidadosamente e usar um único teste de baixo custo para calibrar as expectativas para novos trabalhos. À medida que esses agentes se integram ao trabalho diário, entender a relação entre as palavras que usamos e o dinheiro que gastamos será tão importante quanto o código que eles escrevem.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →