Tokenomics: Quantifying Where Tokens Are Used in Agentic Software Engineering
Este artigo analisa os padrões de consumo de tokens em sistemas de engenharia de software baseados em múltiplos agentes e LLMs, revelando que a etapa iterativa de revisão de código e os tokens de entrada dominam o uso de recursos, destacando assim que os principais custos residem no refinamento e na verificação automatizados, em vez da geração inicial de código.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine que você contrata uma equipe de robôs de IA para construir um software para você. Você pode pensar que a parte mais cara do trabalho é o "construção" propriamente dita (escrever o código). No entanto, este artigo sugere que isso é como pensar que a parte mais cara de construir uma casa é assentar os tijolos, quando, na realidade, o custo vem das reuniões intermináveis onde a equipe discute se a cor da tinta está correta.
Aqui está uma divisão simples do que os pesquisadores descobriram:
A Grande Ideia: "Tokenomics"
Os autores inventaram uma nova palavra, "Tokenomics", para descrever a "economia" da IA. Assim como uma equipe humana gasta dinheiro com salários e café, as equipes de IA gastam "tokens" (a moeda que a IA usa para pensar e falar). Cada vez que a IA lê um comando ou escreve uma linha de código, custa tokens. Os pesquisadores queriam responder a uma pergunta simples: Para onde exatamente vai esse dinheiro?
O Experimento: Uma Fábrica de Software Virtual
Para descobrir, os pesquisadores criaram uma empresa de software virtual chamada ChatDev. Eles deram a essa equipe de IA 30 trabalhos diferentes, variando de problemas matemáticos simples à construção de um jogo de xadrez. Eles usaram um modelo de IA muito inteligente (GPT-5) para alimentar a equipe.
Eles observaram a equipe de IA trabalhar passo a passo, rastreando cada um dos tokens usados e mapeando esses passos para as etapas reais de software:
- Design: Planejamento do que construir.
- Codificação: Escrevendo o primeiro rascunho.
- Revisão de Código: Verificando o trabalho e corrigindo erros.
- Teste: Quebrando o código para ver se funciona.
- Documentação: Escrevendo o manual.
Os Resultados Surpreendentes
1. A "Revisão de Código" é o Poço Sem Fundo
Você poderia esperar que a fase de "Codificação" fosse a mais cara. Não é.
- A Analogia: Imagine uma equipe de construção. O ato real de martelar os pregos (Codificação) é rápido e barato. Mas a parte em que o mestre de obras e o arquiteto caminham pela obra, apontando para a mesma parede, discutindo, reescrevendo os planos e conferindo as medidas repetidamente? Isso é a Revisão de Código.
- O Achado: Os pesquisadores descobriram que 59,4% de todos os tokens (dinheiro) foram gastos apenas nesta fase de "Revisão de Código". Os agentes de IA estavam constantemente conversando entre si para refinar e corrigir o código, o que era incrivelmente caro.
2. O Imposto da "Escuta"
Os tokens de IA são divididos em três tipos: Input (o que a IA lê), Output (o que a IA escreve) e Raciocínio (o que a IA pensa).
- A Analogia: Imagine um grupo de pessoas tentando resolver um quebra-cabeça. Eles passam 2 minutos lendo as instruções e olhando as peças (Input), mas apenas 1 minuto realmente encaixando as peças (Output).
- O Achado: A IA passou 53,9% do seu tempo apenas lendo o contexto (Input). Os pesquisadores chamam isso de "Imposto de Comunicação". Como os agentes conversam entre si em um loop, eles continuam passando toda a conversa e o código de um para o outro. Eles estão gastando a maior parte do orçamento apenas repetindo o que já sabem, em vez de criar algo novo.
3. Diferentes Trabalhos, Diferentes Custos
- Codificação: Esta foi, na verdade, a parte mais barata. Foi "pesada em Output", o que significa que a IA estava ocupada escrevendo coisas novas.
- Documentação e Revisão: Foram "pesadas em Input". A IA teve que ler grandes quantidades de código existente para escrever um pequeno resumo ou encontrar um pequeno erro.
A Conclusão
O artigo conclui que o alto custo de usar IA para construir software não é porque a IA é ruim em escrever código. É porque as equipes de IA são ineficientes ao conversar entre si.
Elas gastam a vasta maioria de seus recursos em um ciclo de checar e rechecar o trabalho (Revisão de Código) e reler o mesmo contexto (Input). Os pesquisadores sugerem que, se quisermos tornar o desenvolvimento de software por IA mais barato e rápido, não devemos focar em fazer a IA escrever código mais rápido; devemos focar em fazer a equipe de IA parar de discutir e de reler tanto.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.