← Últimos artigos
💬 NLP

Token Reduction Is Not Cost Reduction

Este artigo demonstra que reduzir a contagem de tokens em contextos de agentes de codificação não reduz de forma confiável os custos faturados devido à dominância do tráfego de cache de prompt e ao risco de falha na tarefa, argumentando, em vez disso, pela avaliação da eficiência de custo baseada no custo faturado ajustado pelo sucesso, em vez de apenas na redução de tokens.

Autores originais: Sarel Weinberger, Amir Hozez

Publicado 2026-07-15
📖 6 min de leitura🧠 Leitura aprofundada

Autores originais: Sarel Weinberger, Amir Hozez

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está administrando uma agência de detetives de alta tecnologia, onde seus detetives de IA superinteligentes (chamados de "agentes de codificação") resolvem mistérios lendo arquivos, executando comandos e conversando com você. Cada vez que eles leem um arquivo ou executam um comando, você recebe uma conta do provedor de nuvem.

Por muito tempo, todos pensaram que a melhor maneira de economizar dinheiro era fazer os detetives lerem menos texto. A lógica era simples: "Se comprimirmos os arquivos que eles leem, reduzimos a contagem de palavras, então a conta diminui!" Parecia um plano perfeito, como compactar uma mala espremendo todo o ar para fora.

Mas este artigo, intitulado "Token Reduction Is Not Cost Reduction" (Redução de Tokens Não é Redução de Custo), está aqui para dizer que a analogia da mala é uma armadilha. Os autores realizaram um experimento massivo — mais de 2.908 execuções de detetives em 7 diferentes bases de código e 3 modelos de IA diferentes — para ver o que realmente acontece com a conta.

Aqui está a reviravolta que descobriram: Encolher o texto nem sempre encolhe a conta. Na verdade, às vezes, encolher o texto faz a conta subir.

A Surpresa do "Cache de Memória"

O maior choque é para onde o dinheiro realmente vai. Os autores decomporam a conta e descobriram que 87% do custo reconstruído (e cerca de 80% da conta real) vem de algo chamado "tráfego de cache de prompt" (prompt-cache traffic).

Pense na memória da IA como um quadro branco mágico e superveloz.

  • Escrevendo no quadro (Criação de Cache): Isso custa dinheiro, mas é uma taxa única.
  • Lendo do quadro (Leitura de Cache): Isso é super barato, como um cupom de desconto.
  • Texto novo (Input não cacheado): Esta é a parte cara, mas é na verdade uma fatia minúscula do bolo (apenas 1,3% da conta!).

No entanto, há um custo oculto que o quadro branco não mostra claramente. Os autores descobriram um "resíduo não atribuído" de 8,7% na conta que sua decomposição padrão não conseguiu explicar. Esse pedaço restante não é aleatório; ele escala diretamente com o quão intensamente a IA está pensando. No modelo Haiku 4.5, quanto mais "esforço de pensamento" você define, maior esse misterioso valor se torna. Isso sugere que, mesmo quando o texto parece pequeno, a IA pode estar realizando um trabalho mental caro que não aparece na contagem de tokens.

O problema é que, quando você comprime o texto, não está apenas economizando na parte do "Novo texto". Você pode estar atrapalhando a parte de "Ler do quadro". Se você comprimir um arquivo demais, a IA pode ficar confusa, esquecer o que estava fazendo e ter que voltar para reler todo o histórico da conversa para entender o que aconteceu.

Cada vez que a IA tem que reler esse histórico, ela tem que escrevê-lo no quadro novamente. E escrever é caro! Portanto, mesmo que você tenha economizado algumas palavras, você forçou a IA a pagar a "taxa de escrita" repetidas vezes.

O "Corte de 38%" Que Custou Mais

Os autores testaram um sistema de compressão sofisticado (chamado RTK-ML) que conseguiu reduzir 38,4% do texto bruto de saída das ferramentas. Você pensaria que isso economizaria uma fortuna, certo?

Errado.
Em seus testes pareados, este sistema na verdade aumentou o custo em 6,8% (com um intervalo de confiança de 95% de [+2,8, +11,3]).

Por quê? Porque a compressão foi tão agressiva que a IA teve que dar passos extras para resolver o problema. Ela teveu que executar turnos de diagnóstico adicionais, reler arquivos e fazer mais perguntas. Cada um desses passos extras significava retransmitir todo o histórico da conversa, o que anulou quaisquer economias da compressão de texto.

O artigo descarta explicitamente a ideia de que "menos tokens = menor custo". Eles descobriram que a relação entre quanto texto você remove e quanto dinheiro você economiza é basicamente inexistente. A correlação foi um 0,15 fraco, o que é tão próximo de zero que é praticamente o lançamento de uma moeda.

O Desastre do "Âncora Quebrado"

Existe outra maneira pela qual a compressão pode retroceder: ela pode quebrar as pistas de que a IA precisa para fazer seu trabalho.

Os autores realizaram um teste especial em tarefas de programação em Go. Eles descobriram que, quando comprimiam o texto, a IA às vezes perdia os "âncoras de edição verbatim" — as linhas exatas de código, byte por byte, que ela precisava copiar e colar para corrigir um erro.

Imagine tentar consertar um vazamento em um cano, mas as instruções que você está lendo foram tanto espremidas que a parte específica que você precisa cortar agora é uma mancha borrada. A IA tenta consertar, mas o "remendo" (a correção) não se encaixa porque as instruções foram corrompidas.

  • Sem compressão: A IA aplicou com sucesso 27 de 40 patches.
  • Com compressão: A IA conseguiu apenas 15 de 40.

Neste teste específico, a versão comprimida não apenas custou mais por correção bem-sucedida, mas também falhou com mais frequência. Os autores observam que, embora a versão comprimida parecesse mais barata por tentativa, o "custo por problema resolvido" foi na verdade o dobro ($0,515 vs. $0,248) porque ela falhou muitas vezes.

O "Proxy de Caixa Preta"

Eles também testaram uma ferramenta diferente chamada Headroom, que atua como um intermediário que reescreve as mensagens antes que elas cheguem à IA. Este foi um desastre total para o bolso. Ele tornou o custo 48,4% mais alto (com um IC de 95% de [+42,3, +55,0]) do que não fazer nada, sem qualquer melhoria nas taxas de sucesso.

A Conclusão

O artigo conclui que, se você quiser economizar dinheiro com agentes de codificação de IA, não pode apenas olhar para um "contador de tokens" e assumir que está vencendo.

  • O que eles provaram: Nestes testes específicos e do mundo real, cortar o texto não reduziu os custos de forma confiável. Na verdade, para o sistema RTK-ML, tornou as coisas mais caras. Para o Headroom, tornou as coisas muito mais caras.
  • O que eles mediram: Eles não apenas adivinharam; rastrearam 2.908 execuções reais com contas reais totalizando cerca de $175,92 (apenas para a campanha principal), além de um 8,7% adicional da conta que escala com o esforço de pensamento e não pôde ser explicado pelas contagens de tokens padrão.
  • O que eles sugerem: A única maneira de saber se uma ferramenta de compressão funciona é medir a conta final por tarefa bem-sucedida, não o número de palavras removidas.

Portanto, da próxima vez que alguém lhe disser: "Comprimimos os dados em 50% para economizar seu dinheiro!", você pode sorrir e dizer: "Legal, mas você verificou se a IA teve que reler o livro inteiro por causa disso?". Porque no mundo dos agentes de IA, às vezes o caminho mais curto é o mais caro.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →