← Últimos artigos
💬 NLP

Not All Tokens Are Equal: Inflation-Aware Routing for Agentic LLM Systems

Este artigo apresenta o InflationAgent, um novo framework de roteamento que aborda a lacuna da "inflação de tokens" em sistemas de LLM agênticos ao prever custos em nível de fluxo de trabalho via Entropia de Ramificação de CoT e otimizar a seleção de modelos através de uma Taxa de Câmbio Semântica, alcançando, assim, maior precisão com menos tokens do que métodos existentes como o FrugalGPT.

Autores originais: Heming Fu, Shan Lin, Qianqian Xie, Guojun Xiong

Publicado 2026-08-17
📖 7 min de leitura🧠 Leitura aprofundada

Autores originais: Heming Fu, Shan Lin, Qianqian Xie, Guojun Xiong

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está administrando um serviço de entrega para uma frota de robôs. Alguns robôs são minúsculos, rápidos e baratos de operar, mas às vezes ficam confusos e deixam cair os pacotes. Outros são gigantes, superinteligentes e caros, mas quase nunca cometem erros. No mundo da Inteligência Artificial, esses robôs são "Large Language Models" (LLMs). Eles são os cérebros por trás de chatbots e assistentes de programação. Geralmente, quando fazemos uma pergunta, apenas a enviamos para um robô e esperamos por uma resposta. Mas no mundo real, as coisas ficam bagunçadas. Se o robô minúsculo errar, um sistema inteligente não simplesmente desiste; ele pede ao robô para tentar novamente. Ele pode até pedir para o robô gigante intervir. Isso é chamado de um "sistema agente" — uma equipe de agentes de IA trabalhando juntos para resolver um problema.

O problema é que temos contado o custo dessas entregas de forma errada. Temos pago pelo preço de uma única viagem, esquecendo que se o robô bater e tiver que voltar para o armazém para tentar de novo, estamos pagando pela viagem de ida e volta completa, não apenas pelo bilhete de ida. Este artigo é sobre uma nova maneira de gerenciar essas equipes de IA para que não esgotemos acidentalmente nosso orçamento enviando o robô errado para um trabalho que exige muitas tentativas.


O Custo Escondido do "Tente Novamente"

Imagine que você está em um parque de diversões em uma barraca de jogos. Você tem uma quantidade limitada de dinheiro (tokens) para jogar. Você pode escolher entre uma máquina barata e precária que custa US$ 1 por tentativa, ou uma máquina sofisticada e de alta tecnologia que custa US$ 10 por tentativa.

A antiga forma de pensar era simples: "A máquina barata custa US$ 1, então vou escolher essa!". Mas aqui está o detalhe: a máquina barata é traiçoeira. Se você fizer uma pergunta difícil para ela, ela pode errar. Então, você tem que pagar US$ 1 novamente para tentar uma segunda vez. E uma terceira. E uma quarta. No momento em que você finalmente consegue a resposta certa, você gastou US$ 5 com a máquina barata. Enquanto isso, a máquina sofisticada teria acertado de primeira por US$ 10.

Este artigo chama esse custo extra oculto de "Inflação de Tokens". É a lacuna entre o que você acha que está pagando (uma tentativa) e o que você realmente paga (cinco tentativas). Os autores descobriram que, para tarefas difíceis, essa inflação pode ser enorme. Um modelo pequeno e barato pode acabar custando 4,25 vezes mais do que o esperado porque continua falhando e precisando de novas tentativas.

A Nova Estratégia: O "InflationAgent"

Os pesquisadores construíram um novo sistema chamado InflationAgent para corrigir isso. Em vez de apenas olhar para o preço de uma única tentativa, este sistema age como um gerente de parque de diversões astuto que sabe exatamente quais máquinas são propensas a quebrar.

Aqui está como funciona, passo a passo:

1. O "Teste de Intuição" (CoT Branching Entropy)
Antes mesmo de o sistema pedir a um robô para resolver um problema, ele faz um teste rápido e gratuito. Ele pede a um robô pequeno e local para pensar sobre o problema três vezes diferentes.

  • Se o robô der a mesma resposta as três vezes, o sistema sabe que o problema é fácil.
  • Se o robô der três respostas totalmente diferentes e confusas, o sistema sabe que o problema é difícil e que o robô provavelmente ficará preso em um ciclo de tentativas.
    Os autores chamam essa medição de CoT Branching Entropy. É como verificar se o motor de um carro está falhando antes mesmo de você iniciar a viagem. Isso não custa nada extra porque acontece em um computador local, não nos servidores caros na nuvem.

2. O Calculador de "Etiqueta de Preço"
Usando esse "teste de intuição", o sistema prevê quanta "inflação" haverá. Ele não apenas adivinha; ele usa uma calculadora pequena e inteligente (um modelo de aprendizado de máquina) treinada em dados passados. Ele prevê: "Se enviarmos esta pergunta difícil para o robô pequeno, ele provavelmente falhará 3 vezes, então o custo real é 3x o preço".

3. O Seletor de "Melhor Negócio"
Agora o sistema calcula a Taxa de Câmbio Semântica (Semantic Exchange Rate - SER). Esta é uma maneira sofisticada de perguntar: "Quanta precisão eu consigo para cada dólar que eu realmente gasto?".

  • Se o robô pequeno é barato, mas falhará 4 vezes, o seu "negócio" é terrível.
  • Se o robô grande é caro, mas acertará de primeira, o seu "negócio" pode ser, na verdade, melhor.
    O sistema escolhe o robô que oferece o melhor valor, não apenas o menor preço de etiqueta.

4. A Regra do "Recomeço do Zero"
Este é o truque mais importante. Se o sistema envia uma pergunta para um robô e ele falha, e então decide escalar para um robô maior e mais inteligente, ele descarta a tentativa anterior que falhou.
Os pesquisadores descobriram algo surpreendente: se você mostrar ao robô grande as notas confusas e bagunçadas do robô pequeno que falhou, o robô grande também fica confuso! É como mostrar a página de rabiscos de um aluno com dificuldades para um aluno genial; o gênio pode começar a duvidar de si mesmo.
Ao dar ao robô grande um prompt limpo (uma folha em branco), o sistema mantém a precisão alta. Se eles tivessem apenas passado as notas da falha adiante, a precisão do robô grande teria caído 34,8 pontos percentuais em questões difíceis.

O Que Eles Descobriram

A equipe testou isso em problemas matemáticos (GSM8K) e perguntas de trivia complexas (HotpotQA). Aqui está o que aconteceu:

  • A Inflação é Real: Em perguntas de trivia difíceis, o modelo pequeno (Qwen2.5-7B) teve uma taxa de inflação de 4,25×. Isso significava que para cada dólar que você pensava estar gastando, estava na verdade gastando US$ 4,25 porque o robô continuava falhando.
  • Melhores Resultados por Menos Dinheiro: Quando definiram um orçamento fixo (um limite estrito de quantos tokens poderiam gastar), o novo sistema (InflationAgent) acertou 94,7% das respostas. O método popular antigo (FrugalGPT) acertou apenas 91,0%.
  • Economia de Tokens: Para alcançar a mesma precisão de 91,0% do método antigo, o novo sistema usou 31% menos tokens. Isso é uma economia massiva.
  • O Perigo de "Mais Tentativas": Eles descobriram que apenas dar mais chances para o robô pequeno tentar (até 10 vezes) não funcionava para sempre. Depois de um certo ponto, o robô ficava confuso pelas suas próprias falhas passadas, e sua precisão na verdade diminuía. Às vezes, é melhor mudar para um robô mais inteligente do que continuar batendo a cabeça contra a parede.

A Conclusão

Este artigo mostra que, no mundo da IA, "barato" nem sempre é barato. Se um modelo tem probabilidade de falhar e precisar tentar novamente e novamente, ele se torna caro e ineficiente. Ao medir o quão provável é que um modelo fique travado (usando a entropia do "teste de intuição") e ao começar do zero ao mudar para um modelo mais inteligente, podemos economizar dinheiro e obter melhores respostas.

Os autores estão confiantes nesses resultados com base em seus testes com conjuntos de dados específicos de matemática e trivia. Eles sugerem que, embora isso funcione muito bem para tarefas de raciocínio, ainda precisamos descobrir como aplicar isso a conversas mais abertas ou ferramentas. Mas, por enquanto, eles provaram que um pouco de planejamento inteligente vai longe para manter o orçamento da IA sob controle e evitar a inflação.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →