← Últimos artigos
💻 computer science

Compiling Agentic Workflows into LLM Weights: Near-Frontier Quality at Two Orders of Magnitude Less Cost

Este artigo argumenta que compilar fluxos de trabalho agentes diretamente nos pesos de modelos pequenos e ajustados ("agentes subterrâneos") oferece uma alternativa econômica, privada e eficiente em termos de contexto aos frameworks de orquestração externa predominantes, demonstrando qualidade próxima à fronteira em diversas tarefas complexas enquanto supera barreiras-chave de adoção.

Autores originais: Simon Dennis, Rivaan Patil, Kevin Shabahang, Hao Guo

Publicado 2026-05-22
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Simon Dennis, Rivaan Patil, Kevin Shabahang, Hao Guo

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

A Grande Ideia: Assar a Receita no Chef

Imagine que você está tentando realizar uma tarefa complexa, como reservar uma viagem complicada ou consertar uma máquina quebrada. Atualmente, a maioria das empresas usa um sistema de "Gerente e Funcionário" (chamado de Orquestração de Agentes).

  • O Jeito Atual (O Gerente): Você tem um "Gerente" muito inteligente e caro (um modelo de IA de ponta). Toda vez que o "Funcionário" (a IA conversando com você) precisa tomar uma decisão, o Gerente para, lê um livro de regras gigante, diz ao Funcionário o que fazer a seguir e depois espera a resposta do Funcionário. Isso acontece repetidamente. É lento, caro e o Gerente precisa ler todo o livro de regras a cada vez.
  • O Novo Jeito (O Agente Subterrâneo): Os autores propõem uma abordagem diferente: Compilar o procedimento nos pesos. Imagine pegar aquele livro de regras gigante e assá-lo diretamente no cérebro do Funcionário. Agora, o Funcionário é o especialista. Ele não precisa de um Gerente para dizer o que fazer a seguir; ele simplesmente conhece o fluxo naturalmente. Ele se torna um "Agente Subterrâneo" — um especialista que trabalha de dentro para fora.

O artigo pergunta: Assar as regras em uma IA menor e mais barata é realmente tão bom quanto usar um Gerente gigante e caro?

Os Três Obstáculos (E Como Eles os Superaram)

Os autores pensaram que as pessoas não estavam fazendo isso por causa de três grandes medos. Eles testaram esses medos em três cenários do mundo real: Reserva de Viagens, Suporte Técnico do Zoom e Sinistros de Seguros.

1. O Medo da Qualidade: "Um cérebro pequeno será tão inteligente quanto um cérebro grande?"

  • O Medo: As pessoas pensavam que uma IA pequena e barata (3 bilhões ou 8 bilhões de parâmetros) não conseguiria lidar com etapas complexas tão bem quanto uma IA massiva e cara (como as usadas por grandes empresas de tecnologia).
  • O Resultado: Surpreendentemente, a IA pequena fez quase tão bem quanto a grande.
    • Em Viagens, a IA pequena foi ligeiramente menos "educada" ou "graciosa" do que a grande, mas fez o trabalho corretamente.
    • No Suporte do Zoom e em Seguros (que são muito mais difíceis), eles atualizaram a IA pequena para uma versão ligeiramente maior (8 bilhões). Essa versão igualou a IA grande e cara em quase todas as métricas.
    • A Analogia: É como contratar um mecânico local e experiente (a IA pequena) versus trazer uma equipe de corrida mundialmente famosa (a IA grande). Para consertar seus problemas diários de carro, o mecânico local é 90–98% tão bom, mas custa uma fração do preço.

2. O Medo do Custo: "É realmente mais barato executar isso?"

  • O Medo: As pessoas pensavam que, mesmo que a IA pequena seja barata de treinar, executá-la ainda poderia ser caro porque você teria que pagar pela capacidade de computação.
  • O Resultado: É massivamente mais barato.
    • O sistema de "Gerente" precisa chamar uma API muito cara para cada frase que a IA diz.
    • O sistema "Assado" roda em um servidor de computador padrão (hospedado internamente).
    • A Matemática: O novo método é 128 a 462 vezes mais barato por conversa.
    • A Analogia: O jeito antigo é como pagar a um motorista de táxi US$ 50 toda vez que você pedir para ele virar o volante. O jeito novo é como comprar um carro por US$ 1.000 e dirigí-lo você mesmo. Quanto mais você dirige (mais complexa for a tarefa), mais dinheiro você economiza.

3. O Medo da Flexibilidade: "E se as regras mudarem? Preciso re-treinar por meses?"

  • O Medo: As pessoas pensavam que, se a segurança mudasse um formulário ou a agência de viagens mudasse uma política, você teria que esperar semanas para re-treinar a IA.
  • O Resultado: É rápido.
    • Mudar as regras e re-treinar a IA leva 30 a 50 minutos em hardware padrão.
    • A Analogia: Não é como reconstruir uma casa do zero; é mais como atualizar o software do seu telefone. Você pode fazer isso no tempo que leva para preparar uma cafeteira.

Como Funciona (O Fluxo "Subterrâneo")

O processo é surpreendentemente simples:

  1. Desenhe o Mapa: Você desenha um fluxograma de como a conversa deve acontecer (ex: "Pedir datas" -> "Verificar orçamento" -> "Mostrar opções").
  2. Simulação: Uma IA superinteligente (o "Professor") percorre esse mapa milhares de vezes, criando conversas falsas.
  3. Asse o Cérebro: Você ensina uma IA menor com essas conversas falsas. A IA aprende o padrão da conversa, não apenas as palavras.
  4. Vá ao Vivo: Você implanta a IA pequena. Ela não precisa mais do fluxograma; o fluxograma agora faz parte da memória dela. Ela conversa diretamente com você.

O Veredito

O artigo conclui que, para tarefas com etapas claras (como reservas, suporte ou sinistros), você não precisa de um Gerente.

  • Estrutura Persistente pertence aos pesos: As regras do jogo devem ser assadas no cérebro da IA.
  • Estado Transitório pertence ao prompt: Os detalhes específicos da sua viagem ou da sua chamada do Zoom quebrada devem ser informados à IA na conversa.

Ao mover as regras do "Gerente" para o "cérebro do Funcionário", você obtém qualidade quase perfeita com dois ordens de magnitude (100x) menos custo, com a capacidade de atualizar as regras em menos de uma hora.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →