← Últimos artigos
🤖 AI

The Harness Effect: How Orchestration Design Sets the Token Economics of Enterprise Agentic AI

Este artigo argumenta que otimizar a camada de orquestração (o "harness") é mais crítico do que a seleção do modelo para controlar os custos de IA Agêntica empresarial, demonstrando através de um estudo controlado que um harness superior pode reduzir o uso de tokens em 38% e os custos em 41% através de diversos modelos, mantendo ou melhorando a qualidade da tarefa.

Autores originais: Muayad Sayed Ali, Aliaksandra Novik, Anji Boddupally, Artem Yavorskyi, Chris Nickerson, Daniel Rica, Emily DuGranrut, Felix Leung, Garrett Prince, Grace Barnett, Heath Robinson, Hosain Al Ahmad, Jesse
Publicado 2026-07-09
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Muayad Sayed Ali, Aliaksandra Novik, Anji Boddupally, Artem Yavorskyi, Chris Nickerson, Daniel Rica, Emily DuGranrut, Felix Leung, Garrett Prince, Grace Barnett, Heath Robinson, Hosain Al Ahmad, Jesse Resnick, Juan Carlos Farah, Jyothi Swaroop Meruga, Leonid Kuznetsov, Luke Gorham, Marie Schmoll, Michael Paciullo, Saumya Das, Sharath Sheripally, Tommy Griscom, Mykyta Osadchyi, Neha Mantri, Nick Westrum, Olivia Benowitz, Parikshith Kulkarni, Radik Chernyshov, Rakshith Vasudev, Rohith Nadimpally, Vikas Gangadevi, Waseem AlShikh

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está administrando um restaurante movimentado. Neste restaurante, os chefs são os modelos de IA (como Claude, Gemini ou Qwen), e os pedidos são as tarefas que você quer que eles realizem.

Por muito tempo, a indústria de restaurantes tem se obcecado em contratar "super-chefs" que possam pensar de forma mais profunda e rápida. Mas há um problema: mesmo com os melhores chefs, os garçons (o software que gerencia os pedidos) têm sido incrivelmente ineficientes.

Este artigo, escrito por uma equipe da Writer, Inc., argumenta que o verdadeiro segredo para economizar dinheiro e tempo não é apenas comprar um chef melhor. É sobre consertar os garçons. Eles chamam esse conserto de "Harness" (Arreio/Estrutura).

Aqui está a história do que eles descobriram, explicada de forma simples:

1. O Problema: "Token Maxing" (O Garçom Glutão)

No mundo da IA, "tokens" são como a moeda que você paga por cada palavra que a IA lê ou escreve.

  • O Jeito Antigo: Imagine um garçom que, toda vez que o chef precisa pensar, traz de volta para a cozinha o histórico inteiro do dia do restaurante (cada pedido, cada conversa, cada item do menu). Se o chef pede uma segunda opinião, o garçom traz o histórico inteiro novamente.
  • O Resultado: A cozinha fica sobrecarregada de papel. O chef passa todo o seu tempo lendo notas antigas em vez de cozinhar. Você acaba pagando uma fortuna em "tokens" apenas para manter o garçom ocupado. Os autores chamam isso de "Token Maxing": você continua comprando mais tokens esperando por melhores resultados, mas está apenas pagando para o garçom carregar peso demais.

2. A Solução: O "Harness" (O Garçom Inteligente)

Os autores construíram um novo tipo de sistema de garçom chamado Writer Agent Harness. Em vez de despejar tudo sobre o chef, este sistema é inteligente sobre o que traz para a cozinha.

Pense nisso como um sistema de arquivamento inteligente:

  • A Pasta "Estável": O garçom mantém as coisas que nunca mudam (como o menu e a identidade do chef) em uma pasta especial e trancada que a cozinha pode consultar instantaneamente sem pagar extra.
  • A Pasta "Volátil": As coisas que mudam a cada segundo (como a hora atual ou um pedido específico de um cliente) são mantidas em um bloco de notas pequeno e atualizado.
  • O Truque do "Resumo": Se a conversa ficar muito longa, o garçom não traz o livro inteiro. Eles escrevem um resumo de uma página sobre o que aconteceu antes e trazem apenas isso.
  • O Truque da "Delegação": Se uma tarefa é muito grande, o garçom principal não tenta fazer tudo sozinho. Eles enviam um ajudante menor e especializado para fazer uma parte dela e trazem apenas a resposta final.

3. O Grande Experimento

Para provar que isso funciona, os autores realizaram um teste justo. Eles pegaram seis chefs de IA de alto nível diferentes (de diferentes empresas) e deram a eles as mesmas 22 tarefas difíceis.

  • Grupo A: Usou o "Jeito Antigo" (o garçom ineficiente).
  • Grupo B: Usou o "Harness" (o garçom inteligente).
  • A Regra: Os chefs eram exatamente os mesmos. As tarefas eram exatamente as mesmas. A única coisa que mudou foi o garçom.

4. Os Resultados: Um Milagre de Eficiência

Os resultados foram chocantes. Ao apenas mudar o garçom (o Harness), eles obtiveram melhorias massivas em todos os aspectos:

  • Custo: A conta caiu 41%. Custou quase metade do preço para fazer o mesmo trabalho.
  • Velocidade: As tarefas terminaram 44% mais rápido.
  • Uso de Tokens: Eles usaram 38% menos tokens.
  • Qualidade: A qualidade da comida (a resposta) permaneceu a mesma, ou até melhorou ligeiramente.

A parte mais surpreendente? Não importava qual chef você contratasse. Quer você usasse o chef mais caro e poderoso ou um mais barato e rápido, o "Garçom Inteligente" os tornou todos mais baratos e rápidos. Na verdade, consertar o garçolo economizou mais dinheiro do que trocar o chef mais caro pelo mais barato faria!

5. A "Alavancagem do Harness"

O artigo encontrou um padrão interessante: quanto melhor era o chef para começar, mais eles se beneficiavam do garçom inteligente.

  • Um super-chef inteligente + um garçom inteligente = Resultados incríveis.
  • Um chef mais fraco + um garçom inteligente = Ainda é bom, mas eles podem ficar um pouco confusos se o garçom tentar fazer dele muita delegação complexa.

A Conclusão

Por muito tempo, as empresas pensaram que a única maneira de obter uma IA melhor era comprar modelos mais poderosos. Este artigo diz: Pare.

A maior alavanca que você pode puxar é como você organiza o trabalho. Se você construir um "Harness" inteligente que gerencia o contexto, faz o cache das partes entediantes e delega o trabalho pesado, você pode obter os mesmos (ou melhores) resultados pela metade do preço, independentemente de qual modelo de IA você use.

Não se trata de ter o maior motor; trata-se de ter a melhor transmissão.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →