← Últimos artigos
💻 computer science

Towards Scalable Customization and Deployment of Multi-Agent Systems for Enterprise Applications

Este artigo propõe um framework unificado de dois estágios que combina técnicas avançadas de customização de modelos com otimizações de inferência, como decodificação especulativa e quantização FP8, para permitir a implantação escalável, econômica e robusta de sistemas multiagentes baseados em LLM para aplicações empresariais, alcançando um aumento de 4,48x na velocidade de throughput.

Autores originais: Paresh Dashore, Shreyas Kulkarni, Uttam Gurram, Nadia Bathaee, Kartik Balasubramaniam, Genta Indra Winata, Sambit Sahu, Shi-Xiong Zhang

Publicado 2026-06-19
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Paresh Dashore, Shreyas Kulkarni, Uttam Gurram, Nadia Bathaee, Kartik Balasubramaniam, Genta Indra Winata, Sambit Sahu, Shi-Xiong Zhang

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você gerencia uma concessionária de carros de luxo e muito movimentada. Você tem uma equipe de cinco especialistas brilhantes e especializados (um Sistema Multiagente) que trabalham juntos para ajudar um cliente a agendar um test-drive.

  1. O Compreendedor ouve o que o cliente deseja.
  2. O Planejador define os melhores passos a serem tomados.
  3. O Avaliador atua como um guarda de segurança, verificando se o plano é seguro e lógico.
  4. O Executor efetivamente agenda o compromisso.
  5. O Explicador conta ao cliente os detalhes finais.

No passado, essa equipe era comandada por um "Superespecialista" (um modelo de IA massivo). Embora o Superespecialista fosse incrivelmente inteligente, ele era lento, caro para contratar e ocupava um enorme espaço de escritório (poder computacional). Se um cliente fizesse uma pergunta complexa, a equipe tinha que chamar o Superespecialista cinco vezes separadamente, causando longos tempos de espera e contas altas.

Os autores deste artigo (da Capital One) queriam manter a inteligência da equipe, mas torná-la mais rápida, barata e fácil de operar. Eles fizeram isso em duas fases principais: Treinando um Novo Estagiário e Otimizando o Fluxo de Trabalho.

Fase 1: Treinando um Novo Estagiário (Customização de Modelo Agêntico)

Em vez de depender do lento Superespecialista para cada tarefa, eles decidiram treinar um "Estagiário" menor e mais rápido (um modelo de IA compacto) para fazer o trabalho. Mas eles não deram apenas um livro didático ao Estagiário; eles usaram um campo de treinamento de três etapas muito inteligente:

  • Etapa 1: O Curso Intensivo de Contexto (Pré-treinamento Contínuo):
    Normalmente, quando você ensina um novo funcionário sobre uma indústria específica (como venda de carros), ele pode esquecer como falar o inglês normal ou perder sua inteligência geral. Para corrigir isso, os autores deram ao Estagiário "pistas contextuais" antes de cada lição. Imagine ler um capítulo de um livro, mas, antes de começar, ler um resumo rápido do capítulo anterior. Isso manteve o Estagiário fluido e evitou que ele esquecesse suas habilidades gerais enquanto aprendia as regras da concessionária.

  • Etapa 2: Observando o Mestre (Ajuste Fino Supervisionado):
    O Estagiário observou o Superespecialista lidar com milhares de conversas reais de clientes. No entanto, o Superespecialista às vezes cometia pequenos erros ou dava respostas que eram tecnicamente corretas, mas não perfeitas. Para corrigir isso, eles usaram um "Juiz" de IA ainda mais inteligente para revisar o trabalho do Superespecialista e reescrever as respostas para que fossem perfeitas. O Estagiário então aprendeu com essas respostas reescritas perfeitas, não com as brutas.

  • Etapa 3: Aprendendo o que os Clientes Realmente Gostam (Otimização de Preferência):
    Às vezes, existem duas maneiras de responder a uma pergunta. Uma é segura e a outra é arriscada. O Estagiário precisava aprender qual delas o cliente prefere. A equipe mostrou ao Estagiário pares de respostas: "Esta é boa (Escolhida)" vs. "Esta é ruim (Rejeitada)". O Estagiário aprendeu a escolher o caminho "Escolhido", alinhando seu comportamento com o que a empresa realmente queria.

O Resultado: Eles agora tinham um Estagiário pequeno e rápido que era tão bom no trabalho quanto o gigante Superespecialista, mas era muito mais leve e fácil de gerenciar.

Fase 2: Turbinando o Fluxo de Trabalho (Otimização de Inferência)

Mesmo com um Estagiário rápido, o sistema ainda era um pouco lento devido à forma como o computador processava a informação. Eles adicionaram dois "impulsos de turbo":

  • O Truque do "Adivinha e Verifica" (Decodificação Especulativa):
    Normalmente, a IA escreve uma palavra por vez, verificando seu trabalho após cada única letra. Isso é como digitar uma frase uma letra por vez e apertar "Enter" após cada uma.
    Os autores adicionaram um "Assistente de Rascunho" (uma IA muito pequena) que adivinha as próximas palavras antes de o Estagiário principal escrevê-las. O Estagiário principal então verifica rapidamente se essas suposições estão certas. Se estiverem, ele aceita todas de uma vez. É como se o Assistente de Rascunho escrevesse a frase inteira em um guardanapo, e o Estagiário apenas carimbasse "Aprovado" nela. Isso economiza uma quantidade massiva de tempo.

  • O "Uniforme Leve" (Quantização FP8):
    Os modelos de IA geralmente usam "roupas pesadas" (números de alta precisão matemática) que ocupam muita memória. Os autores trocaram essas roupas pesadas por "uniformes leves" (um tipo específico de matemática comprimida chamada FP8). Isso fez com que o modelo usasse metade da memória e rodasse duas vezes mais rápido, sem que o Estagiário esquecesse como fazer o trabalho.

O Resultado Final

Ao combinar o Estagiário Inteligente com o truque de "Adivinha e Verifica" e o "Uniforme Leve", a equipe alcançou algo incrível:

  • Velocidade: O sistema é agora 4,48 vezes mais rápido do que a configuração original.
  • Qualidade: O novo sistema não ficou mais burro; ele na verdade lidou com situações complexas e complicadas (como conversas longas ou pedidos incomuns) ainda melhor do que o modelo gigante original.
  • Custo: Como é mais rápido e usa menos memória, custa muito menos para operar.

A Grande Lição:
Este artigo nos ensina que você não precisa de um cérebro gigante e lento para resolver problemas complexos. Se você treinar um cérebro menor cuidadosamente (usando os dados e métodos de ensino corretos) e lhe der as ferramentas certas (como o truque de "Adivinha e Verifica"), você pode construir um sistema que é ao mesmo tempo incrivelmente rápido e incrivelmente inteligente. Trata-se de trabalhar de forma mais inteligente, não apenas de forma mais árdua.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →