Scalable Inference Architectures for Compound AI Systems: A Production Deployment Study
Este artigo apresenta um estudo de implantação em produção de uma arquitetura de inferência modular e agnóstica de plataforma na Salesforce que permite a entrega escalável, economicamente viável e de baixa latência de sistemas de IA compostos como Agentforce e ApexGuru, alcançando melhorias significativas no throughput, na latência de cauda e nos custos operacionais, ao mesmo tempo em que aborda desafios únicos como a distribuição de múltiplos modelos e os reinícios em cascata.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine que você administra um restaurante movimentado e de alto padrão chamado Agentforce. No passado, esse restaurante tinha uma única cozinha massiva (uma configuração "estática") onde um único chef tentava fazer tudo: picar legumes, grelhar bifes, assar sobremesas e lavar pratos. Se o restaurante ficava lotado, a cozinha ficava congestionada. Se o chef precisava fazer uma pausa para descansar (um "início frio"), todo o restaurante parava de servir comida. E, o pior de tudo, você tinha que pagar o salário do chef 24 horas por dia, 7 dias por semana, mesmo quando ninguém estava comendo.
Este artigo descreve como a Salesforce reestruturou seu "restaurante" para lidar com Sistemas de IA Compostos. Em vez de uma única cozinha grande, eles construíram uma rede de entrega de alimentos modular e sob demanda.
Veja como eles fizeram isso, explicado de forma simples:
1. O Problema: A Cozinha "Tamanho Único"
Aplicações modernas de IA (como Agentforce ou ApexGuru) são complexas. Quando um cliente faz uma pergunta, o sistema não pede apenas a um robô que responda. É mais como uma equipe de especialistas trabalhando juntos:
- Especialista A (Modelo de Embedding) consulta o histórico do cliente.
- Especialista B (LLM) escreve a resposta.
- Especialista C (Executor SQL) verifica o banco de dados.
- Especialista D (Classificador) decide o que o cliente realmente quer.
Na antiga configuração "estática", todos esses especialistas estavam presos na mesma sala, no mesmo hardware.
- O Gargalo: Se o especialista do banco de dados fosse lento, todo o pedido era atrasado.
- O Desperdício: Você tinha que manter todos os especialistas acordados e prontos 24/7, mesmo que apenas o especialista de "picar" fosse necessário às 3 da manhã.
- O Pesadelo do "Início Frio": Se o restaurante fechasse por uma hora e reabrisse, cada especialista tinha que acordar, esticar e preparar suas ferramentas. O cliente tinha que esperar o mais lento acordar antes de receber qualquer comida.
2. A Solução: Uma "Rede de Entrega Inteligente"
A Salesforce construiu uma nova arquitetura que atua como um serviço de entrega inteligente e dinâmico.
- O Recebedor de Pedidos (Serviço de Previsão): Quando um cliente faz um pedido, um despachante inteligente não envia o pedido para uma única cozinha grande. Em vez disso, ele divide o pedido em partes e as envia para os especialistas específicos mais adequados para a tarefa.
- Escalonamento Independente: Se 100 pessoas pedirem "bife" (chamadas de LLM), o sistema contrata instantaneamente 100 chefs de bife. Se apenas 5 pessoas pedirem "salada" (chamadas de embedding), ele contrata apenas 5 chefs de salada. Eles não disputam espaço na mesma cozinha.
- Serverless (Pague pelo Uso): Os especialistas não ficam sentados em um prédio esperando pedidos. Eles são "trabalhadores em nuvem" que só aparecem quando um pedido chega e saem quando terminam. Você só paga pelos minutos em que eles realmente trabalham.
3. Resolvendo o Problema do "Acordar" (Inícios Frios em Cascata)
O artigo descobriu um problema complicado: em um sistema composto, os especialistas dependem uns dos outros. O Especialista A deve terminar antes que o Especialista B possa começar.
- O Jeito Antigo: Se o restaurante reabrisse, o Especialista A acordaria (30 segundos), depois o Especialista B acordaria (150 segundos), depois o Especialista C acordaria (20 segundos). O cliente esperaria 180 segundos no total.
- O Novo Truque de "Pré-Aquecimento": O sistema é inteligente o suficiente para conhecer a receita. Assim que o Especialista A é chamado, o sistema simultaneamente acorda os Especialistas B e C em segundo plano.
- O Resultado: Em vez de esperar 180 segundos, o cliente espera apenas cerca de 65 segundos. O artigo diz que isso reduziu o tempo de "acordar" em 65%.
4. Os Resultados: Mais Rápido, Mais Barato e Mais Suave
Após operar esse novo sistema por mais de um ano com clientes reais, eis o que aconteceu:
- Velocidade: A "latência de cauda" (o tempo de espera no pior caso para clientes lentos) caiu 50%. Pedidos que antes levavam 37 segundos agora levam cerca de 10–11 segundos.
- Capacidade: O sistema pode lidar com 3,9 vezes mais pedidos ao mesmo tempo em comparação com a antiga cozinha.
- Custo: Como deixaram de pagar por trabalhadores ociosos, economizaram 30–40% nos custos.
- Confiabilidade: Se um especialista ficar doente (falhar), o sistema não fecha todo o restaurante. Ele apenas redireciona o pedido ao redor dessa pessoa (por exemplo, "Não podemos verificar o banco de dados, então vamos apenas dar uma resposta geral"). O restaurante permanece aberto 95% do tempo, mesmo quando partes quebram.
5. Lições Principais Aprendidas (Os "Segredos do Chef")
Os autores compartilharam algumas grandes conclusões para qualquer pessoa construindo esses sistemas:
- Inícios frios se multiplicam, não apenas se somam. Se você tem uma cadeia de tarefas, o tempo de espera se acumula. Você precisa acordar toda a cadeia de uma vez, não uma por uma.
- Observe todo o pipeline, não apenas trabalhadores individuais. Um trabalhador pode ser rápido por si só, mas se estiver preso esperando por alguém, todo o pedido fica lento. Você precisa ver o "quadro geral" do pedido.
- Teste peças individualmente. Como o sistema é modular, você pode trocar apenas o "chef de salada" por um novo, sem demitir o "chef de bife". Isso permite que eles melhorem seus modelos de IA em dias em vez de semanas.
- Degradação graciosa é melhor que perfeição. Se uma pequena parte do sistema falhar, todo o sistema não deve travar. É melhor dar uma resposta ligeiramente menos detalhada do que não dar nenhuma resposta.
Resumo
Este artigo trata da transição de uma configuração de IA rígida, cara e de "uma única cozinha" para uma rede flexível, estilo "economia de bicos". Ao tratar cada ferramenta de IA como um trabalhador separado e sob demanda que pode ser dimensionado para cima ou para baixo instantaneamente, a Salesforce tornou seus agentes de IA mais rápidos, mais baratos e muito mais confiáveis para milhares de usuários empresariais.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.