Observation, Not Prediction: Conversation-Level Disaggregated Scheduling for Agentic Serving
O artigo apresenta o ConServe, um framework de escalonamento que desloca a unidade de escalonamento de turnos individuais para conversas inteiras para eliminar a necessidade de prever custos futuros desconhecidos, reduzindo assim a latência e melhorando a eficiência energética ao aproveitar uma estrutura estável de duas fases de prefill limitado por computação e decoding limitado por memória.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine que você administra uma cozinha de um restaurante movimentado. Antigamente, cada pedido era simples: um cliente entra, você prepara a refeição e ele vai embora. Você conseguia gerenciar a cozinha facilmente porque cada pedido levava aproximadamente o mesmo tempo e esforço.
Mas agora, imagine que seus clientes são "Agentes de IA". Eles não apenas pedem uma refeição; eles iniciam um projeto complexo.
- A Primeira Rodada (O Grande Briefing): O cliente senta-se e entrega a você um manual de instruções massivo de 50 páginas. Isso leva muito tempo para ler e entender (o "Prefill").
- As Rodadas Intermediárias (As Chamadas de Ferramenta): O chef começa a cozinhar, depois para para ligar para um fornecedor, esperar uma resposta, verificar uma receita e ligar de volta. Essas etapas são curtas, mas acontecem repetidamente.
- A Rodada Final (O Resultado): Finalmente, o prato está pronto para ser servido.
O Problema: A Velha Forma de Agendamento
Os atuais gerentes de cozinha (sistemas de IA) tratam cada etapa individual como um pedido separado. Toda vez que o chef para para ligar para um fornecedor, o gerente tem que decidir: "Eu deixo o chef terminar esta etapa aqui mesmo na cozinha principal, ou eu envio esta etapa específica para uma estação diferente e especializada?"
O problema é que o gerente tem que adivinhar quanto tempo aquela etapa levará ou quanta memória ela precisará antes que ela aconteça. Se ele adivinhar errado, ele envia a etapa para a estação errada, causando um congestionamento. É como um guarda de trânsito tentando direcionar carros prevendo exatamente a velocidade de cada motorista antes mesmo de eles começarem a se mover.
A Solução: ConServe (A Abordagem ao Nível da Conversa)
O artigo apresenta um novo sistema chamado ConServe. Em vez de gerenciar cada etapa separadamente, o ConServe gerencia a conversa inteira como uma única unidade.
Aqui está como o ConServe muda as regras usando um plano de duas fases:
Fase 1: O Trabalho Pesado (O Prefill)
Quando o cliente chega pela primeira vez com aquele manual de 50 páginas, o ConServe o envia imediatamente para uma estação de alta potência e super rápida (uma GPU poderosa). Esta estação foi construída especificamente para ler documentos enormes rapidamente. Ela lê o manual, entende o contexto e cria um "mapa de memória" (chamado de cache KV) de tudo o que é necessário.
F Fase 2: A Cauda Longa (O Restante da Conversa)
Uma vez que esse mapa inicial é feito, o ConServe diz: "Ok, o trabalho pesado está feito. Agora, toda esta conversa pertence a uma estação específica, menor e mais eficiente em termos de energia."
- O "mapa de memória" é movido exatamente uma vez para esta nova estação.
- A partir desse momento, cada etapa de acompanhamento (as chamadas de ferramenta, as atualizações curtas) acontece ali mesmo, na mesma estação.
- O sistema nunca mais adivinha. Não importa se a próxima etapa é curta ou longa; a conversa permanece fixada nessa mesma estação até que o trabalho seja concluído.
Por que isso é melhor (A Analogia)
Pense nisso como um caminhão de entrega:
- A Velha Forma: Você tenta prever se o próximo pacote é pesado ou leve. Se você errar o palpite, envia um caminhão pequeno para uma carga pesada, ou um caminhão grande para um pacote minúsculo. Você desperdiça combustível e tempo.
- ConServe: Você carrega o caminhão uma vez no início. Você dirige o caminhão até o destino e o estaciona lá. Todos os pacotes subsequentes para esse cliente específico são carregados nesse mesmo caminhão. Você não precisa prever o peso do próximo pacote; você apenas mantém o caminhão funcionando de forma eficiente.
Os Resultados
O artigo testou isso em cargas de trabalho reais de agentes de IA e descobriu que:
- Velocidade: Reduziu o tempo que o cliente leva para ver o primeiro resultado real (não apenas uma chamada de ferramenta) em 51%. É como receber sua comida 50% mais rápido porque a cozinha não está confusa sobre onde colocar os ingredientes.
- Eficiência: Economizou 7,5% de energia. Ao usar uma estação poderosa apenas para a leitura inicial intensa e uma estação mais barata para o restante, ele desperdiça menos eletricidade.
- Confiabilidade: Como o sistema não precisa adivinhar (prever) o que acontecerá a seguir, ele nunca comete erros de "direção errada". Os sistemas antigos travariam ou ficariam lentos se suas previsões estivessem erradas; o ConServe simplesmente continua, pois depende do que ele pode realmente ver agora.
Em resumo: O ConServe para de tentar prever o futuro de cada pequena etapa em uma conversa de IA. Em vez disso, trata a conversa inteira como um único trabalho, lida com o início pesado com um motor potente e deixa um motor constante e eficiente terminar o resto.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.