← Últimos artigos
💻 computer science

Astrolabe: Balancing Load in LLM Serving with Randomized Prediction-Guided Scheduling

O Astrolabe é um escalonador de múltiplas instâncias para o serviço de LLM guiado por predição aleatória que alcança um balanceamento de carga superior e latência reduzida ao combinar estimativa de comprimento de resposta, predição de latência baseada em simulação e uma política de despacho de escolha de potência de dois, eliminando, assim, a necessidade de rebalanceamento baseado em migração custoso.

Autores originais: Wei Da, Evangelia Kalyvianaki

Publicado 2026-08-12
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Wei Da, Evangelia Kalyvianaki

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está administrando uma confeitaria massiva e de alta tecnologia que se especializa em assar "bolos de pensamento" para milhões de clientes ao mesmo tempo. Nesta confeitaria, os fornos são incrivelmente potentes, mas as receitas são complicadas. Às vezes, um cliente pede um biscoito simples (uma resposta curta) e, às vezes, ele pede um bolo de casamento de dez camadas (uma resposta longa e complexa). O problema é que os padeiros (os computadores) não sabem o tamanho do bolo até começarem a assá-lo. Se um padeiro ficar preso com um pedido enorme enquanto todos os outros estão ociosos, a fila acumula e os clientes ficam irritados.

Para resolver isso, muitas confeitarias costumavam ter um "corredor" que corria entre os fornos, pegando bolos sem assar totalmente e movendo-os para um forno mais livre se um ficasse muito ocupado. Isso é chamado de "migração". Mas, no mundo da inteligência artificial, mover esses bolos meio assados é problemático e lento. É como tentar carregar um bolo gigante, frágil e meio congelado através de uma sala lotada sem deixá-lo cair; isso consome muita energia, entope os corredores e, muitas vezes, torna a confeitaria inteira mais lenta. Este artigo, intitulado "Astrolabe", faz uma pergunta ousada: E se não precisássemos mover os bolos de jeito nenhum? E se pudéssemos apenas adivinhar o tamanho do pedido antes mesmo de ele chegar ao forno e enviá-lo para o padeiro certo imediatamente?

Os autores deste artigo, Wei Da e Evangelia Kalyvianaki, da Universidade de Cambridge, construíram um novo sistema chamado Astrolabe para resolver exatamente este problema. Eles descobriram que, em vez de correr freneticamente de um lado para o outro para redistribuir o trabalho, você pode usar um "jogo de adivinhação" inteligente para enviar os pedidos para o lugar certo instantaneamente.

Eis como o Astrolabe funciona, usando um simples jogo de azar. Imagine que você tem uma dúzia de padeiros. Quando um novo pedido chega, em vez de perguntar a cada um dos padeiros o quão ocupados estão (o que leva muito tempo) ou apenas escolher um ao acaso (o que é arriscado), o sistema escolhe dois padeiros aleatoriamente. Ele pergunta rapidamente a eles: "Se você aceitasse este pedido agora, quanto tempo levaria?". Um deles pode dizer: "Cerca de 10 segundos", e o outro pode dizer: "Cerca de 50 segundos". O sistema escolhe instantaneamente o padeiro de 10 segundos e envia o pedido para lá.

Este truque é chamado de "poder de duas escolhas" (power-of-two choices). É como entrar em uma cafeteria lotada e escolher a fila mais curta apenas verificando duas filas, em vez de escanear todo o ambiente. O artigo mostra que essa verificação aleatória simples é surpreendentemente poderosa. Ao combinar isso com uma "bola de cristal" (um modelo de previsão) que adivinha quanto tempo a resposta da IA levará, o Astrolabe consegue rotear as solicitações para o melhor padeiro antes mesmo que a fila comece a se formar.

Os resultados são bastante impressionantes. Em seus testes, o Astrolabe conseguiu lidar com o mesmo número de solicitações que o antigo método do "corredor" (migração), mas sem o overhead desordenado de mover dados por aí. Na verdade, quando a confeitaria ficava superlotada, o antigo método começava a colapsar, com os tempos de espera saltando de segundos para minutos. O Astrolabe, no entanto, mantinha tudo fluido. Ele reduziu o tempo necessário para obter a primeira palavra de uma resposta em até 77% em alguns casos e diminuiu o número de vezes que os pedidos tinham que ser interrompidos e reiniciados em cerca de 6 vezes em comparação com a concorrência.

O artigo também testou o que acontece se a "bola de cristal" não for perfeita. Mesmo quando as previsões eram um pouco imprecisas (o que acontece na vida real), o sistema ainda funcionava melhor do que os métodos antigos. Acontece que, como o sistema compara apenas dois padeiros de cada vez, pequenos erros de previsão não importam tanto quanto se pensaria. Se ambos os padeiros forem previstos como lentos, o sistema apenas escolhe o "menos lento", e a matemática ainda funciona.

Os autores também verificaram se isso funcionaria se mudassem o tipo de forno ou o tipo de bolo sendo assado. Eles testaram diferentes modelos e diferentes configurações, e o Astrolabe continuou vencendo. Parece que esta abordagem de "adivinhar e verificar" é uma forma robusta de manter os sistemas de IA funcionando rapidamente, mesmo quando a carga de trabalho é caótica e imprevisível.

Em resumo, o artigo sugere que não precisamos construir sistemas complexos e pesados para mover o trabalho e equilibrar a carga. Em vez disso, um pouco de aleatoriedade e uma boa suposição sobre o futuro podem fazer o trabalho de forma muito mais rápida e eficiente. É um lembrete de que, às vezes, a maneira mais inteligente de gerenciar uma multidão não é microgerenciar cada pessoa, mas dar a elas algumas boas opções e deixá-las escolher o melhor caminho.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →