← Últimos artigos
💻 computer science

Beyond Prediction: Tail-Aware Scheduling for LLM Inference

Este artigo introduz um framework de escalonamento livre de predição e consciente da distribuição que utiliza o aumento de prioridade suave (soft priority boosting) e a preempção consciente de cache para reduzir significativamente a latência de cauda e o tempo para o primeiro token na inferência de LLMs, superando políticas tradicionais baseadas em predição mesmo sob condições desafiadoras como chegadas intermitentes (bursty arrivals) e pressão de memória de GPU.

Autores originais: Yueying Li, Yuanfan Chen, Jiayang Chen, Esha Choukse, Haoran Qiu, G. Edward Suh, Rodrigo Fonseca, Ziv Scully, Udit Gupta

Publicado 2026-06-19
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Yueying Li, Yuanfan Chen, Jiayang Chen, Esha Choukse, Haoran Qiu, G. Edward Suh, Rodrigo Fonseca, Ziv Scully, Udit Gupta

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine uma cozinha de restaurante movimentada onde os chefs (as GPUs) estão cozinhando refeições para os clientes (as requisições de IA). Algumas ordens são simples: "Apenas um copo de água" (uma mensagem de chat curta). Outras são complexas: "Projetar um romance de 50 páginas com um enredo detalhado" (uma tarefa de raciocínio longa).

O problema é que o gerente da cozinha não sabe quanto tempo qualquer pedido levará até que ele esteja quase pronto. Um "copo de água" pode se transformar em um "menu degustação de 10 pratos" se o cliente continuar pedindo mais.

O Jeito Antigo: Adivinhando o Futuro

Os atuais gerentes de cozinha tentam ser eficientes fazendo suposições sobre quanto tempo cada pedido levará. Eles usam uma estratégia chamada "Tarefa Mais Curta Primeiro" (SJF - Shortest Job First).

  • A Lógica: "Eu acho que este pedido será rápido, então vou cozinhá-lo primeiro para tirá-lo da mesa."
  • A Falha: Se o gerente errar o palpite (o que acontece frequentemente com tarefas complexas de IA), o pedido rápido é atrasado, e o pedido longo que deveria ser "curto" acaba dominando o fogão para sempre.
  • O Resultado: O tempo de espera médio parece aceitável, mas os tempos de espera do pior caso (a latência de cauda) são terríveis. Alguns clientes esperam horas enquanto outros são servidos em segundos. Isso é ruim para a experiência do usuário.

O Novo Jeito: O Sistema "Boost" (UNIBOOST)

Os autores deste artigo propõem um novo gerente que para de adivinhar e começa a observar. Eles chamam seu sistema de UNIBOOST.

Veja como funciona, usando analogias simples:

1. O "Soft Boost" (Sem Necessidade de Bolas de Cristal)

Em vez de tentar prever o futuro, o novo gerente dá a cada pedido uma "pontuação de prioridade" que muda suavemente ao longo do tempo.

  • A Analogia: Imagine uma fila de pessoas esperando por um brinquedo. O novo gerente não pergunta: "Até onde você vai?". Em vez disso, eles diz: "Quanto mais tempo você estiver esperando, mais o seu ingresso recebe um pequeno 'boost' de prioridade".
  • Como ajuda: Pedidos curtos são atendidos rapidamente porque chegam primeiro. Mas se um pedido longo estiver esperando há algum tempo, ele recebe um empurrãozinho gentil para frente, para que não fique preso atrás de um fluxo interminável de novos pedidos curtos. Isso evita que a "cauda longa" de clientes espere para sempre.

2. O "Guarda de Memória" (Não Desperdice a Panela)

Na IA, cozinhar uma refeição requer muita memória (o cache KV). Se você parar de cozinhar uma refeição no meio do caminho para trocar por uma nova, terá que jogar fora os ingredientes que acabou de preparar e começar do zero. Isso é caro e lento.

  • A Analogia: Imagine que um chef está no meio do preparo de um bolo enorme. Se o gerente gritar: "Pare! Cozinhe um biscoito!", o chef tem que raspar a massa do bolo da panela, lavá-la e começar o biscoito. Então, se eles voltarem para o bolo, terão que lavar a panela novamente.
  • A Solução: O novo gerente usa um "Guarda de Memória". Eles dizem: "Uma vez que você começar a cozinhar um bolo, deve terminar pelo menos uma 'fatia' dele antes que possamos sequer considerar a troca". Isso evita que a cozinha fique trocando de tarefas constantemente e desperdiçando tempo limpando panelas.

3. O "Termostato Adaptável"

As condições da cozinha mudam. Às vezes há uma correria de pedidos pequenos; outras vezes, há alguns pedidos massivos.

  • A Analogia: O gerente tem um termostato inteligente que observa há quanto tempo as pessoas estão realmente esperando. Se a fila ficar muito longa, o gerente ajusta automaticamente as configurações de "boost" para serem mais agressivas em ajudar as pessoas que estão esperando há mais tempo. Ele aprende sobre a hora sem precisar de uma bola de cristal.

Os Resultados

O artigo testou este novo sistema contra os antigos sistemas de "adivinhação" usando dados do mundo real (como tarefas de codificação e conversas de chat).

  • Os Sistemas Antigos: Quando a carga de trabalho ficava caótica (com picos de demanda), os sistemas de "adivinhação" falhavam. Os tempos de espera do pior caso (P99) tornavam-se enormes.
  • O Novo Sistema (UNIBOOST): Ele não apenas melhorou o tempo de espera médio; ele reduziu drasticamente os piores tempos de espera.
    • Reduziu o tempo de espera do pior caso (P99) em 35% a 50% em comparação com os melhores sistemas de "previsão perfeita".
    • Tornou o primeiro token aparecer (TTFT) de 34% a 47% mais rápido.

A Conclusão

O artigo argumenta que tentar prever quanto tempo uma tarefa de IA levará é frágil e frequentemente errado. Em vez disso, um sistema que reage ao tempo que as tarefas estão esperando, enquanto é cuidadoso para não desperdiçar memória ao trocar de tarefas com muita frequência, cria uma experiência muito mais justa e rápida para todos. Trata-se de gerenciar o fluxo da fila, não de adivinhar o destino.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →