← Últimos artigos
🤖 AI

Position: LLM Serving Needs Mathematical Optimization and Algorithmic Foundations, Not Just Heuristics

Este artigo de posição argumenta que o atendimento de inferência de LLMs superou heurísticas genéricas e exige o desenvolvimento de modelos de otimização matemática e fundamentos algorítmicos adaptados às suas características únicas para garantir garantias de desempenho comprováveis em diversas cargas de trabalho.

Autores originais: Zijie Zhou

Publicado 2026-05-06
📖 6 min de leitura🧠 Leitura aprofundada

Autores originais: Zijie Zhou

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está gerenciando uma cozinha de restaurante massiva e de alta velocidade. Esta cozinha não apenas prepara hambúrgueres; ela cria refeições complexas de vários pratos com base em pedidos que chegam um por um. O problema? Você não sabe quanto tempo cada refeição levará para ser preparada, e quanto mais o chef cozinha, mais espaço no balcão a refeição ocupa, sufocando outros pedidos.

Esta é exatamente a situação dos Modelos de Linguagem de Grande Escala (LLMs) hoje. Eles são as "cozinhas" que alimentam motores de busca, assistentes de programação e chatbots.

O artigo argumenta que, atualmente, essas cozinhas digitais estão operando com base em adivinhações e regras simples (heurísticas). O autor acredita que é hora de mudar para precisão matemática e fundamentos algorítmicos sólidos para torná-las mais rápidas, baratas e confiáveis.

Aqui está a análise do argumento do artigo usando analogias do cotidiano:

1. O Problema: Regras "Bastante Boas" Estão Falhando

Atualmente, sistemas como vLLM e SGLang (o software que executa esses modelos) usam regras antiquadas emprestadas da computação geral.

  • A Fila: Se você tem uma fila de clientes, a cozinha atende apenas na ordem em que chegaram (Primeiro a Chegar, Primeiro a Ser Atendido).
  • O Roteamento: Se você tem vários chefs, a cozinha envia o próximo pedido ao chef com a fila mais curta, ou simplesmente gira uma roda para escolher um.
  • A Limpeza: Se o balcão fica cheio, a cozinha joga fora o item mais antigo no balcão para fazer espaço para um novo.

O Ponto do Artigo: Essas regras funcionam bem para um restaurante de hambúrgueres padrão. Mas os LLMs são estranhos.

  • A Refeição "Crescente": Diferente de um hambúrguer que ocupa o mesmo espaço do início ao fim, uma refeição de LLM cresce enquanto é preparada. Cada palavra que a IA gera ocupa mais memória.
  • A Cozimento em "Duas Fases": A primeira parte do pedido (ler o prompt) é rápida e requer muita capacidade de processamento (computação). A segunda parte (gerar a resposta) é lenta e requer muita largura de banda de memória.
  • O Desconhecido: A cozinha não sabe quanto tempo a refeição terá até que ela termine.

Por causa dessas peculiaridades, as antigas regras de "fila mais curta" ou "item mais velho para fora" frequentemente causam caos, deixando alguns chefs ociosos enquanto outros são sobrecarregados, ou fazendo com que o balcão fique sem espaço inesperadamente.

2. A Solução: Trazer os Matemáticos

O autor diz que precisamos parar de adivinhar e começar a usar otimização matemática. Pense nisso como contratar um planejador logístico mestre que usa um supercomputador para calcular a maneira perfeita de operar a cozinha, em vez de apenas seguir um livro de regras.

O artigo destaca quatro áreas específicas onde a matemática pode consertar a cozinha:

  • Equilibrando os Chefs (Balanceamento de Carga):

    • Modo Atual: Enviar pedidos ao chef com menos tickets.
    • Modo Matemático: Calcular exatamente quanto "espaço no balcão" e "capacidade de processamento" cada pedido precisará à medida que cresce, e distribuí-los para que nenhum chef fique preso esperando pelo mais lento. O artigo cita um sistema real (DeepSeek) que usa Programação Linear (um tipo de matemática) para fazer isso perfeitamente, economizando tempo e dinheiro.
  • A Fila de Espera (Agendamento):

    • Modo Atual: Atender a primeira pessoa na fila.
    • Modo Matemático: Olhar para a fila e perceber: "Aquela pessoa pediu um ensaio de 10 páginas, mas a próxima pessoa quer apenas uma piada de uma frase." Atenda a piada primeiro! Isso limpa o balcão mais rápido e permite que mais pessoas comam. A matemática pode prever quais pedidos terminarão rapidamente para manter a cozinha em movimento.
  • O Espaço no Balcão (Cache):

    • Modo Atual: Jogar fora o item mais antigo quando o balcão está cheio.
    • Modo Matemático: Perceber que jogar fora um "vídeo de alta resolução" para fazer espaço para uma "miniatura pequena" é um mau negócio. Refazer o vídeo leva uma eternidade e custa uma fortuna. A matemática pode calcular o "custo" de jogar coisas fora e manter os itens caros no balcão.
  • Planejando a Equipe (Planejamento de Capacidade):

    • Modo Atual: Continuar adicionando chefs quando a fila fica muito longa.
    • Modo Matemático: Usar fórmulas para saber exatamente quantos chefs você precisa antes mesmo de abrir as portas, com base em quantos clientes são esperados. Isso impede que a cozinha fique sobrecarregada desde o início.

3. Por Que Não Apenas Manter as Regras?

O artigo aborda os céticos que dizem: "As regras atuais funcionam bem, por que mudar?"

  • "Funciona em escala": O autor admite que as regras atuais funcionam bem, mas são frágeis. Se um aplicativo viral enviar repentinamente um tipo estranho de pedido, a cozinha pode travar. A matemática fornece uma rede de segurança (garantias) que assegura que a cozinha não falhará, mesmo nos piores cenários.
  • "O hardware muda muito rápido": O autor argumenta que, embora o hardware (os fornos) mude, a lógica de como organizar a cozinha permanece a mesma. A matemática fornece um projeto que funciona mesmo se você trocar os fornos.
  • "A engenharia de sistemas é mais importante": O autor diz que matemática e engenharia são parceiros. Você pode ter o forno mais rápido do mundo, mas se seu agendamento for ruim, o forno fica ocioso. A matemática diz como manter o forno ocupado.

4. O Quadro Geral

O artigo conclui que o campo de serviço de LLMs cresceu além de sua "infância" de regras simples. Ele amadureceu em um sistema complexo que exige supervisão adulta de matemáticos e especialistas em algoritmos.

Ao tratar esses problemas como quebra-cabeças matemáticos em vez de apenas ajustes de engenharia, podemos obter:

  1. Previsibilidade: Saber exatamente como o sistema se comportará.
  2. Eficiência: Economizar quantidades massivas de energia e dinheiro.
  3. Confiabilidade: Garantir que o sistema não trave quando as coisas ficarem loucas.

Em resumo: Pare de adivinhar. Comece a calcular. O futuro do serviço de IA não se trata apenas de construir modelos maiores; trata-se de construir maneiras mais inteligentes e matematicamente comprovadas de operá-los.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →