← Últimos artigos
🤖 machine learning

DiLaServe: High SLO Attainment Serving for Diffusion Language Models

O DiLaServe é um sistema de serviço em nível de cluster para Modelos de Linguagem de Difusão que melhora o cumprimento de SLO em até 56,6 pontos percentuais e reduz a latência em 46% com perda mínima de precisão, alcançado por meio de escalonamento consciente de prazos, controle de carga adaptativo via ajuste de limiar de confiança e reconfiguração dinâmica de cluster que considera a heterogeneidade de nível de passo proveniente de cache KV aproximado.

Autores originais: Tzu-Tao Chang, Benjamin Yuanyang Hong, Kiet Pham, Shivaram Venkataraman

Publicado 2026-06-30
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Tzu-Tao Chang, Benjamin Yuanyang Hong, Kiet Pham, Shivaram Venkataraman

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está administrando um restaurante movimentado onde os chefs (os modelos de IA) têm que escrever uma história palavra por palavra. No modo antigo de fazer as coisas (chamado de modelos "autoregressivos"), um chef escreve uma palavra, pensa sobre ela, escreve a próxima, e assim por diante. Isso é lento porque eles só conseguem fazer uma coisa de cada vez.

Recentemente, um novo tipo de chef chegou: o Modelo de Linguagem de Difusão (DLM). Em vez de escrever uma palavra por vez, este chef olha para uma página inteira de palavões (palavras mascaradas) e tenta corrigir muitas palavras de uma só vez em um único "passo". Isso é muito mais rápido, como uma equipe de editores corrigindo um parágrafo inteiro simultaneamente.

No entanto, há um detalhe: o novo chef é um pouco perfeccionista. Antes de corrigir uma palavra, ele se pergunta: "Tenho 90% de certeza de que isso está certo?". Se ele não tiver certeza suficiente, ele deixa a palavra como está e tenta novamente na próxima passagem. Se estiver muito confiante, ele a corrige imediatamente.

O Problema:
Se o chef for exigente demais (alta confiança), ele levará uma eternidade para terminar a história, e os clientes ficarão irritados esperando (alta latência). Se ele for apressado demais (baixa confiança), terminará rápido, mas poderá escrever algo sem sentido (baixa qualidade).

Além disso, o restaurante tem um número limitado de chefs. Às vezes a cozinha está vazia e, às vezes, está lotada de pedidos. Se você atribuir muitos pedidos complexos a um único chef, ele ficará sobrecarregado. Se você atribuir muitos pedidos simples a um chef super-rápido, você desperdiçará o potencial dele.

A Solução: DiLaServe
O artigo apresenta o DiLaServe, um "Gerente de Restaurante" inteligente projetado especificamente para esses novos chefs de Difusão. Veja como ele funciona, usando analogias do cotidiano:

1. O "Botão de Confiança" (Velocidade vs. Qualidade)

Imagine que o chef tem um botão giratório rotulado como "Confiança".

  • Gire para 10 (Alta Confiança): O chef só corrige as palavras das quais tem absoluta certeza. A história será perfeita, mas levará muito tempo.
  • Gire para 5 (Baixa Confiança): O chef corrige as palavras mesmo quando está apenas chutando. É super rápido, mas a história pode ficar estranha.

A Magia do DiLaServe: Ele não escolhe apenas uma configuração para o dia todo. Ele observa o relógio.

  • Se o pedido de um cliente estiver atrasado, o DiLaServe sussurra para o chef: "Ei, estamos atrasados! Diminua um pouco a confiança para que você possa terminar mais rápido".
  • Se a cozinha estiver calma, ele diz: "Leve o tempo que precisar, aumente a confiança para que fique perfeito".
  • O Resultado: Ele equilibra velocidade e qualidade de forma dinâmica, garantindo que nenhum cliente espere demais enquanto mantém a história boa.

2. O "Balanceador de Carga" (Gerenciando a Multidão)

Imagine que você tem uma equipe de chefs. Alguns são cozinheiros solo (usando uma GPU) e outros são super-equipes trabalhando juntas em um único pedido gigante (usando múltiplas GPUs, chamado de "Paralelismo de Tensor").

  • Super-equipes são ótimas para pedidos enormes e complexos porque os terminam rapidamente.
  • Cozinheiros solo são melhores para lidar com uma enorme enxurrada de pedidos pequenos, pois você pode ter mais deles trabalhando ao mesmo tempo.

A Magia do DiLaServe: Ele conta constantemente os pedidos que estão chegando.

  • Se o restaurante estiver calmo, ele envia os pedidos para as Super-equipes para que terminem rápido.
  • Se o restaurante estiver lotado, ele muda para os Cozinheiros solo para lidar com o grande volume de pedidos, mesmo que cada pedido individual leve um pouco mais de tempo.
  • Ele também evita que a cozinha fique entupida. Se muitas pessoas estiverem tentando cozinhar ao mesmo tempo, ele diz aos chefs para diminuírem sua confiança (trabalharem mais rápido) para que toda a linha continue se movendo, evitando um congestionamento total.

3. O "Agendador Inteligente" (Movendo Pedidos)

Em uma cozinha normal, assim que um chef começa um pedido, ele o termina. Mas o DiLaServe permite que os chefs troquem de pedidos no meio do caminho.

  • Se o Chef A estiver ficando sobrecarregado com um pedido difícil e o Chef B estiver livre, o DiLaServe pode transferir instantaneamente o pedido para o Chef B.
  • Como o modelo de Difusão trabalha em "passos" (corrigindo um lote de palavras), essa transferência é muito barata e rápida. É como um garçom pegando um prato de uma linha lenta e colocando em uma linha rápida sem derramar uma gota de sopa.

4. A "Caixa de Reciclagem" (Cache KV Aproximado)

Normalmente, quando um chef escreve uma história, ele tem que se lembrar de tudo o que escreveu até agora para manter o contexto correto. Isso consome muita energia mental (memória).

  • O DiLaServe usa um truque chamado Cache KV Aproximado. É como dizer: "Não precisamos reler o primeiro parágrafo da história toda vez que escrevemos uma nova frase; podemos apenas lembrar da ideia central".
  • Isso economiza uma enorme quantidade de tempo. O DiLaServe sabe exatamente quando "atualizar" essa memória para que a história não fique confusa, garantindo que os chefs permaneçam eficientes.

Os Resultados

O artigo testou este sistema contra sistemas antigos e rígidos usando dados do mundo real.

  • Taxa de Sucesso: O DiLaServe cumpriu os limites de tempo dos clientes (SLOs) até 56% mais vezes do que os sistemas antigos.
  • Velocidade: Ele reduziu o tempo total de espera em 46%.
  • Qualidade: As histórias ficaram apenas ligeiramente menos perfeitas (menos de 1% de queda na qualidade), o que é um preço pequeno a pagar para não fazer os clientes esperarem para sempre.

Em resumo: O DiLaServe é um gerente inteligente que sabe quando deve pressionar os chefs para trabalharem mais rápido e quando deve deixá-los ser perfeitos, e ele reorganiza a equipe da cozinha sobre a hora para garantir que todos sejam alimentados rapidamente sem esgotar a cozinha.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →