← Últimos artigos
🤖 machine learning

InferScale: GPU-Native KV Injection for Personalized LLM Serving

O InferScale é um sistema de memória nativo de GPU que acelera o serviço de LLMs personalizados ao pré-computar e injetar estados KV reutilizáveis diretamente no cache do vLLM, desacoplando assim a latência do primeiro token (time-to-first-token) do tamanho do contexto recuperado, enquanto mantém uma alta precisão.

Autores originais: Peter Li, Prashant Pandey

Publicado 2026-07-30
📖 6 min de leitura🧠 Leitura aprofundada

Autores originais: Peter Li, Prashant Pandey

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando ensinar toda a história da sua vida para um robô superinteligente para que ele possa responder perguntas sobre você. Toda vez que você faz uma pergunta ao robô, você tem que colar toda a sua biografia no cérebro dele antes que ele possa pensar. Se a sua biografia for curta, o robô pensa rápido. Mas se a sua biografia for longa — repleta de anos de memórias, piadas internas e aventuras passadas — o robô tem que reler e reprocessar cada palavra dessa biografia apenas para responder a um simples "Qual é a minha cor favorita?". Esse processo de releitura é lento e caro, como um bibliotecário que tem que recolocar todas as estantes de livros na biblioteca antes de te entregar apenas um. Este é o estado atual da IA "personalizada": quanto mais memórias você dá a ela, mais lenta ela fica para falar com você.

O artigo que você está prestes a ler aborda este problema usando um truque inteligente do mundo da ciência da computação chamado "Cache de Chave-Valor" (Key-Value caching). Pense no cérebro do robô como um quadro branco gigante onde ele escreve as partes mais importantes do que leu até agora, para não ter que reler o texto original. Normalmente, se você mudar a ordem dos livros na estante, o robô tem que reescrever todo o quadro branco. Mas e se o robô pudesse apenas pegar as notas pré-escritas de uma gaveta e colá-las no quadro branco instantaneamente, não importa para onde você as queira levar? Essa é a ideia central desta pesquisa: em vez de forçar o robô a reler suas memórias toda vez, nós pré-calculamos as "notas" para cada memória e as armazenamos no drive interno super-rápido do robô. Então, quando você faz uma pergunta, nós apenas jogamos essas notas diretamente no cérebro do robô.

O Problema: A Armadilha da "Releitura"
Hoje, quando você usa um assistente de IA com um longo histórico de conversas, o sistema tem que encontrar as memórias mais relevantes e colá-las na sua nova pergunta. Isso é chamado de "injeção de prompt" (prompt injection). Imagine que você está pedindo um conselho a um amigo, mas toda vez que você fala, você tem que ler em voz alta as últimas 50 páginas do seu diário antes de poder dizer sua pergunta real. Quanto mais páginas você lê, mais tempo leva para chegar ao conselho. Mesmo que você faça exatamente a mesma pergunta dez vezes, o amigo tem que ler essas 50 páginas dez vezes. Isso faz com que a IA pareça lenta, especialmente conforme sua memória pessoal cresce.

A Solução: InferScale
Os pesquisadores, Peter Li e Prashant Pandey, construíram um novo sistema chamado InferScale. Em vez de fazer a IA reler as memórias, o InferScale faz o trabalho pesado uma única vez antes mesmo de você começar a falar. Ele pega cada fato de memória (como "Eu amo pizza" ou "Meu cachorro se chama Rex") e calcula suas "notas cerebrais" (chamadas de estados KV) antecipadamente. Essas notas são armazenadas diretamente na placa de vídeo (GPU), que é o cérebro super-rápido do computador.

Quando você faz uma pergunta, o sistema não envia o texto das suas memórias para a IA. Em vez disso, ele encontra as "notas cerebrais" corretas da GPU e as injeta diretamente na memória de trabalho da IA. É como ter uma biblioteca onde, em vez de te entregar os livros, o bibliotecário cola instantaneamente os parágrafos exatos que você precisa na sua mesa. A IA nunca precisa reler o texto de origem; ela apenas usa as notas.

Os Truques Mágicos
Para fazer isso funcionar, a equipe teve que resolver dois enigmas complicados:

  1. O Problema do "Alvo Móvel" (Chunked RoPE):
    Normalmente, essas "notas cerebrais" estão ligadas a um lugar específico no texto. Se você mover uma memória do início de uma história para o meio, as notas se tornam erradas. Os pesquisadores inventaram uma técnica chamada Chunked RoPE. Imagine que as notas são escritas em um tipo especial de papel que pode ser rotacionado. Não importa onde você coloque o papel na mesa, você pode girá-lo para corresponder perfeitamente à nova posição. Isso permite que o sistema pegue uma memória armazenada em um lugar e a deposite em qualquer lugar da sua conversa sem quebrar a matemática.

  2. O Problema do "Contexto" (Context-Window Encoding):
    Se você pegar apenas uma frase isolada como "Ele foi à loja", a IA pode não saber quem é "Ele". Se você armazenar a memória isoladamente, você perde o contexto. Para corrigir isso, o sistema armazena a memória junto com uma pequena janela das frases que vieram antes dela (como "João foi à loja"). No entanto, ele salva apenas as "notas cerebrais" para a parte específica da memória, não a janela inteira. Dessa forma, a IA entende o contexto ("Ele" é João) sem ter que reler todo o parágrafo toda vez.

O Que Eles Descobriram
Os resultados são impressionantes. Os pesquisadores testaram isso em três modelos diferentes de IA (Llama-3.1-8B, Mistral-7B e Qwen2.5-7B) usando um conjunto de dados de conversas longas.

  • Velocidade: No método antigo (Mem0), conforme aumentavam o número de memórias recuperadas de 5 para 50, o tempo para a IA começar a falar (Time-to-First-Token) saltou 106% (de 33,2 ms para 68,3 ms). Com o InferScale, esse mesmo aumento causou apenas um desaceleramento de 4% (de 16,6 ms para 17,3 ms).
  • Throughput (Vazão): Quando 100 pessoas usaram o sistema ao mesmo tempo, o InferScale lidou com 3,7 a 4,5 vezes mais perguntas por segundo do que o sistema antigo.
  • Precisão: Como o sistema às vezes armazena memórias separadamente, havia o risco de a IA ficar confusa. No entanto, ao usar o truque da "Janela de Contexto", eles recuperaram quase toda a precisão. Na carga de memória mais alta, o InferScale acertou 60,3% das respostas, o que é muito próximo dos 63,3% do sistema antigo, mas muito mais rápido.

Por Que Isso Importa
Este artigo prova que você não precisa escolher entre uma IA inteligente e rica em memória e uma IA rápida. Ao mover o armazenamento de memória para a GPU e injetar as "notas cerebrais" diretamente, eles desacoplaram a velocidade da IA do tamanho da sua memória. O sistema não requer nenhum retreinamento dos modelos de IA e nenhuma mudança no mecanismo subjacente, tornando-o uma atualização prática para o futuro dos assistentes de IA personalizados. Mesmo que os dados de memória sejam grandes demais para caber na GPU rápida, eles mostraram que transferir esse processamento para a memória regular do computador ainda mantém o sistema significativamente mais rápido do que os métodos atuais.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →