← Últimos artigos
💬 NLP

MiniPIC: Flexible Position-Independent Caching in <100LOC

O MiniPIC é um design de vLLM minimalista e flexível que possibilita o cache independente de posição eficiente para entradas estruturadas recorrentes ao armazenar vetores K não rotacionados e aplicar codificações posicionais por requisição durante a atenção, alcançando assim melhorias significativas de throughput e latência com menos de 100 linhas de mudanças no núcleo do motor.

Autores originais: Nathan Ordonez (IBM Research), Thomas Parnell (IBM Research)

Publicado 2026-06-12
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Nathan Ordonez (IBM Research), Thomas Parnell (IBM Research)

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está administrando uma biblioteca massiva e de alta velocidade, onde um bibliotecário (a IA) tem que ler milhares de livros para responder a uma única pergunta. Na IA moderna, essa fase de "leitura" é chamada de prefill.

Normalmente, se duas pessoas fazem perguntas semelhantes, o bibliotecário pode reutilizar partes dos livros que já leu. No entanto, os sistemas de biblioteca atuais (como o vLLM) são muito rígidos: eles só podem reutilizar uma página se ela aparecer no mesmo lugar exato no livro. Se você mover um parágrafo da página 10 para a página 100, o sistema da biblioteca trata isso como uma página totalmente nova e tem que lê-la inteira novamente, mesmo que tenham acabado de lê-la um segundo atrás.

MiniPIC é um upgrade inteligente e minúsculo para este sistema de biblioteca que resolve esse problema sem reconstruir todo o edifício. Veja como funciona, usando analogias simples:

1. O Problema: O Dilema do "Post-it"

Nos sistemas de IA atuais, a "memória" do que foi lido (chamada de KV cache) tem um post-it colado em cada página dizendo: "Eu sou a página 10".

  • O Conflito: Se você quiser usar essa mesma página de texto para uma nova solicitação onde ela pertence na página 100, o sistema da biblioteca fica confuso. Ele não pode ter a mesma página física sendo tanto a "Página 10" quanto a "Página 100" ao mesmo tempo para pessoas diferentes.
  • A Solução Antiga: Soluções anteriores tentavam fazer fotocópias da página, movê-las de lugar e relabelá-las. Isso é lento, desperdiça espaço e cria engarrafamentos na biblioteca.

2. A Solução MiniPIC: A Estratégia da "Página em Branco"

O MiniPIC muda as regras da biblioteca de duas maneiras simples:

A. A Prateleira "Sem Rótulos" (Cache Independente de Posição)
Em vez de escrever "Página 10" na página física, o MiniPIC mantém as páginas em branco em relação à sua localização. A página contém apenas as palavras.

  • Como funciona: Quando o bibliotecário lê a página, ele só decide onde ela está naquele exato momento. Se estiver lendo para a Pessoa A, a página é a "Página 10". Se estiver lendo para a Pessoa B, a mesma página física instantaneamente se torna a "Página 100".
  • O Benefício: Você não precisa fotocopiar ou mover páginas. O mesmo bloco de memória física pode servir a múltiplas pessoas em diferentes posições simultaneamente.

B. Os "Tokens Mágicos" (Primitivos Controlados pelo Usuário)
Como o bibliotecário não sabe mais onde uma página pertence apenas olhando para ela, o usuário (ou um gerente) fornece ao bibliotecário três "tokens mágicos" especiais (palavras especiais) para dizer ao sistema como lidar com os livros:

  1. Padding (Preenchimento): "Preencha o espaço vazio para que este livro termine ordenadamente em um limite de prateleira."
  2. SSEP (Separador de Extensão): "Esta seção é independente. Você pode reutilizar este trecho de texto mesmo que ele esteja em um livro diferente ou em um lugar diferente." (Isso quebra a regra rígida de "deve coincidir com o início").
  3. PDEP (Dependência de Prompt): "Esta parte depende de tudo o que veio antes dela. Não reutilize isso; leia do zero."

Ao usar esses três tokens, o usuário pode dizer ao sistema exatamente quais partes do texto são blocos reutilizáveis (como documentos ou arquivos de código) e quais são únicas.

3. O Agendamento da "Esteira de Produção"

O artigo também introduz uma forma mais inteligente de organizar o trabalho.

  • Jeito Antigo: A biblioteca terminaria de ler todos os blocos reutilizáveis para todos, colocaria uma placa de "PARE" na linha e, só então, começaria a responder às perguntas reais. Isso deixa o bibliotecário ocioso.
  • Jeito MiniPIC (Agendamento Intercalado): O bibliotecário começa a ler os blocos reutilizáveis para a próxima pessoa enquanto ainda está respondendo à pergunta da pessoa atual. É como um chef picando vegetais para o próximo prato enquanto o prato atual ainda está cozinhando. Isso mantém a cozinha (a GPU) ocupada 100% do tempo.

Os Resultados: Rápido, Pequeno e Flexível

O artigo afirma que, ao fazer essas mudanças, eles alcançaram:

  • Velocidade: Um aumento de 49% na rapidez com que o sistema lê e prepara os dados (throughput de prefill) em comparação com o sistema padrão.
  • Acesso Instantâneo: Para documentos em cache, o tempo para obter a primeira resposta caiu até 100 vezes (duas ordens de magnitude).
  • Pegada Minúscula: Todo o sistema exigiu a alteração de apenas 78 linhas de código no motor central (além de uma ferramenta de "atenção" customizada). É como consertar o motor de um carro trocando apenas duas pequenas velas de ignição em vez de reconstruir todo o motor.
  • Sem Penalidade: Quando o sistema não usa esses truques, ele fica apenas cerca de 5,7% mais lento, o que é quase imperceptível.

Resumo

O MiniPIC é um upgrade leve e flexível que permite aos sistemas de IA reutilizar blocos de texto independentemente de onde eles apareçam em um prompt. Ele faz isso removendo os "rótulos de localização" da memória e permitindo que os usuários marquem quais partes são reutilizáveis com palavras especiais simples. Isso elimina a necessidade de operações complexas e lentas de cópia e permite que a IA trabalhe muito mais rápido, especialmente ao lidar com documentos longos ou informações repetidas.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →