← Últimos artigos
🤖 machine learning

Irminsul: MLA-Native Position-Independent Caching for Agentic LLM Serving

Irminsul apresenta um sistema de cache nativo independente de posição para LLMs Agentes que aproveita a estrutura arquitetural da Atenção Latente Multi-Cabeça para habilitar o cache de pares chave-valor endereçado por conteúdo, alcançando até 83% de recuperação de tokens de prompt e 63% de economia de energia no pré-preenchimento ao superar os problemas de invalidação de cache inerentes às abordagens tradicionais de correspondência de prefixo.

Autores originais: Bole Ma, Jan Eitzinger, Harald Köstler

Publicado 2026-05-08
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Bole Ma, Jan Eitzinger, Harald Köstler

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está gerenciando uma biblioteca muito movimentada e de alta velocidade, onde um bibliotecário (a IA) precisa ler uma pilha massiva de documentos para responder a uma pergunta. Para ser rápido, o bibliotecário mantém uma "cola" (um cache) das páginas mais recentes que leu, para não ter que relê-las do zero toda vez.

O Problema: O "Onde" versus o "O Que"

Na maneira antiga de fazer as coisas (chamada de Cache de Prefixo), a cola do bibliotecário era organizada estritamente por localização.

  • "Página 1 é o Prompt do Sistema."
  • "Página 2 é o Documento A."
  • "Página 3 é o Documento B."

Se o bibliotecário fizer uma nova pergunta e a ordem mudar ligeiramente — digamos, "Página 1 ainda é o Prompt do Sistema, mas agora o Documento A está na Página 5" — a cola antiga quebra. O bibliotecário pensa: "Ah, a Página 2 é diferente, então devo jogar fora toda a cola e reler tudo desde o início."

No mundo da IA Agente (IA que usa ferramentas, pesquisa na web e conversa com outras IAs), isso acontece constantemente. A IA pode recuperar o mesmo documento, mas, como está inserindo-o em uma parte diferente da conversa, a "localização" muda. O sistema antigo vê isso como uma bagunça totalmente nova e ilegível, forçando a IA a desperdiçar tempo e energia relendo coisas que já conhece.

A Solução: Irminsul (O Bibliotecário do "Conteúdo")

O artigo apresenta um novo sistema chamado Irminsul. Em vez de organizar a cola por onde uma página está sentada, o Irminsul a organiza pelo que a página realmente diz.

Pense nisso assim:

  • Maneira Antiga: "Eu só me lembro do livro se ele estiver na 3ª prateleira."
  • Irminsul: "Eu me lembro do livro porque é uma cópia de Harry Potter, não importa em qual prateleira ele esteja."

O Irminsul divide a conversa em blocos com base no texto real (conteúdo). Se a IA vê "Documento A" novamente, mesmo que esteja em um local diferente, o Irminsul diz: "Já vi exatamente esse texto antes! Posso reutilizar minhas anotações."

O Segredo: O Ajuste de "Posição"

Você pode perguntar: "Se o texto é o mesmo, mas a posição é diferente, a IA não ficará confusa?"

Sim, geralmente. Na IA, a "posição" de uma palavra importa muito (é como saber se uma palavra está no início ou no fim de uma frase).

  • O Problema Antigo: Para corrigir a posição, os sistemas antigos tinham que reescrever a inteira cola para cada palavra. Era como reescrever um livro inteiro apenas para mudar o número da página. Isso era lento e caro.
  • O Truque do Irminsul: O artigo foca em um tipo específico de arquitetura de IA chamada MLA (Atenção Latente Multi-Cabeça). Essa arquitetura é especial porque divide as "anotações" em duas partes:
    1. O Conteúdo (90%): O significado real das palavras. Esta parte é idêntica independentemente da posição.
    2. A Posição (10%): Uma pequena etiqueta que diz "Eu estou aqui".

O Irminsul percebe que só precisa ajustar essa pequena etiqueta de 10%. Ele usa uma "torção" matemática inteligente (chamada de rotação δ\delta) para atualizar instantaneamente a etiqueta de posição sem reescrever o livro inteiro. É como tirar uma foto de um documento e apenas deslizá-lo para um novo local na mesa, em vez de tirar uma nova foto de todo o quarto.

Os Resultados

O artigo testou isso em três sistemas de IA do mundo real (DeepSeek, Kimi e JoyAI) que atuam como agentes.

  • Recuperação: Em tarefas complexas onde a IA move documentos ao redor, o Irminsul conseguiu reutilizar cerca de 77% a 83% do trabalho que o sistema antigo jogava fora.
  • Energia: Como não precisa reler o texto, ele economiza cerca de 63% da energia necessária para processar essas partes repetidas.
  • Precisão: A IA responde tão corretamente quanto antes; ela não fica confusa com o novo método.

A Regra da "Primeira Página"

Há um pequeno detalhe. As primeiras palavras de qualquer conversa atuam como uma "âncora de gravidade" para a atenção da IA. O artigo descobriu que, se você tentar reutilizar um bloco que começa exatamente no início de uma conversa, a IA fica confusa.

  • O Conserto: O Irminsul simplesmente relê o muito primeiro bloco de texto (as primeiras 32 palavras) toda vez, mas para tudo depois disso, usa a reutilização inteligente "baseada em conteúdo". Esse pequeno custo garante que o restante do sistema funcione perfeitamente.

Resumo

Irminsul é uma maneira mais inteligente para a IA lembrar de coisas. Em vez de dizer: "Eu me lembro disso porque estava no slot #5", ela diz: "Eu me lembro disso porque é a mesma história". Ao perceber que a "história" (conteúdo) é mais importante que o "slot" (posição), e ao usar um truque especial para corrigir a etiqueta de posição rapidamente, torna os agentes de IA mais rápidos, mais baratos de executar e muito melhores em lidar com conversas complexas e em mudança.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →