← Últimos artigos
💬 NLP

Context Memorization for Efficient Long Context Generation

Este artigo propõe a "memória de estado de atenção", um método sem treinamento que externaliza informações de prefixo em uma tabela de consulta leve de estados de atenção pré-calculados para superar a influência desvanecida e as limitações de escalabilidade linear da inferência aumentada por prefixo tradicional, melhorando assim a precisão e reduzindo a latência na geração de contexto longo.

Autores originais: Yasuyuki Okoshi, Hao Mark Chen, Guanxi Lu, Hongxiang Fan, Masato Motomura, Daichi Fujiki

Publicado 2026-05-19
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Yasuyuki Okoshi, Hao Mark Chen, Guanxi Lu, Hongxiang Fan, Masato Motomura, Daichi Fujiki

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você é um chef brilhante (a IA) que precisa cozinhar um prato específico com base em um cartão de receita muito longo e detalhado (o "prefixo") que você deve ler cada vez que um cliente faz um pedido.

O Problema: O Cartão de Receita Pesado

Atualmente, quando um cliente pede: "Faça-me um hambúrguer", o chef tem que:

  1. Ler todo o cartão de receita do início ao fim cada vez que um pedido é feito.
  2. Lembrar de cada detalhe enquanto pica os vegetais.

À medida que o cartão de receita fica mais longo (milhares de palavras), duas coisas ruins acontecem:

  • O Efeito "Esquecimento": Quando o chef chega ao final do cartão e começa a cozinhar, já esqueceu as primeiras instruções. Quanto mais longo o cartão, mais o início se desvanece no fundo.
  • O Efeito "Leitura Lenta": Ler um cartão de 100 páginas leva muito mais tempo do que ler um cartão de 1 página. Se o chef tiver que ler tudo para cada pedido, a cozinha fica congestionada e os clientes esperam para sempre.

Outras soluções tentadas por cientistas têm falhas:

  • Comprimir o cartão: Eles tentam encolher a receita, mas você ainda precisa ler a versão encolhida cada vez, e pode perder detalhes importantes.
  • Memorizar o cartão: Eles tentam forçar o chef a memorizar a receita fazendo-o estudá-la por horas (treinamento). Isso é lento, caro e, se a receita mudar, o chef tem que estudar tudo novamente.

A Solução: A "Cola" (Memória de Estado de Atenção)

Os autores deste artigo propõem um novo método chamado Memória de Estado de Atenção. Em vez de fazer o chef ler todo o cartão ou memorizá-lo, eles fornecem ao chef uma cola inteligente e pré-fabricada.

Veja como funciona, usando uma analogia simples:

1. Criação da "Cola" (Fase Offline)

Antes da cozinha abrir, o chef pega o cartão de receita longo e alguns pedidos de exemplo. Eles não apenas leem o cartão; eles descobrem: "Se um cliente pedir um hambúrguer, a parte mais importante da receita é a seção sobre 'Molho'. Se pedirem uma salada, é a seção de 'Tempero'."

Eles escrevem essas "respostas" específicas em um pequeno cartão de índice (a memória).

  • Crucialmente: Eles fazem isso sem alterar o cérebro do chef (sem treinamento). Eles apenas olham para a receita e para as perguntas, calculam as respostas e as escrevem.
  • O Truque Mágico: Eles usam uma atalho matemático (chamado de "identidade online-softmax") que permite combinar essas respostas perfeitamente. É como tirar uma foto das partes mais importantes da receita e colá-las em um cartão, para que o chef não precise mais olhar para o livro original.

2. O Serviço na Cozinha (Inferência Online)

Agora, quando um cliente faz um pedido:

  1. O chef olha para o pedido ("Quero um hambúrguer").
  2. Em vez de ler a receita de 100 páginas, o chef lança um olhar rápido para a Cola.
  3. Eles encontram a correspondência mais próxima na folha (por exemplo, "Instruções para hambúrguer") e recuperam instantaneamente os detalhes necessários.
  4. Eles começam a cozinhar imediatamente.

Por Que Isso é Melhor

  • Sem Mais Leitura: O chef nunca mais precisa ler o cartão de receita longo. Eles apenas consultam a resposta na cola.
  • Velocidade: Consultar uma palavra em um dicionário é muito mais rápido do que ler um livro inteiro. Mesmo que a cola cresça, encontrar a entrada correta é incrivelmente rápido (escala logaritmicamente, o que significa que permanece rápida mesmo quando a lista fica enorme).
  • Sem Esquecimento: Como o chef não está distraído lendo o livro inteiro enquanto cozinha, as instruções da "cola" permanecem frescas e fortes. A influência da receita não se desvanece.
  • Sem Reestudo: Se a receita mudar, você apenas atualiza a cola. Você não precisa fazer o chef estudar por semanas.

O Que o Artigo Encontrou

Os pesquisadores testaram isso em um modelo de IA inteligente (LLaMA 3.1-8B) com dois tipos de tarefas:

  1. Aprendizado a Partir de Exemplos (Aprendizado em Contexto): Fornecer à IA muitos exemplos de perguntas e respostas.
    • Resultado: O método da "Cola" foi mais preciso do que o método padrão quando a lista de exemplos era longa (1.000 a 8.000 exemplos). Também foi 1,36 vezes mais rápido.
  2. Usando um Livro de Regras (RAG): Fornecer à IA um livro de regras massivo (como regras de troca da NBA) para responder perguntas.
    • Resultado: O método da "Cola" superou o método padrão usando apenas 20% do espaço de memória.

A Conclusão

Este artigo apresenta uma maneira de transformar um manual de instruções massivo e lento de ler em uma pequena tabela de consulta instantânea. Permite que modelos de IA lembrem perfeitamente de instruções longas sem ficar cansados, sem precisar ser re-treinados e sem atrasar a cozinha. É como trocar um livro didático de 1.000 páginas por um único cartão de índice perfeito.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →