← Últimos artigos
💬 NLP

PReM: Learning What to Preserve and When to Refresh for Context Compression

PReM é um novo framework de compressão de contexto que aprende dinamicamente a preservar e atualizar a memória KV interna camada por camada por meio de uma camada de memória dedicada e tokens especiais, permitindo a inferência eficiente de contexto longo sem depender de compressores externos ou tomar decisões de retenção prematuras.

Autores originais: Bohan Yu, Lei Shen, Chenxi Zhou, Chen Han, Junlin Liu, Wenbo Su, Yu Cheng, Bo Zheng

Publicado 2026-07-17
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Bohan Yu, Lei Shen, Chenxi Zhou, Chen Han, Junlin Liu, Wenbo Su, Yu Cheng, Bo Zheng

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando resolver um mistério enorme e complexo, mas em vez de uma única pista, lhe entregam uma biblioteca contendo 32.000 páginas de documentos. Seu cérebro (ou, neste caso, um programa de computador chamado Modelo de Linguagem de Grande Escala) tem que ler tudo isso para encontrar os fatos específicos necessários para responder a uma pergunta. O problema é que manter toda essa biblioteca em sua "memória de trabalho" de uma só vez é incrivelmente pesado e lento. É como tentar carregar uma biblioteca em uma mochila enquanto corre em uma corrida; eventualmente, você ficará cansado e poderá deixar cair justamente o livro de que precisa.

Para corrigir isso, cientistas tentaram dois truques principais até agora. O primeiro é a "compressão", onde eles tentam encolher a biblioteca para um resumo único e minúsculo antes mesmo de você começar a ler. O segundo é o "cache", onde eles mantêm a biblioteca inteira, mas tentam olhar apenas para as páginas mais populares. Mas ambos têm uma falha: eles tomam uma decisão sobre o que manter antes de você começar a resolver o enigma. Se o mistério mudar no meio do caminho e você de repente precisar de uma página do final do livro que foi descartada, você estará preso. Você não pode voltar e pegá-la porque a decisão foi tomada cedo demais. Este artigo introduz uma nova maneira de lidar com isso, sugerindo que, em vez de um resumo estático, precisamos de um sistema de memória que possa se atualizar conforme a história se desenrola.

Apresentamos o PReM (Preserve and Refresh Memory - Preservar e Atualizar a Memória), um novo framework inteligente que trata a memória do modelo como um caderno dinâmico e vivo, em vez de um arquivo estático. A ideia central é simples, mas poderosa: não decida apenas o que manter uma vez; decida o que manter agora mesmo, e esteja pronto para trocar as coisas no momento em que a história exigir.

Eis como o PReM funciona, usando uma analogia divertida. Imagine que você é um detetive resolvendo um caso com uma equipe de assistentes (as diferentes camadas da IA). Nos métodos antigos, a equipe leria todo o arquivo do caso, escolheria suas 10 páginas favoritas e as trancaria em um cofre. Se você precisasse de uma página do cofre mais tarde, azar o seu.

O PReM muda as regras. Ele mantém todo o arquivo do caso, mas o organiza em pequenos "pedaços" (como capítulos). À medida que o detetive começa a escrever a solução, um "Token de Memória" especial (vamos chamá-lo de Marcador de Página Mágico, escrito como ⟨m⟩) atua como um sinal. Quando o detetive escreve este marcador, é como dizer: "Espere! Preciso repensar o que está na minha mesa".

Nesse exato momento, um "Gerenciador de Memória" dedicado (uma camada especial na IA) desperta. Ele olha para a pergunta atual e para o Marcador de Página Mágico, então faz uma varredura rápida em todos os capítulos. Ele decide: "Ok, para este próximo passo da história, definitivamente precisamos do Capítulo 3 e do Capítulo 12. Podemos esquecer o resto por enquanto". Ele então troca os capítulos antigos da mesa pelos novos, mantendo os detalhes importantes nítidos e claros, enquanto comprime o que não é necessário em um resumo minúsculo. Isso acontece durante o processo de escrita, não antes.

O artigo mostra que esse mecanismo de "atualização" é um divisor de águas. Em testes usando contextos de 32.000 tokens (isso é muito texto!), o PReM conseguiu comprimir a memória em 16 vezes e 32 vezes. Apesar de ter muito menos informação "na mesa" a cada momento, ele na verdade respondeu às perguntas melhor do que modelos que tentaram manter toda a biblioteca aberta. Por exemplo, em um modelo de 7 bilhões de parâmetros, o PReM melhorou a precisar das respostas em até 12,55 pontos em comparação com os melhores métodos existentes.

Os pesquisadores também descobriram algo interessante sobre onde esse gerenciador de memória deve residir. Eles testaram colocar o "Gerenciador de Memória" nas partes iniciais, médias ou tardias do cérebro da IA. Eles descobriram que as camadas médias e tardias eram muito melhores em decidir o que manter, enquanto as camadas iniciais eram lentas demais para aprender essa habilidade. É como ter um detetive sênior (as camadas médias) tomando a decisão sobre qual evidência é relevante, em vez de um novato (as camadas iniciais).

Uma das descobertas mais surpreendentes é que o PReM é tão bom nesse gerenciamento de memória "aprendido" que um modelo menor (3 bilhões de parâmetros) usando PReM pode superar modelos maiores (7 bilhões de parâmetros) que usam outros truques de compressão. Isso sugere que saber quando atualizar sua memória é tão importante quanto o tamanho do seu cérebro.

O artigo também descarta algumas ideias. Ele mostra que simplesmente usar a atenção natural da IA (olhar para o que ela está pensando no momento) não é suficiente para decidir o que manter; você precisa de um sistema específico e treinado para fazer a seleção. Também mostra que você não pode apenas comprimir o texto uma vez no início e esperar pelo melhor; a abordagem "estática" de manter o mesmo resumo comprimido durante toda a resposta leva a resultados piores, especialmente para perguntas complexas de múltiplos passos.

Em suma, o PReM sugere que o futuro de uma IA eficiente não é apenas sobre encolher dados, mas sobre construir uma memória que respira. Ele aprende a preservar as evidências necessárias para o passo atual da conversa e sabe exatamente quando apertar o botão de "atualizar" para trocar as evidências por novas para o próximo passo. Ao fazer isso, ele mantém a IA rápida e eficiente sem fazer com que ela esqueça as pistas necessárias para resolver o mistério.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →