Conditional Memory via Scalable Lookup: A New Axis of Sparsity for Large Language Models
Este artigo introduz o Engram, um módulo de memória condicional escalável que moderniza os embeddings de -gramas para busca em O(1), revelando uma lei de alocação de esparsidade em forma de U que otimiza o equilíbrio entre computação neural e memória estática para aumentar significativamente o desempenho em raciocínio, código e recuperação de contexto longo em grandes modelos de linguagem.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine que você está tentando resolver um quebra-cabeça gigante e complexo. Por muito tempo, os resolvedores de quebra-cabeças mais inteligentes (modelos de IA) foram construídos como fábricas massivas. Eles têm milhares de trabalhadores especializados (chamados de "Mixture-of-Experts" ou MoE) que entram em ação apenas quando necessário para decifrar lógicas complicadas ou novas ideias. Isso é ótimo para pensar, mas é um pouco desajeitado quando se trata de lembrar fatos simples e entediantes.
Pense da seguinte forma: Se você perguntasse a um matemático brilhante: "Qual é a capital da França?", ele não diria apenas "Paris". Ele teria que realizar uma simulação mental completa, rederivando a resposta do zero toda vez, consumindo muita energia cerebral apenas para recordar algo que já sabe há tempos. É como usar um supercomputador para procurar um número de telefone na própria mente.
A Grande Descoberta: Uma "Folha de Cola" para o Cérebro
Os pesquisadores da DeepSeek-AI e da Universidade de Pequim perguntaram: E se déssemos a esses modelos uma "folha de cola" dedicada para as coisas que eles só precisam lembrar?
Eles introduziram uma nova ferramenta chamada Engram. Em vez de forçar a IA a "pensar" o caminho de cada palavra, o Engram atua como uma tabela de consulta super-rápida, O(1) (isso significa que leva o mesmo tempo ínfimo para procurar uma palavra ou um milhão delas). Ele é baseado em uma ideia antiga chamada N-grams (olhar para grupos de palavras juntos), mas eles a atualizaram com tecnologia moderna para fazê-la funcionar perfeitamente dentro de uma IA gigante.
O Segredo em "Formato de U"
A equipe descobriu uma regra fascinante sobre como construir esses modelos, que eles chamam de lei de escala em forma de U.
Imagine que você tem um orçamento fixo de "poder cerebral" (etapas de computação). Você pode gastar tudo nos "trabalhadores de pensamento" (MoE), ou pode gastar tudo na "folha de cola de memória" (Engram).
- Se você gastar 100% nos trabalhadores de pensamento, o modelo será bom em lógica, mas ruim em lembrar fatos.
- Se você gastar 100% na folha de cola, o modelo lembrará fatos, mas não conseguirá raciocinar bem.
- O Ponto Ideal: O artigo descobriu que o melhor desempenho acontece quando você divide o orçamento. Você precisa de ambos. Especificamente, eles descobriram que retirar cerca de 20–25% do orçamento de memória "extra" dos trabalhadores de pensamento e entregá-lo ao módulo de memória Engram torna o sistema inteiro mais inteligente. É como perceber que um gênio precisa de uma boa biblioteca, não apenas de um céreuro rápido.
O Que Realmente Aconteceu? (A Prova)
Eles construíram um modelo chamado Engram-27B e o compararam com um modelo padrão de "apenas pensamento" do mesmo tamanho e velocidade. Os resultados foram surpreendentemente fortes:
- Conhecimento: Ele melhorou em conhecimentos gerais e fatos (como pontuar +3.4 a mais no MMLU e +4.0 no CMMLU).
- Raciocínio: Mais surpreendente ainda, ele ficou muito melhor em raciocínio geral e enigmas lógicos (pontuando +5.0 a mais no BBH e +3.7 no ARC-Challenge).
- Matemática e Código: Também melhorou em programação e matemática (como +3.0 no HumanEval).
O artigo sugere que isso acontece porque o módulo Engram lida com as coisas "entediantes" (como lembrar que "Alexandre, o Grande" é um nome específico), para que o cérebro principal não precise perder tempo reconstruindo-o. Isso libera as camadas profundas da IA para focar em pensamentos complexos e profundos. É como ter um secretário que cuida de toda a agenda para que o CEO possa focar na estratégia.
O Truque da "Memória Longa"
Um dos efeitos colaterais mais legais é o quão bem esses modelos lidam com histórias longas. Como o módulo Engram captura detalhes locais instantaneamente, a IA principal tem mais "atenção" restante para lembrar a história inteira do começo ao fim. Em testes, o modelo Engram conseguiu encontrar uma agulha específica em um palheiro de texto 97,0% das vezes, enquanto o modelo padrão conseguiu apenas 84,2%.
A Magia do Hardware
Finalmente, o artigo argumenta que isso não é apenas um truque de software; é um truque amigável ao hardware. Como a "folha de cola" usa endereços fixos (IDs determinísticos), o computador pode começar a buscar a próxima parte da memória enquanto ainda está fazendo o cálculo para a parte atual. Isso significa que eles podem armazenar uma tabela de 100 bilhões de parâmetros no disco rígido de um computador comum (memória host) e ainda obter resultados quase tão rápidos quanto se estivesse na super-rápida GPU. A penalidade de velocidade foi insignificante, menos de 3%.
O Que Eles Explicitamente Dizem que NÃO É
O artigo é muito claro sobre o que isso não é:
- Não é apenas um vocabulário maior. Eles tentaram apenas aumentar o vocabulário (OverEncoding), e não funcionou tão bem quanto o Engram.
- Não é um substituto para a parte do "pensamento". Se você remover totalmente os trabalhadores de pensamento (MoE), o modelo falha no raciocínio. A memória é uma ajudante, não uma substituta.
- Não é uma solução mágica para tudo. O artigo observa que, embora ajude com fatos e raciocínio, a "espinha dorsal" (a IA principal) ainda é quem faz o trabalho pesado para coisas como compreensão de leitura, que depende mais de contexto do que de memória estática.
O Quão Certo Eles Estão?
Os autores estão muito confiantes em suas medições. Eles não apenas simularam isso; eles treinaram modelos reais com 262 bilhões de tokens de dados e os testaram em benchmarks do mundo real. Eles mostraram que a regra do "formato de U" se mantém através de diferentes tamanhos e que os ganhos de desempenho são reais, mensuráveis e repetíveis. Eles até visualizaram os "portões" (gates) dentro do modelo para mostrar que ele realmente está ativando a memória especificamente para coisas como nomes e frases, exatamente como planejado.
Em suma, o artigo sugere que o futuro da IA não é apenas sobre criar cérebros maiores; é sobre dar a esses cérebros uma maneira melhor, mais rápida e mais inteligente de consultar informações.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.