← Últimos artigos
💻 computer science

Gated DeltaNet-2: Decoupling Erase and Write in Linear Attention

Gated DeltaNet-2 introduz um mecanismo de atenção linear inovador que desacopla operações de apagamento e escrita por canal através de portas separadas para superar as limitações da edição acoplada por escalar em modelos anteriores, alcançando desempenho de ponta em modelagem de linguagem e tarefas de recuperação de longo contexto.

Autores originais: Ali Hatamizadeh, Yejin Choi, Jan Kautz

Publicado 2026-05-22
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Ali Hatamizadeh, Yejin Choi, Jan Kautz

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

A Visão Geral: O Problema do "Excesso de Memória"

Imagine uma bibliotecária superinteligente (o modelo de IA) que precisa ler um livro muito longo para responder a uma pergunta.

  • O Jeito Antigo (Transformers Padrão): A bibliotecária mantém uma pilha gigante e crescente de cartões de índice para cada palavra que já leu. Se o livro tem 100.000 palavras, a pilha é enorme. Isso ocupa muito espaço na mesa (memória) e torna difícil encontrar as coisas.
  • O Jeito Mais Novo (Atenção Linear): Para economizar espaço, a bibliotecária usa um único caderno de tamanho fixo. Em vez de anotar tudo, ela resume a história à medida que avança. Se o caderno encher, ela precisa apagar algo para escrever algo novo.

O problema com esse "caderno fixo" é a interferência. Se a bibliotecária apagar uma página para escrever uma nova história, ela pode acidentalmente eliminar um detalhe importante do passado que ainda precisará usar mais tarde. É como tentar escrever uma nova lista de compras em um post-it que já tem seu número de telefone; se você rabiscar sobre o número, você o perde.

A Solução Anterior: O "Apagador de Tamanho Único"

Pesquisadores tentaram corrigir isso com modelos como KDA e Gated DeltaNet. Eles deram à bibliotecária um "apagador" especial e uma "caneta".

No entanto, esses modelos tinham um defeito: O apagador e a caneta estavam amarrados.
Imagine um único interruptor que controla duas coisas ao mesmo tempo:

  1. Quanto da escrita antiga deve ser apagada.
  2. Quanto da escrita nova deve ser comprometida.

Se a bibliotecária quisesse apagar uma palavra específica do passado, mas manter o resto da página, ela não podia. O interruptor a forçava a apagar a página inteira ou escrever a história nova inteira. Ela não podia ser precisa. Eles estavam "amarrados pelo quadril".

A Nova Solução: Gated DeltaNet-2

Gated DeltaNet-2 é uma nova versão do sistema de caderno dessa bibliotecária. Sua principal inovação é o desacoplamento (desenredar) o apagador da caneta.

Em vez de um interruptor, o modelo agora tem dois controles independentes:

  1. O "Portão de Apagar" (O Apagador): Este controle olha para a informação antiga. Ele decide exatamente quais partes específicas da história antiga devem ser apagadas. É como ter um apagador de precisão que pode remover apenas a palavra "maçã" sem tocar na palavra "laranja" ao lado.
  2. O "Portão de Escrever" (A Caneta): Este controle olha para a informação nova. Ele decide exatamente quais partes da nova história devem ser escritas. É como ter uma caneta que pode escrever apenas os novos ingredientes que você comprou, sem reescrever a lista inteira.

A Analogia:
Pense na página do caderno como um quadro branco digital.

  • Modelo Antigo: Você tem um controle remoto. Se você pressionar "Atualizar", ele apaga 50% do quadro e escreve 50% de coisas novas. Você não pode escolher o que é apagado ou o que é escrito.
  • Gated DeltaNet-2: Você tem um ponteiro laser e uma caneta. Você pode usar o laser para eliminar apenas os fatos antigos específicos que estão errados (o "Portão de Apagar") e, em seguida, usar a caneta para escrever apenas os fatos novos específicos que importam (o "Portão de Escrever").

Por Que Isso Importa (Os Resultados)

O artigo testou esse novo sistema de "dois portões" contra outros modelos inteligentes (como Mamba-2, Mamba-3 e o KDA original) em um modelo de 1,3 bilhão de parâmetros treinado em uma quantidade massiva de texto educacional.

Aqui está o que eles descobriram:

  1. Melhor em Encontrar a "Agulha no Palheiro":
    Imagine um teste onde a bibliotecária precisa encontrar uma frase específica escondida dentro de um documento de 100 páginas.

    • Os modelos antigos às vezes ficavam confusos porque o apagador "amarrado" apagava acidentalmente a agulha enquanto tentava escrever novas informações.
    • Gated DeltaNet-2 foi o melhor nisso. Como ele podia apagar seletivamente apenas a informação distrativa enquanto protegia a "agulha" importante, ele lembrou a resposta correta muito melhor, mesmo em documentos muito longos.
  2. Raciocínio Mais Inteligente:
    Em testes envolvendo senso comum (como "Se eu colocar uma xícara em uma mesa, onde está a xícara?"), o novo modelo pontuou mais alto que seus concorrentes. Parece que ser capaz de editar a memória com precisão ajuda o modelo a entender melhor as relações.

  3. Velocidade e Eficiência:
    Apesar de ter controles mais complexos (dois portões em vez de um), o modelo não ficou significativamente mais lento. Ele ainda processa texto em uma velocidade semelhante aos outros modelos eficientes, tornando-o prático para uso no mundo real.

Resumo

Gated DeltaNet-2 é uma maneira mais inteligente para a IA gerenciar sua memória de curto prazo. Ao separar o ato de esquecer (apagar dados antigos) do ato de aprender (escrever novos dados), o modelo evita o "dano colateral" de apagar acidentalmente informações importantes. Isso permite que ele lide com histórias mais longas e tarefas complexas com mais precisão do que métodos anteriores, mantendo ao mesmo tempo o uso de memória baixo e a velocidade alta.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →