← Últimos artigos
💬 NLP

Learning how to Forget: Fine-tuning for Long-Context Sparse Attention

Este artigo apresenta um método de ajuste fino para modelos transformer que possibilita a inferência eficiente de contexto longo com atenção esparsa em hardware moderado, ao permitir que os modelos se coadaptem com várias políticas de cache KV, frequentemente superando abordagens de atenção exata.

Autores originais: Matthias Seeger, Zeyu Zhang, Vihang Patil, Konstantinos Benidis, Sebastian Schelter

Publicado 2026-08-21
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Matthias Seeger, Zeyu Zhang, Vihang Patil, Konstantinos Benidis, Sebastian Schelter

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Os sistemas modernos de inteligência artificial que geram texto semelhante ao humano dependem de um mecanismo que atua como uma memória de curto prazo, permitindo que eles se lembrem do que foi dito anteriormente em uma conversa ou em um documento longo. Essa memória é armazenada em um buffer digital que cresce a cada nova palavra que o sistema processa. Para que esses sistemas funcionem bem ao longo de extensos trechos de texto, essa memória precisa ser vasta, mas o hardware de computador necessário para contê-la é caro e limitado. Quando o buffer de memória enche, o sistema deve decidir quais partes antigas de informação descartar para abrir espaço para a nova. Se ele jogar fora a informação errada, o sistema perde sua capacidade de raciocinar ou responder perguntas com precisão. Isso cria um difícil equilíbrio: manter a memória pequena economiza dinheiro e permite que o sistema rode em equipamentos padrão, mas corre o risco de perder o contexto necessário para ser inteligente.

Pesquisadores há muito tempo tentam resolver isso ensinando o sistema a ser seletivo sobre o que manter, um processo conhecido como atenção esparsa. No entanto, um novo estudo revela uma falha crítica na forma como esses sistemas têm sido treinados até agora. A maioria dos métodos existentes treina a IA usando uma memória perfeita e ilimitada e depois tenta forçá-la a operar com uma memória limitada mais tarde. Os pesquisadores descobriram que essa abordagem falha porque a IA nunca aprendeu como funcionar sob as restrições específicas que realmente enfrentaria. Ao treinar o modelo para esquecer intencionalmente e se adaptar a um tamanho de memória fixo desde o início, a equipe demonstrou que o sistema poderia performar significativamente melhor do que aqueles treinados com recursos ilimitados, mesmo rodando em um único chip de computador moderadamente potente.

A equipe, liderada por cientistas da Amazon Web Services e da Universidade de Amsterdã, desenvolveu uma nova maneira de ajustar esses grandes modelos de linguagem. Em vez de usar supercomputadores massivos para simular uma memória perfeita, eles ensinaram os modelos a coadaptar-se com uma política específica de gerenciamento de memória. Imagine um bibliotecário que é treinado para organizar livros em uma biblioteca com prateleiras infinitas, apenas para ser informado mais tarde que deve trabalhar em uma sala minúscula com uma única prateleira. O bibliotecário treinado na biblioteca grande provavelmente teria dificuldade em priorizar o que manter na sala pequena. Em contraste, o método proposto neste artigo treina o bibliotecário diretamente na sala pequena, ensinando-o exatamente quais livros manter e quais descartar com base nas regras daquele espaço específico. Isso permite que o modelo aprenda o ritmo de suas próprias limitações, em vez de tentar desaprender os hábitos de ter muito espaço.

Os pesquisadores testaram essa abordagem em um modelo com quatro bilhões de parâmetros, um tamanho substancial, mas gerenciável. Eles realizaram seus experimentos em uma única placa gráfica com 40 gigabytes de memória, uma configuração acessível para muitas organizações comparada aos clusters de dezenas de placas exigidos pelos métodos anteriores. Eles compararam essa nova técnica de treinamento contra o método padrão, que utiliza uma técnica chamada paralelismo de sequência para dividir a carga de memória entre múltiplos dispositivos caros. Os resultados mostraram que os modelos treinados com o novo método frequentemente superaram os modelos padrão, particularmente quando a tarefa exigia que o sistema gerasse respostas específicas e concisas, em vez de textos longos e prolixos. Em vários testes envolvendo perguntas complexas e extração de dados, o método padrão produziu saídas que eram excessivamente longas e cheias de números aleatórios e sem sentido, enquanto o novo método aprendeu a parar no momento certo e fornecer o valor único correto.

Uma parte fundamental desse sucesso foi a melhoria do "oráculo de heavy-hitter", uma estratégia popular para decidir qual informação manter. Essa estratégia funciona rastreando em quais partes de informação o modelo presta mais atenção ao longo do tempo. Os pesquisadores descobriram que a versão original dessa estratégia era lenta e ineficiente. Eles reescreveram o código subjacente para funcionar muito mais rápido, permitindo que o sistema calculasse essas pontuações de importância sem atrasar todo o processo. Essa otimização significou que o sistema poderia tomar decisões inteligentes sobre o que esquecer em tempo real, sem precisar do enorme poder computacional que geralmente acompanha tais tarefas. A equipe também lançou uma nova biblioteca de software de código aberto para disponibilizar essas técnicas a outros, visando baixar a barreira para qualquer pessoa que deseje construir sistemas de IA de contexto longo sem precisar de uma fortuna em hardware.

O estudo destaca que a maneira como um modelo é treinado é tão importante quanto o hardware em que ele roda. Quando os pesquisadores forçaram o modelo a treinar com as exatas mesmas restrições de memória que ele enfrentaria durante o uso, ele aprendeu a navegar por essas restrições de forma eficaz. Em um teste específico envolvendo dados JSON, o método padrão falhou completamente, sendo incapaz de encontrar os pontos de dados corretos, enquanto o novo método teve sucesso em identificá-los cerca de metade das vezes. Isso sugere que a capacidade de lidar com contextos longos não é apenas uma questão de ter mais memória, mas de ensinar o sistema a gerenciar a memória que ele possui. As descobertas indicam que, para muitas aplicações, o caminho mais eficaz à frente não é construir computadores maiores, mas ensinar o software a ser mais eficiente com os recursos que ele já possui.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →