← Últimos artigos
🤖 AI

LinearKV: One Cached State Suffices for Position-Independent Caching in Hybrid LLMs

O artigo apresenta o LinearKV, um framework livre de treinamento que possibilita o cache independente de posição em LLMs híbridos ao demonstrar que inicializar camadas de recorrência linear com um único estado em cache é mais eficaz e eficiente do que a composição algebricamente exata de todos os estados em cache utilizados em métodos concorrentes.

Autores originais: Yirui Liu, Ruoling Qi, Longwen Wang, Xuaner Wu, Jian Chen, Yuxin Jin, Jiawei Shao, Xuelong Li

Publicado 2026-08-13
📖 4 min de leitura☕ Leitura rápida

Autores originais: Yirui Liu, Ruoling Qi, Longwen Wang, Xuaner Wu, Jian Chen, Yuxin Jin, Jiawei Shao, Xuelong Li

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está administrando uma biblioteca massiva e superinteligente onde um robô bibliotecário lê livros para responder às suas perguntas. O problema é que a biblioteca está crescendo tão rápido que ler um livro inteiro desde a primeira página toda vez que você faz uma pergunta leva uma eternidade. Para acelerar o processo, os bibliotecários inventaram um truque inteligente: eles memorizam trechos de livros que já leram. Se você perguntar sobre uma história que eles já viram antes, eles apenas consultam suas anotações em vez de reler o livro todo. Isso é chamado de "caching". Mas há um porém: geralmente, eles só podem usar essas anotações se a história começar exatamente da mesma forma de antes. Se você mudar o começo, as anotações tornam-se inúteis.

Recentemente, cientistas inventaram uma nova maneira de tornar essas bibliotecas ainda mais rápidas, misturando dois tipos de estilos de leitura. Um estilo é como um bibliotecário tradicional que lembra de cada palavra (Atenção Total), enquanto o outro é como um robô super eficiente que lembra apenas de um único "estado de resumo" da história até o momento (Linear/Recorrente). Essa abordagem híbrida é ótima, mas quebrou o antigo truque de caching. O antigo truque dependia de costurar páginas de notas, mas o novo estilo de robô não possui páginas para costurar; ele possui apenas um único estado de resumo. Assim, o grande questionamento tornou-se: ainda podemos usar o truque de "notas de qualquer lugar" com esses novos robôs híbridos, ou temos que começar do zero toda vez?

Este artigo, intitulado LINEARKV, responde a essa pergunta com uma reviravolta surpreendente. Os pesquisadores descobriram que você pode, sim, usar o truque de "notas de qualquer lugar" com esses modelos híbridos, mas a maneira como você combina as notas importa mais do que você imagina. Eles descobriram que a maneira mais lógica e matematicamente perfeita de combinar as notas de diferentes trechos de uma história na verdade deixa o robô confuso e gera respostas terríveis. Em vez disso, a melhor estratégia é chocantemente simples: apenas pegue as notas do último trecho que você encontrou e use isso como seu ponto de partida.

Veja como eles descobriram isso. Quando o robô híbrido lê um trecho de texto, ele comprime tudo o que aprendeu em um pequeno "estado" (um resumo). Se você tiver três trechos de texto armazenados em cache, você tem esses três resumos. A maneira "perfeita" de combinar os três é tentar reconstruir exatamente como o cére-do-robô seria se tivesse lido todos os três trechos em ordem desde o início. Os autores chamam isso de "composição exata". Parece ser a coisa certa a se fazer, como tentar remontar perfeitamente um quebra-cabeça. No entanto, quando testaram isso em um tipo específico de modelo híbrido chamado Mamba-2, falhou completamente. O robô ficou tão confuso que recuperou apenas cerca de 46,6% da qualidade de uma leitura do zero.

Por outro lado, o método de "resumo único" — apenas pegar o resumo do último trecho e ignorar o restante — funcionou incrivelmente bem. Ele elevou a qualidade para 86,8% de uma leitura do zero. Acontece que tentar colar matematicamente os resumos introduz erros que se acumulam e quebram a lógica do robô. Ao usar apenas o resumo mais recente, o robô evita esses erros e mantém-se no caminho certo. Curiosamente, no outro tipo de modelo híbrido que testaram (chamado GDN), tanto o método da "matemática perfeita" quanto o do "resumo único" funcionaram de forma semelhante, recuperando até 92% da qualidade.

Os pesquisadores também verificaram a velocidade disso. Usar o método de "resumo único" não foi apenas mais preciso para o modelo Mamba-2, mas também mais rápido. Ele reduziu o tempo para obter a primeira resposta para 0,46 vezes o tempo de ler tudo do zero, enquanto o método da "matemática perfeita" era ligeiramente mais lento e ainda dava respostas ruins.

Em suma, o artigo mostra que, para esses novos modelos de IA híbridos, você não precisa de matemática complexa para reutilizar memórias antigas. Na verdade, fazer a matemática complexa pode te prejudicar. A melhor abordagem é manter a simplicidade: pegue a memória da última peça do quebra-cabeça que você encontrou e deixe a IA preencher as lacunas. Este método funciona em diferentes tipos de tarefas de documentos longos, desde responder perguntas sobre história até rastrear variáveis em uma história, provando que, às vezes, a solução mais simples é a mais inteligente.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →