PERK: Long-Context Reasoning as Test-Time Learning
O artigo apresenta o PERK, um framework de eficiência de parâmetros que utiliza atualizações de gradiente em tempo de teste por meio de loops de meta-aprendizado aninhados para codificar contextos longos em adaptadores de baixo posto, superando significativamente o ajuste fino padrão e modelos especializados em tarefas de raciocínio de contexto longo em várias escalas de modelos.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Os modelos de linguagem de grande escala são ferramentas poderosas que aprenderam a ler e escrever estudando vastas quantidades de texto. Eles se destacam em encontrar padrões e responder perguntas quando a informação está bem diante deles. No entanto, esses modelos enfrentam um obstáculo significativo quando a informação de que precisam está enterrada dentro de uma enorme parede de texto, como um documento de extensão de um livro ou uma transcrição longa. À medida que o texto cresce, os modelos frequentemente lutam para ignorar o ruído irrelevante e encontrar o fato específico necessário para resolver um problema. Essa dificuldade é agravada por uma tendência de muitos modelos de focar pesadamente no início ou no fim de um texto, perdendo o rastro de detalhes escondidos no meio. Pesquisadores há muito buscam maneiras de ajudar esses modelos a lidar com tais tarefas de "contexto longo" sem exigir que sejam treinados do zero, um processo que é frequentemente proibitivamente caro e demorado.
Em um novo estudo apresentado na conferência ICLR 2026, pesquisadores da EPFL propõem uma solução chamada PERK, que significa Parameter Efficient Reasoning over Knowledge (Raciocínio sobre Conhecimento com Eficiência de Parâmetros). Em vez de tentar forçar o modelo a ler um documento massivo de uma só vez, o PERK trata o ato de ler como um processo de aprendizagem que acontece no exato momento em que a pergunta é feita. Imagine um estudante que, ao receber um livro didático grosso e uma pergunta específica, percorre rapidamente as páginas para escrever um conjunto conciso de notas em um bloco de notas. Uma vez que essas notas são escritas, o estudante pode guardar o livro e responder à pergunta usando apenas as notas. O PERK funciona de maneira semelhante. Quando um documento longo é apresentado, o modelo não mantém todo o texto em sua memória ativa. Em vez disso, ele utiliza uma breve fase de aprendizagem interna para comprimir as partes mais importantes desse texto em um pequeno e eficiente conjunto de ajustes em suas próprias configurações internas. Esses ajustes atuam como um módulo de memória especializado, armazenando a essência do documento longo. Uma vez que este "bloco de notas" é criado, o texto original é descartado, e o modelo usa suas novas configurações atualizadas para responder perguntas sobre o conteúdo.
Os pesquisadores desenvolveram um método de treinamento que ensina o modelo a realizar essa compressão e recuperação de forma eficaz. Eles utilizaram uma técnica envolvendo duas camadas de aprendizagem. Na primeira camada, o modelo aprende a codificar rapidamente um fragmento de texto em suas configurações de memória. Na segunda camada, o modelo aprende como usar essas configurações para responder perguntas com precisão. Para manter esse processo eficiente e evitar que o computador fique sem memória, o modelo atualiza apenas uma fração minúscula de seus parâmetros totais — especificamente, um componente leve de adição conhecido como adaptador de baixo posto (low-rank adapter). Isso permite que o modelo aprenda com o contexto sem alterar sua base de conhecimento central. Os pesquisadores testaram essa abordagem em várias tarefas desafiadoras, incluindo encontrar um único fato específico escondido em milhares de páginas de texto, responder a perguntas complexas que exigem a conexão de múltiplas partes de informação e recuperar dados de longas listas de registros de aparência semelhante.
Os resultados mostraram que o PERK superou significativamente os métodos padrão onde os modelos são simplesmente treinados em textos longos para responder perguntas posteriormente. Em testes envolvendo o modelo Qwen-2.5, o PERK melhorou a precisão em até 20% em comparação com essas abordagens padrão. O método provou ser robusto mesmo quando o modelo foi solicitado a lidar com textos muito mais longos do que os que viu durante o treinamento, generalizando com sucesso para contextos de 64.000 e até 128.000 tokens. Além disso, o PERK demonstrou uma capacidade única de ignorar a posição da informação. Enquanto outros modelos frequentemente falham quando o fato relevante é movido do início ou do fim de um texto para o meio, o PERK manteve alta precisão independentemente de onde a informação aparecia. Isso sugere que, ao codificar o texto em uma estrutura de memória flexível em vez de depender de posições fixas, o modelo pode raciocinar de forma mais confiável. A abordagem funcionou consistentemente em diferentes tamanhos de modelos, desde modelos muito pequenos com 0,5 bilhão de parâmetros até modelos maiores com 8 bilhões, e até igualou ou superou o desempenho de modelos massivos especializados projetados especificamente para contextos longos.
Além da precisão, o estudo destacou a eficiência deste método. Como o modelo processa o texto em fragmentos menores e gerenciáveis e descarta o texto original após a codificação, ele requer significativamente menos memória de computador para lidar com documentos extremamente longos. Em testes onde os métodos padrão travaram devido a limites de memória em 128.000 tokens, o PERK continuou a funcionar, processando a informação em uma fração do tempo e usando uma fração da memória. Os pesquisadores concluíram que, ao reformular o raciocínio de contexto longo como uma tarefa de aprendizagem em tempo de teste, onde o modelo se adapta à sua própria memória sobre a hora, é possível alcançar um desempenho superior sem o pesado custo computacional do treinamento tradicional. Esta abordagem oferece um caminho promissor para tornar os modelos de linguagem de grande escala mais capazes de lidar com a vasta e complexa informação encontrada no mundo real.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.