← Últimos artigos
💬 NLP

YaRN: Efficient Context Window Extension of Large Language Models

O YaRN é um método computacionalmente eficiente para estender a janela de contexto de modelos de linguagem baseados em RoPE, permitindo que modelos como o LLaMA extrapolem comprimentos de sequência muito maiores do que o treinamento original permitia, com menos tokens e etapas de treinamento do que métodos anteriores.

Autores originais: Bowen Peng, Jeffrey Quesnelle, Honglu Fan, Enrico Shippole

Publicado 2026-02-10
📖 4 min de leitura☕ Leitura rápida

Autores originais: Bowen Peng, Jeffrey Quesnelle, Honglu Fan, Enrico Shippole

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem um assistente de leitura muito inteligente, mas que sofre de uma "amnésia de curto prazo" severa. Ele consegue ler um capítulo de um livro perfeitamente, mas se você der uma enciclopédia inteira para ele, ele começa a se confundir, esquece o que leu no início e acaba "alucinando" ou perdendo o fio da meada.

Esse assistente é o que chamamos de LLM (como o ChatGPT). O problema é que eles têm um "limite de visão" (a janela de contexto). O artigo YaRN apresenta uma técnica para dar a esse assistente uma "supervisão" e uma memória de longo alcance, sem precisar reeducá-lo do zero.

Aqui está a explicação do que eles fizeram, usando analogias:


1. O Problema: A Régua que Encolhe (Position Interpolation)

Para entender a ordem das palavras, os modelos usam uma espécie de "régua invisível" (chamada RoPE) que marca a posição de cada palavra.

Imagine que você está tentando medir uma estrada usando uma régua de 30 cm. Se a estrada tem 1 km, você precisa de muitas réguas. O método antigo (chamado PI) tentava resolver isso "espremendo" a estrada para caber na régua. O problema? Ao espremer a estrada, você perde os detalhes: as marcas de cada metro ficam borradas. É como tentar ler um mapa de uma cidade inteira que foi encolhido até ficar do tamanho de um selo postal. Você vê que existe uma cidade, mas não consegue mais distinguir as ruas.

2. A Solução YaRN: O "Zoom Inteligente"

O YaRN (que significa "Mais uma técnica de extensão de RoPE") é muito mais esperto. Em vez de espremer tudo de uma vez, ele usa uma estratégia de zoom seletivo.

Imagine que você tem um telescópio.

  • Para as coisas que estão muito perto (palavras vizinhas), o YaRN mantém o foco nítido, sem mexer em nada. Ele sabe que para entender uma frase, você precisa de precisão milimétrica.
  • Para as coisas que estão muito longe (o início de um livro em relação ao fim), ele aplica um "zoom out" suave. Ele entende que, para saber se o personagem morreu no capítulo 10, ele não precisa saber a cor exata da meia que o personagem usava, mas sim o contexto geral.

Ele trata as frequências de informação de forma diferente: o que é detalhe fino, ele preserva; o que é contexto geral, ele estica.

3. O Tempero Especial: O Ajuste de Temperatura

Além de ajustar a "régua", os pesquisadores descobriram um truque extra: o ajuste de temperatura no Softmax.

Pense nisso como o "volume" da atenção do assistente. Quando o texto fica muito longo, o assistente começa a ficar sobrecarregado de informações e "grita" com tudo, perdendo a capacidade de distinguir o que é importante. O YaRN ajusta esse volume (a temperatura) para que, mesmo em textos gigantescos, o assistente consiga manter a calma e focar no que realmente importa, sem se perder no ruído.

4. Por que isso é incrível? (Os Resultados)

Os cientistas provaram que o YaRN é:

  • Muito Econômico: É como se, em vez de mandar o assistente para uma faculdade de 4 anos para aprender a ler livros longos, você desse apenas um "treinamento intensivo" de alguns dias. Ele aprende muito mais rápido e gasta muito menos energia (computação).
  • Um Mestre da Extrapolação: Se você treinar o assistente para ler 64 páginas, o YaRN permite que ele consiga ler 128 páginas com uma qualidade surpreendente, quase como se ele já tivesse sido treinado para isso.

Resumo da Ópera

O YaRN é como trocar uma lupa de brinquedo por um sistema de lentes de alta tecnologia que sabe exatamente quando deve dar zoom nos detalhes e quando deve mostrar a paisagem completa. Isso permite que a Inteligência Artificial "leia" livros inteiros, códigos de programação gigantescos ou documentos jurídicos complexos sem perder o sentido do que aconteceu na primeira página.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →