← Últimos artigos
💬 NLP

Position Encoding in Transformers: From Absolute and Relative Methods to Rotary Position Embeddings and Long-Context Scaling

Este levantamento técnico fornece uma estrutura unificada para compreender os métodos de codificação de posição em Transformers — desde abordagens absolutas e relativas até o Rotary Position Embedding (RoPE) — ao mesmo tempo em que analisa suas propriedades computacionais, técnicas de escalonamento de contexto longo e a distinção crítica entre a capacidade de extrapolação de comprimento e a generalização confiável de contexto longo.

Autores originais: Jiguo Li

Publicado 2026-08-12
📖 7 min de leitura🧠 Leitura aprofundada

Autores originais: Jiguo Li

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando ensinar um robô a entender uma história. Você tem um cérebro superveloz que consegue olhar para todas as palavras de uma frase ao mesmo tempo, em vez de ler uma por uma como um humano. Este é o segredo do Transformer, o motor por trás da IA moderna. Mas há um problema: como este cérebro vê tudo de uma vez, ele não tem ideia de qual palavra veio primeiro, segunda ou por último. Se você embaralhasse as palavras de uma frase, este cérebro pensaria que a versão embaralhada é tão boa quanto a original. Para consertar isso, temos que dar à IA uma maneira de saber "onde" cada palavra se situa na linha. Chamamos isso de Codificação de Posição (Position Encoding). Pense nisso como dar a cada palavra uma etiqueta de identificação única ou um número de assento. Sem essas etiquetas, a IA é como um convidado em uma festa que consegue ver o rosto de todos, mas não tem ideia de quem está ao lado de quem, ou quem chegou primeiro.

Este artigo é um mergulho profundo nos diferentes sistemas de "etiquetas de identificação" que inventamos para a IA ao longo dos anos. Ele traça a história desde simples números de assento até relógios rotativos complexos e, finalmente, uma nova geração de truques que permitem que a IA leia livros com centenas de milhares de palavras sem se confundir. O autor não está apenas listando esses métodos; ele está descobrindo quais realmente funcionam quando tentamos estendê-los para lidar com histórias massivas, e nos alerta que só porque um sistema pode aceitar uma entrada longa, não significa que ele a compreende.

A Evolução do "Número de Assento" da IA

No início, a maneira mais simples de dar um número de assento a uma palavra era apenas procurá-la em um dicionário. Isso é chamado de Posição Absoluta Aprendida (Learned Absolute Position). Imagine um professor entregando uma lista onde a "Palavra 1" recebe uma cor específica, a "Palavra 2" recebe outra, e assim por diante. Isso funciona muito bem para histórias curtas, mas se você tentar ler um romance e o professor tiver feito uma lista apenas para as primeiras 500 palavras, a IA se perde quando chega na palavra 501.

Depois veio a Codificação Sinusoidal (Sinusoidal Encoding). Em vez de uma lista estática, a IA usa um padrão de onda matemática (como uma onda senoidal) para gerar números de assento. Pense nisso como um conjunto de relógios girando em diferentes velocidades. Alguns relógios batem rápido para diferenciar a palavra 1 da palavra 2, enquanto outros batem lentamente para diferenciar a palavra 1 da palavra 1.000. Isso é inteligente porque a IA pode calcular um número de assento para qualquer posição, mesmo aquelas que ela ainda não viu. No entanto, o artigo aponta que só porque você pode calcular o número, não significa que a IA saiba como usá-lo para distâncias muito longas.

Em seguida, os pesquisadores perceberam que, na linguagem, o que mais importa é frequentemente a distância entre as palavras, não seus números de assento absolutos. A palavra "ele" está perto do substantivo ao qual se refere? Isso levou à Codificação de Posição Relativa (Relative Position Encoding). Em vez de dizer "Estou no assento 50", a IA aprende a dizer "Estou a 3 assentos de distância de você". Isso é como um jogo de dança das cadeiras onde você só se importa com quem está sentado ao seu lado, não com o número exato na sua cadeira. Métodos como T5 e Transformer-XL usam isso para lidar com textos longos, focando no intervalo entre as palavras.

A Estrela do Show: RoPE

O artigo destaca um método de terceira geração chamado RoPE (Rotary Position Embedding) como o atual campeão para muitos grandes modelos de IA. Em vez de adicionar um número à palavra ou calcular uma distância, o RoPE trata os dados da palavra como uma seta giratória. À medida que a palavra avança na linha, sua seta rotaciona. Quando a IA compara duas palavras, ela verifica o ângulo entre suas setas. Se as setas estiverem próximas, as palavras estão próximas na história; se estiverem distantes, as palavras estão distantes.

A beleza do RoPE é que ele lida naturalmente com a "distância" entre as palavras sem precisar de uma tabela de consulta separada. É como se todos na festa usassem um relógio que gira em uma velocidade baseada em quando chegaram. Quando duas pessoas conversam, elas apenas olham para a diferença nas mãos de seus relógios para saber quanto tempo estão separadas.

O Desafio do Contexto Longo: Estendendo a História

O maior problema com esses sistemas é que eles são geralmente treinados em histórias curtas (como 4.000 palavras). Quando tentamos usá-los para documentos massivos (como 128.000 palavras ou mais), os "relógios" ou "setas giratórias" começam a girar em padrões que a IA nunca viu antes. É como tentar dirigir um carro projetado para ruas da cidade em uma rodovia; o motor pode até funcionar, mas o controle parece errado.

O artigo faz um levantamento de várias técnicas de "extensão" para corrigir isso:

  • Interpolação de Posição (PI): Isso espreme a história longa de volta para o espaço curto que a IA conhece. É como comprimir um filme de 10 horas em 2 horas. A IA pode assistir, mas os detalhes ficam borrados, e ela pode perder as diferenças sutis entre palavras que estão próximas.
  • Escalonamento Sensível ao NTK (NTK-aware Scaling): Isso é mais inteligente. Mantém os "relógios rápidos" (que lidam com detalhes próximos) girando em sua velocidade normal, mas desacelera os "relógios lentos" para cobrir a longa distância. É um compromisso que mantém os detalhes locais nítidos enquanto alcança mais longe.
  • NTK Dinâmico (Dynamic NTK): Este método altera o fator de extensão dependendo de quão longa é a história atual. Se a história é curta, não estende nada. Se é longa, estende. No entanto, o artigo alerta que isso pode ser difícil de gerenciar em tempo real porque pode confundir a memória da IA sobre palavras passadas.
  • LongRoPE e LongRoPE2: Estes são os métodos mais avançados. Em vez de usar uma única regra para todos, eles procuram o fator de extensão perfeito para cada parte do cérebro da IA. Eles até misturam histórias curtas e longas durante o treinamento para que a IA aprenda a lidar com ambas. O autor sugere que este é o caminho mais promissor, mas requer um ajuste cuidadoso e dados específicos.

O Grande Aviso: Só Porque Cabe, Não Significa Que Funciona

A descoberta mais importante deste artigo é um choque de realidade. Só porque um modelo de IA pode aceitar uma entrada de 100.000 palavras não significa que ele possa entendê-la. O autor argumenta que muitos modelos falham no teste "Agulha no Palheiro" (encontrar um fato específico em um texto enorme) ou têm dificuldade em raciocinar sobre longas distâncias, mesmo que tenham as configurações sofisticadas de "contexto longo" ativadas.

Eles enfatizam que o comprimento de contexto efetivo (quanto a IA realmente usa) é frequentemente muito menor do que o comprimento de contexto nominal (o número máximo de palavras que ela tecnicamente pode conter). Eles também apontam que simplesmente mudar a matemática para lidar com números maiores não é suficiente; a IA precisa ser treinada novamente ou ajustada com essas novas configurações para realmente aprender a usá-las.

O Veredito

O artigo conclui que, embora tenhamos feito progressos incríveis, desde simples números de assento até setas giratórias complexas, ainda não resolvemos o problema da compreensão de contexto longo. Não existe uma única "bala de prata". A melhor abordagem parece ser uma mistura de escalonamento inteligente (como o LongRope), treinamento cuidadoso com exemplos curtos e longos, e testes rigorosos para ver se a IA está realmente prestando atenção a toda a história, e não apenas ao início e ao fim.

Para qualquer pessoa que esteja construindo ou usando esses modelos de IA, a lição é clara: não confie apenas nos números de marketing. Se você quer que uma IA leia um romance inteiro, você precisa verificar se ela consegue realmente encontrar as reviravoltas no meio, e não apenas se ela consegue engolir o livro inteiro de uma vez. A jornada para uma IA de contexto verdadeiramente longo ainda está em curso, e o caminho à frente exige mais do que números maiores; exige maneiras mais inteligentes de manter a atenção da IA focada.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →