← Últimos artigos
💬 NLP

PaTH Attention: Position Encoding via Accumulating Householder Transformations

Este artigo introduz o PaTH, um esquema de codificação de posição flexível e dependente de dados baseado em transformações de Householder acumuladas que supera o Rotary Position Encoding (RoPE) padrão em tarefas de modelagem de linguagem, oferecendo simultaneamente um treinamento paralelo eficiente e a capacidade de converter modelos RoPE pré-treinados.

Autores originais: Songlin Yang, Yikang Shen, Kaiyue Wen, Shawn Tan, Mayank Mishra, Liliang Ren, Rameswar Panda, Yoon Kim

Publicado 2026-02-05
📖 4 min de leitura☕ Leitura rápida

Autores originais: Songlin Yang, Yikang Shen, Kaiyue Wen, Shawn Tan, Mayank Mishra, Liliang Ren, Rameswar Panda, Yoon Kim

Artigo original dedicado ao domínio público sob CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

O Grande Problema: A Memória "Cega"

Imagine um grande modelo de linguagem (como este com o qual você está falando) como um bibliotecário muito inteligente que lê um livro longo para responder às suas perguntas. Para entender a história, o bibliotecário precisa saber não apenas quais são as palavras, mas onde elas aparecem no livro.

Os modelos atuais usam um sistema chamado RoPE (Codificação de Posição Rotativa) para lembrar das posições das palavras. Pense no RoPE como uma régua fixa e pré-impressa.

  • Se você mover uma palavra da página 1 para a página 2, a régua a desloca por uma quantidade definida.
  • A Falha: Esta régua é "cega" ao conteúdo. Ela trata a palavra "maçã" e a palavra "foguete" exatamente da mesma maneira, apenas porque estão no mesmo lugar. Ela não se importa se a história é sobre uma fruta ou uma nave espacial. Por causa disso, o bibliotecário às vezes fica confuso quando a história exige uma lógica complexa e passo a passo (como rastrear quem possui qual item em uma lista longa).

A Solução: PaTH (A Régua "Inteligente")

Os autores introduzem o PaTH, uma nova forma de lembrar das posições. Em vez de uma régua fixa, o PaTH é como uma régua dinâmica que muda de forma conforme a história que está sendo lida.

  • Como funciona: Enquanto o bibliotecário lê cada palavra, o PaTH aplica um "giro" matemático especial (chamado transformação de Householder) à memória das palavras anteriores.
  • A Analogia: Imagine que você está caminhando por um corredor com espelhos.
    • RoPE: Os espelhos são fixos. Não importa o que você esteja vestindo, seu reflexo parece o mesmo.
    • PaTH: Os espelhos são inteligentes. Se você estiver usando um chapéu vermelho, o espelho gira seu reflexo de um jeito. Se estiver usando um chapéu azul, o espelho o gira de outro jeito. O "giro" depende do conteúdo real (o chapéu) que você está segurando.

Isso permite que o modelo construa um "caminho" de memória que se adapta aos dados específicos que está processando, tornando-o muito melhor em resolver quebra-cabeças que exigem o rastreamento de estados (como lembrar o valor de uma variável em um código de computador).

O Truque de Mágica: Fazendo Isso Rápido

Normalmente, criar uma régua que muda de forma para cada palavra seria incrivelmente lento e computacionalmente caro. Seria como tentar recalcular todos os ângulos dos espelhos do corredor toda vez que você dá um passo.

A segunda grande contribuição do artigo é um algoritmo de aceleração (semelhante ao chamado FlashAttention).

  • A Analogia: Em vez de recalcular todo o corredor a cada vez, os autores encontraram um atalho inteligente. Eles perceberam que, se agruparem os espelhos em pequenos blocos, podem calcular o "giro" para o bloco inteiro de uma só vez usando uma fórmula matemática compacta.
  • O Resultado: Eles construíram um sistema que roda quase tão rápido quanto o antigo sistema de régua fixa (RoPE), mas mantém os benefícios "inteligentes e mutáveis" do novo sistema.

O Que Eles Provaram?

Os autores testaram este novo sistema de duas maneiras:

  1. Quebra-cabeças Sintéticos (Os "Rodinhas de Treinamento"):
    Eles deram ao modelo jogos de lógica simples, como um jogo de "Flip-Flop" onde ele tem que lembrar a última vez que um interruptor foi acionado, ou um jogo de "Problema de Palavras" envolvendo regras matemáticas complexas.

    • Resultado: Os modelos antigos (RoPE) frequentemente falhavam nesses quebra-cabeças, confundindo-se com a sequência. O novo modelo PaTH resolveu-os quase perfeitamente, mesmo com menos camadas de "cérebro" do que os outros.
  2. Tarefas de Linguagem Real:
    Eles treinaram modelos em textos reais (livros, código, conversas).

    • Resultado: Os modelos PaTH foram melhores em entender contextos longos (ler livros muito longos sem esquecer o início) e tiveram um desempenho superior em tarefas de raciocínio, especialmente em programação e matemática.
    • Bônus: Eles mostraram que você pode pegar um modelo existente treinado com a antiga "régua fixa" (RoPE) e convertê-lo para usar a "régua inteligente" (PaTH) com apenas um pouco de treinamento extra, sem precisar começar do zero.

A Conclusão

PaTH é uma nova forma de a IA lembrar a ordem das palavras. Em vez de usar um sistema rígido e universal, ela usa um sistema flexível que muda com base nas próprias palavras. Os autores descobriram como fazer esse sistema flexível rodar rápido o suficiente para ser prático, resultando em modelos de IA que são melhores em lógica, rastreamento de informações a longas distâncias e compreensão de sequências complexas.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →