← Últimos artigos
🤖 machine learning

Relational Rank Geometry in Transformers: Detecting and Steering Hidden-State Relation Frames

Este artigo demonstra que estruturas relacionais de alta ordem nos estados ocultos do Transformer podem ser detectadas por meio da entropia de sinal de Plücker e efetivamente orientadas por intervenções direcionadas na geometria do quadro de relações, recuperando assim saídas comportamentais corretas em modelos Llama de diversas escalas.

Autores originais: Mazen Kobrosly

Publicado 2026-05-29
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Mazen Kobrosly

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine um modelo de linguagem grande (como os que alimentam chatbots) como uma cidade massiva e movimentada. Dentro desta cidade, a informação flui por ruas chamadas "estados ocultos". A maioria dos pesquisadores tem observado esta cidade estudando edifícios individuais (neurônios), semáforos únicos (cabeças de atenção) ou estradas específicas (direções). Eles perguntam: "O que este edifício específico faz?"

Este artigo faz uma pergunta diferente: "Como é a relação entre vários edifícios como um todo?"

O autor, Mazen Kobrosly, propõe que, quando um modelo compreende uma relação complexa (como "A é para B assim como C é para D"), ele não apenas acende alguns pontos aleatórios. Em vez disso, os tokens (palavras) envolvidos formam uma forma geométrica específica e rígida no espaço interno do modelo. O artigo chama isso de "Quadro de Relação".

Aqui está uma análise das descobertas do artigo usando analogias simples:

1. O "Nível do Encanador" (Detectando a Forma)

Para encontrar essas formas, o autor inventou uma ferramenta chamada Entropia de Sinal de Plücker.

  • A Analogia: Imagine que você tem um conjunto de três varas flutuando no espaço 3D. Você pode organizá-las para formar uma pirâmide. Se você trocar a ordem das varas, a pirâmide pode virar de cabeça para baixo ou do avesso. Essa "virada" é uma mudança na orientação (como uma mão esquerda versus uma mão direita).
  • O Teste: O autor observa grupos de palavras que deveriam estar relacionados (por exemplo, três palavras formando um quebra-cabeça lógico específico) e grupos de palavras que são apenas um amontoado sem sentido.
  • A Descoberta: Quando o modelo processa as palavras relacionadas corretas, elas se organizam em uma orientação geométrica muito consistente e previsível (como uma pirâmide perfeitamente construída). Quando as palavras estão embaralhadas, elas parecem uma pilha bagunçada de varas sem forma consistente.
  • O Resultado: Essa "assinatura geométrica" foi encontrada em modelos Llama de diferentes tamanhos (8 bilhões, 70 bilhões e 405 bilhões de parâmetros). Quanto maior o modelo, mais clara e consistente era essa forma.

2. A "Grade Mágica" (O Experimento)

Para provar que essa forma realmente causa o modelo a pensar corretamente, o autor criou um jogo chamado Ensaio de Grade de Aresta.

  • A Analogia: Imagine uma planilha com 8 linhas e 8 colunas.
    • Estado Limpo: As marcações "SIM" formam uma linha diagonal perfeita (Linha 1 conecta à Coluna 1, Linha 2 à Coluna 2, etc.). O modelo identifica corretamente isso como um "padrão diagonal".
    • Estado Corrompido: As marcações "SIM" estão embaralhadas de modo que várias linhas apontam para a mesma coluna. O modelo identifica corretamente isso como um "padrão duplicado".
  • A Intervenção: O autor pegou o estado "Corrompido" (onde o modelo estava confuso) e tentou "dirigi-lo". Eles não apenas deram um leve empurrão ao modelo; tentaram remodelar fisicamente a "nuvem" interna de dados que representa essas palavras.

3. A "Escultura de Argila" (Direcionando o Modelo)

O autor tentou corrigir o modelo "Corrompido" movendo seus dados internos de diferentes maneiras. Pense nos dados como um bloco de argila.

  • Tentativa A: Mover o Centro (Centróide Apenas): Eles tentaram apenas empurrar todo o bloco de argila na direção da resposta "Limpa".
    • Resultado: Falha. O modelo permaneceu confuso. Mover o centro de massa não corrigiu a lógica.
  • Tentativa B: Adicionar Ruído: Eles adicionaram estática aleatória aos dados.
    • Resultado: Falha. O modelo permaneceu confuso.
  • Tentativa C: Remodelar o Bloco (Apenas Forma): Eles mantiveram o bloco no mesmo lugar, mas remodelaram para corresponder à geometria da resposta "Limpa". Eles torceram e viraram a argila até que ela parecesse exatamente com a escultura "Limpa".
    • Resultado: Sucesso! O modelo começou a dar a resposta correta de repente.

A Chave da Descoberta: Não era onde os dados estavam (a localização) que importava; era como os dados estavam organizados em relação a si mesmos (a forma). O modelo precisa do "esqueleto" geométrico específico da relação para funcionar.

4. A "Transferência de Planta" (Sucesso Cruzado entre Prompts)

O autor testou se essa "Forma Limpa" era uma correção universal.

  • Eles pegaram a "Forma Limpa" de um quebra-cabeça específico e aplicaram a um diferente quebra-cabeça com a mesma estrutura, mas com palavras diferentes.
  • Resultado: Funcionou! O modelo resolveu o novo quebra-cabeça.
  • O Problema: Isso só funcionou se a "Forma Limpa" viesse de um exemplo corretamente resolvido. Se eles tentassem transferir uma "Forma Limpa" de um exemplo corrompido, falhou. Isso prova que o modelo não está apenas memorizando palavras específicas; está aprendendo um formato geométrico portátil para "correção".

Resumo das Alegações

O artigo faz três alegações específicas, nada mais:

  1. Detecção: Podemos detectar que os modelos representam relações como formas geométricas específicas (Quadros de Relação) usando uma ferramenta matemática chamada entropia de sinal de Plücker.
  2. Intervenção: Podemos corrigir erros de raciocínio de um modelo não mudando as palavras, mas remodelando cirurgicamente a "nuvem" geométrica interna da relação para corresponder a um exemplo correto.
  3. Especificidade: Isso funciona por causa da forma dos dados, não apenas de sua localização ou tamanho. O modelo depende dessa disposição geométrica específica para obter a resposta correta.

O que o artigo NÃO alega:

  • Não alega ter encontrado a "alma" da IA.
  • Não alega que isso funciona para todo tipo de pergunta (foi testado em grades lógicas específicas).
  • Não alega ter mapeado todo o circuito de como o modelo constrói essas formas (apenas olhou para a forma em si, não para a "máquina" que a constrói).

Em resumo, o artigo mostra que dentro da "caixa preta" de uma IA grande, as relações têm uma forma 3D distinta e mensurável, e se você puder corrigir essa forma, pode corrigir a resposta da IA.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →