← Últimos artigos
🤖 machine learning

A Geometric Perspective on Next-Token Prediction in Large Language Models: Three Emerging Phases

Ao reaproveitar lentes de representação como ferramentas de diagnóstico geométrico para rastrear a evolução dos subespaços de leitura preditiva através das camadas, este estudo revela que os modelos de linguagem de grande escala processam a previsão do próximo token por meio de três fases geométricas distintas — Multiplexação de Semente, Elevação de Sobrescrita e Convergência Focal — nas quais o aumento da profundidade do modelo aprimora principalmente a desambiguação de candidatos em vez de expandir a capacidade representacional.

Autores originais: Gianfranco Lombardo, Giuseppe Trimigno, Stefano Cagnoni

Publicado 2026-05-12
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Gianfranco Lombardo, Giuseppe Trimigno, Stefano Cagnoni

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine um Modelo de Linguagem de Grande Escala (LLM) como uma fábrica massiva de vários andares, onde uma peça de informação (uma palavra) viaja do térreo até o telhado. Em cada andar, uma equipe de trabalhadores adiciona um pouco de nova informação ao pacote antes de passá-lo para cima. O grande mistério que este artigo resolve é: como a fábrica decide qual palavra emitir a seguir e onde essa decisão realmente ocorre?

Os autores não se limitaram a perguntar o que o modelo prevê em cada andar; eles perguntaram onde a previsão reside dentro da maquinaria da fábrica e como ela se move à medida que sobe.

Aqui está a história de sua descoberta, decomposta em conceitos e analogias simples.

A Ferramenta: A "Lente de Representação"

Geralmente, se você espiar dentro da fábrica nos andares intermediários, os trabalhadores parecem confusos. Eles seguram uma mistura embaralhada de possibilidades e, se você tentar adivinhar a palavra final com base no que estão segurando, erra. Isso ocorre porque os trabalhadores estão segurando a informação em uma "superposição" — como um mágico segurando um baralho de cartas com a face para baixo, onde todas as cartas estão misturadas.

Os pesquisadores usaram uma ferramenta especial chamada Lente de Representação. Pense nisso como um par de óculos mágicos que podem girar e focar a visão dos trabalhadores. Em vez de apenas olhar para a pilha bagunçada de cartas, a lente encontra o ângulo específico onde a "carta vencedora" (a próxima palavra correta) está realmente visível, mesmo que esteja enterrada sob outras cartas.

A Descoberta: Uma Peça de Três Atos

Ao rastrear como a "carta vencedora" se move pela fábrica usando esses óculos, os autores descobriram que o processo não é aleatório. Ele segue uma dança geométrica estrita de três estágios que ocorre em quase todos os modelos testados (desde modelos pequenos de 1 bilhão de parâmetros até enormes de 32 bilhões).

Fase 1: A "Multiplexação de Semeadura" (A Multidão se Reunindo)

  • O que acontece: À medida que a informação entra na fábrica, os trabalhadores começam a lançar muitas palavras possíveis a seguir ao mesmo tempo. Eles ainda não escolhem um vencedor.
  • A Analogia: Imagine uma sala lotada onde todos estão gritando ideias diferentes. A sala está cheia de ruído, mas a ideia "correta" já está lá, apenas misturada com centenas de outras.
  • A Geometria: A fábrica está expandindo sua "rango" (sua capacidade de reter muitas ideias diferentes). A palavra correta está presente, mas é apenas uma voz em um coral. Ela é visível para a lente mágica, mas ainda não é a voz mais alta.

Fase 2: A "Sobrecarga de Elevação" (O Filtro Silencioso)

  • O que acontece: Esta é a parte mais longa da jornada (cerca de 60% da altura da fábrica). Os trabalhadores param de adicionar novos tipos de ideias. Em vez disso, começam a abaixar silenciosamente o volume das ideias erradas e aumentar o volume da correta.
  • A Analogia: Imagine um engenheiro de som em uma sala de controle. Eles não estão trazendo novos cantores; estão apenas desvanecendo gradualmente o ruído de fundo e reforçando o cantor principal. O cantor principal ainda está cercado pela multidão, mas está se tornando o foco claro.
  • A Geometria: O "rango" (o número de ideias ativas) permanece estável. Os trabalhadores são muito precisos aqui, fazendo ajustes minúsculos, quase invisíveis, que não alteram a forma da sala, mas mudam quem é ouvido. É aqui que o modelo faz o trabalho pesado: desambiguação (descobrir qual dos muitos candidatos é realmente o correto).

Fase 3: A "Convergência Focal" (O Holofote)

  • O que acontece: No trecho final, a fábrica faz uma movimentação massiva e decisiva. Ela despeja toda a sua energia em uma única direção.
  • A Analogia: O engenheiro de som corta repentinamente a energia para todos os outros na sala. O holofote se fixa no cantor principal. A multidão fica em silêncio e o cantor é agora a única coisa que importa.
  • A Geometria: Os trabalhadores param de ser gentis. Eles fazem atualizações enormes e poderosas que se alinham perfeitamente com a direção da saída final. O "rango" encolhe porque estão focando toda a sua energia em apenas um vencedor. A lente mágica agora pode ver a resposta claramente, sem nenhuma ajuda.

A Grande Conclusão: Modelos Maiores = Filtros Melhores, Não Inícios Melhores

A descoberta mais surpreendente é sobre como o tamanho do modelo afeta esse processo.

Os autores descobriram que, à medida que você torna a fábrica maior (adicionando mais andares/camadas):

  1. Fase 1 (A Multidão) permanece aproximadamente do mesmo tamanho.
  2. Fase 3 (O Holofote) permanece aproximadamente do mesmo tamanho.
  3. Fase 2 (O Filtro Silencioso) fica muito mais longa.

A Metáfora: Se você tem uma fábrica pequena, a sala de "filtragem" é pequena. Se você tem uma fábrica gigante, a sala de "filtragem" é enorme.

Isso significa que, quando construímos modelos de IA maiores e mais inteligentes, não estamos necessariamente tornando-os melhores em começar com as ideias certas ou terminar o trabalho. Estamos dando a eles uma sala muito maior e mais detalhada para classificar a confusão e descobrir qual das muitas possibilidades é a correta. O poder extra dos grandes modelos é usado principalmente para desambiguação de candidatos — transformar uma pilha bagunçada de "talvez isso, talvez aquilo" em um único e confiante "sim".

Resumo

O artigo revela que a previsão do próximo token não é um flash súbito de insight no final. É uma jornada geométrica:

  1. Semear: Jogar tudo na mistura.
  2. Elevação: Filtrar silenciosamente o ruído (é aqui que o modelo fica maior).
  3. Convergir: Travar no vencedor com alta energia.

A "magia" dos modelos de linguagem de grande escala reside nessa fase intermediária, onde eles têm o espaço e o tempo para separar cuidadosamente o sinal do ruído.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →