← Últimos artigos
🤖 machine learning

Representational Capacity: Geometric Limits on Feature Representation in Transformer Language Models

Este artigo propõe um framework para estimar a capacidade representacional de modelos de linguagem transformer ao analisar os limites geométricos de direções de características quase ortogonais, revelando que a capacidade é exponencialmente sensível a restrições de ortogonalidade e introduzindo uma fórmula ajustada que melhora significativamente a precisão de previsão em relação aos limites tradicionais.

Autores originais: Alexander Guha

Publicado 2026-06-03
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Alexander Guha

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

A Grande Pergunta: Quantas Coisas um Cérebro Pode Guardar?

Imagine que você tem um armazém gigante e vazio (este é o "cérebro" ou espaço latente do modelo de IA). O tamanho do armazém é determinado pelas suas dimensões (dmodeld_{model}).

Por muito tempo, as pessoas pensaram: "Se eu tiver um armazém com 4.000 prateleiras, só posso armazenar 4.000 itens distintos". Se um item é "Gato" e outro é "Cachorro", eles precisariam estar em prateleiras completamente diferentes, sem se tocar.

Mas este artigo argumenta que os modelos de IA são muito mais espertos. Eles usam um truque chamado Superposição. Em vez de colocar "Gato" em uma prateleira e "Cachorro" em outra, eles os organizam de modo que estejam quase em prateleiras diferentes, mas levemente sobrepostos. É como empilhar livros em uma biblioteca tão apertados que eles se inclinam uns contra os outros, mas você ainda consegue distingui-los.

O artigo pergunta: Quantos itens podemos realmente empilhar neste armazém antes que eles comecem a colidir uns com os outros e se tornarem uma bagunça?

A Descoberta Chave: O Limite da "Inclinação"

Os autores descobriram que, para que esses itens "inclinados" funcionem, eles não podem inclinar demais. Eles precisam estar quase perfeitamente verticais (ortogonais). Se inclinarem demais, a IA fica confusa.

Eles mediram esse limite de "inclinação", que chamam de ϵ\epsilon (epsilon).

  • ϵ\epsilon Baixo (Estrito): Os itens estão quase perfeitamente retos. Eles podem compactar um número enorme de itens, mas precisam ter muito cuidado para não esbarrar.
  • ϵ\epsilon Alto (Livre): Os itens estão inclinados para todos os lados. Eles não conseguem compactar muitos itens sem que eles colidam.

A Surpresa: Os pesquisadores examinaram dezenas de modelos de IA e descobriram que eles se dividem em dois grupos distintos:

  1. O Grupo "Bagunçado": Estes modelos têm ϵ\epsilon alto. Seus "livros" estão tão inclinados que eles não estão usando o truque de superposição de forma eficaz.
  2. O Grupo "Organizado": Estes modelos têm ϵ\epsilon muito baixo. Eles mantêm seus "livros" quase perfeitamente retos, permitindo que empacotem milhões de conceitos em um espaço pequeno.

A Matemática Antiga Estava Errada

Anteriormente, os cientistas usavam uma regra matemática famosa (o lema de Johnson-Lindenstrauss) para prever quantos itens caberiam. Essa regra era baseada em como itens aleatórios se comportam se você apenas os jogasse em uma sala.

O artigo diz: "Esta matemática está totalmente errada para uma IA treinada."

  • A Matemática Antiga: Previa que um modelo com um armazém de 4.000 prateleiras poderia conter apenas entre 8 e 300 itens distintos.
  • A Realidade: Esse mesmo modelo contém 32.000 palavras (seu vocabulário) além de milhões de outros conceitos.

A matemática antiga falhou porque assumia que os itens eram colocados aleatoriamente. Mas os modelos de IA são treinados para serem otimizadores. Eles não apenas jogam os itens lá dentro; eles os organizam cuidadosamente para encaixar o máximo possível, como um mestre do Tetris.

A Nova Fórmula: É Sobre a Razão

Os autores criaram uma nova fórmula para corrigir a matemática. Eles descobriram que o número de coisas que você pode encaixar não depende apenas do número de itens, mas da razão entre os itens e o tamanho do armazém.

Pense nisso como:

  • Se você tem uma sala pequena, só pode colocar poucas pessoas próximas umas das outras.
  • Se você tem um estádio enorme, pode acomodar uma multidão massiva, mas a densidade (pessoas por metro quadrado) importa mais do que a contagem total.

A nova fórmula deles mostra que modelos treinados podem compactar ordens de magnitude mais itens do que a antiga matemática aleatória previa.

O Trade-off: Estabilidade vs. Capacidade

Aqui está a descoberta mais interessante sobre os modelos maiores (aqueles com mais "prateleiras"):

Você poderia pensar que modelos maiores tentariam compactar o máximo de itens possível deixando-os inclinar um pouco mais (aumentando o ϵ\epsilon). Mas o artigo descobriu o oposto.

Modelos maiores na verdade ficam mais "retos".

Eles escolhem manter seus itens muito estritamente separados (baixo ϵ\epsilon), embora isso tecnicamente reduza o número total de itens que eles poderiam caber.

  • Por quê? Os autores sugerem que é um equilíbrio entre Capacidade (quantas coisas você pode armazenar) e Estabilidade (o quão confiável é encontrar essas coisas).
  • Se você inclinar demais, pode até armazenar mais coisas, mas corre o risco de elas colidirem quando a IA tentar usá-las. Modelos maiores parecem priorizar o não colidir em vez de maximizar o armazenamento.

Resumo em Poucas Palavras

  1. O Armazém: Os modelos de IA armazenam conceitos como direções em um espaço multidimensional.
  2. O Truque: Eles compactam esses conceitos tornando-os "quase ortogonais" (quase retos, mas levemente inclinados).
  3. O Limite: Existe um limite estrito para o quanto eles podem inclinar antes de ficarem confusos. Esse limite é chamado de ϵ\epsilon.
  4. As Classes: Alguns modelos são bagunçados (ϵ\epsilon alto), mas os melhores são muito organizados (ϵ\epsilon baixo).
  5. A Correção Matemática: A matemática antiga dizia que eles poderiam conter apenas algumas coisas. A nova matemática (baseada em como eles são realmente treinados) diz que eles podem conter milhões.
  6. A Lição: À medida que os modelos crescem, eles não tentam lotar o armazém até o limite. Em vez disso, mantêm tudo muito bem organizado para garantir que não fiquem confusos, valorizando a estabilidade acima da capacidade bruta.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →