Inferring the Size of Large Language Models From Popular Text Memorization
Este artigo apresenta um método de caixa-preta que infere limites inferiores conservadores para as contagens de parâmetros de grandes modelos de linguagem, analisando sua precisão de memorização de textos populares, permitindo a classificação dos tamanhos dos modelos e revelando estratégias ocultas de escalonamento da indústria, mesmo para sistemas com pesos fechados.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine que você entra em uma sala onde várias pessoas estão recitando histórias famosas como Alice no País das Maravilhas ou a Bíblia. Você não consegue vê-las, não pode perguntar o tamanho de seus cérebros e não pode espiar suas anotações. Você só pode ouvir o que elas dizem a seguir quando as interrompe no meio de uma frase.
Este é exatamente o problema que os pesquisadores enfrentaram com os modelos de IA modernos (Modelos de Linguagem de Grande Escala). As grandes empresas de tecnologia constroem essas IAs poderosas, mas mantêm seus "projetos" secretos. Elas não dizem quantos "neurônios" (parâmetros) a IA possui, que é a maneira padrão de medir o quão inteligente ou cara é um modelo.
Este artigo apresenta um método inteligente de detetive "caixa-preta" para estimar o tamanho desses cérebros de IA secretos apenas ouvindo o quão bem eles completam frases.
A Ideia Central: O "Teste de Memória"
Os pesquisadores perceberam que quase toda IA grande é treinada no mesmo monte massivo de texto da internet. Isso significa que todas leram os mesmos livros populares, textos religiosos e documentos famosos.
Pense nisso como um concurso de memória. Se você pedir a uma pessoa para completar uma frase de um livro que ela memorizou, uma pessoa com um cérebro maior (mais parâmetros) geralmente acertará com mais frequência do que alguém com um cérebro menor.
Os pesquisadores testaram isso:
- Selecionando 37 textos famosos de domínio público (como Hamlet, a Bíblia e a Constituição dos EUA).
- Cortando-os em milhares de pequenos fragmentos.
- Pedindo a diferentes modelos de IA que previssem a próxima palavra exata nesses fragmentos.
Eles encontraram um padrão claro: quanto maior a IA, melhor ela era em adivinhar a próxima palavra nessas histórias famosas. Embora outros fatores (como o modo como a IA foi ensinada) importem, o tamanho do cérebro foi o principal motor do sucesso.
As Duas Ferramentas de Detetive
Para transformar essas "pontuações de memória" em uma estimativa de tamanho, a equipe criou duas ferramentas diferentes:
1. A "Lei de Escalonamento" (O Mapa)
Imagine que você tem um grupo de pessoas conhecidas (IAs de código aberto) cujos tamanhos de cérebro você sabe. Você plota suas pontuações de memória contra seus tamanhos conhecidos e desenha uma curva suave conectando os pontos. Parece uma escada: conforme a pontuação sobe, o tamanho sobe exponencialmente.
- Como funciona: Quando uma IA secreta faz o teste, você vê onde ela cai na escada. Se ela pontuar como um modelo de 100 bilhões de parâmetros, você estima que é aproximadamente desse tamanho.
- O Problema: Como a IA secreta pode ser construída de forma diferente (como um modelo de "Mistura de Especialistas", onde apenas parte do cérebro está ativa a cada momento), os pesquisadores decidiram ser muito conservadores. Eles não adivinham o tamanho exato; eles adivinham um piso mínimo. Eles dizem: "Esta IA tem pelo menos este tamanho."
2. O Teste "Cara a Cara" (A Corrida)
Às vezes, você não precisa de um número exato; você só precisa saber quem é maior.
- Como funciona: Os pesquisadores colocam duas IAs secretas uma contra a outra no mesmo teste de memória. Eles usam uma "corrida" estatística para ver se uma IA é consistentemente melhor em completar as frases do que a outra.
- O Resultado: Se a IA A vencer a IA B na corrida, eles podem afirmar com confiança: "A IA A é definitivamente maior que a IA B", mesmo sem conhecer os números exatos.
O Que Eles Descobriram
A equipe testou seu método em 19 modelos de código aberto (onde conheciam as respostas) e acertou 95% das vezes. Em seguida, voltaram seus olhos para os modelos "secretos" de empresas como OpenAI, Google, Anthropic e Alibaba.
Eis o que o "trabalho de detetive" revelou sobre as estratégias ocultas da indústria:
- A Estratégia do "Cérebro Grande" (Google e Anthropic): Essas empresas parecem estar construindo modelos com contagens massivas de parâmetros. Por exemplo, seus modelos de ponta mostraram sinais de terem centenas de bilhões de parâmetros, sugerindo que estão ficando cada vez maiores a cada nova geração.
- A Estratégia de "Eficiência" (OpenAI e Alibaba): Surpreendentemente, os pesquisadores descobriram que os modelos mais recentes da OpenAI (como GPT-4o e variantes do GPT-5) não pareciam estar ficando significativamente maiores em termos de contagem bruta de parâmetros em comparação com suas versões mais antigas. Eles parecem ter atingido um "teto de tamanho". Em vez de tornar o cérebro maior, eles parecem estar tornando o cérebro existente mais inteligente através de melhor treinamento ou algoritmos mais inteligentes.
- Verificação de Hierarquia: O método identificou corretamente a classificação interna dos produtos. Por exemplo, ele adivinhou corretamente que o modelo "Opus" da Anthropic é maior que seu modelo "Sonnet", que é maior que seu modelo "Haiku", sem que essa ordem fosse informada anteriormente.
As Limitações (O Texto Miúdo)
O artigo é muito honesto sobre o que ele não consegue fazer:
- É um Limite Inferior: O método é projetado para ser seguro. Ele dirá que a IA tem pelo menos o tamanho X, mas o tamanho real pode ser muito maior. É como dizer: "Esta caixa pesa pelo menos 10 libras", quando na verdade pode pesar 50.
- O Problema do "MoE": Algumas IAs modernas usam uma arquitetura de "Mistura de Especialistas". Imagine uma biblioteca onde apenas alguns bibliotecários específicos são chamados para responder a uma pergunta, em vez de toda a equipe. Como os pesquisadores não podem ver quantos bibliotecários existem no total versus quantos estão ativos, eles não podem obter uma contagem total exata para esses modelos, apenas um mínimo conservador.
- Sem Trapaça: O método assume que a IA não está tentando enganá-los. Se uma empresa programar intencionalmente sua IA para esquecer livros famosos para esconder seu tamanho, este método falharia.
A Conclusão
Este artigo prova que você não precisa dos projetos secretos de uma empresa para ter uma boa ideia do tamanho de sua IA. Ao simplesmente testar o quão bem uma IA lembra histórias famosas, você pode inferir um "tamanho mínimo" confiável e descobrir se uma empresa está fazendo seus modelos crescerem tornando-os maiores ou tornando-os mais inteligentes. Isso transforma a "caixa-preta" da IA em algo que podemos espiar, mesmo que não possamos ver tudo.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.