← Últimos artigos
💻 computer science

Predictable Emergence: An Empirical Analysis of Whether Sharp Capability Jumps Follow from Smooth Per-Token Scaling Laws

Este artigo demonstra que os saltos abruptos "emergentes" na precisão de correspondência exata observados na adição de inteiros de múltiplos dígitos não são descontinuidades genuínas na capacidade do modelo, mas sim artefatos totalmente previsíveis resultantes de melhorias suaves, seguindo uma lei de potência, na precisão por token, compostas pela não linearidade de exigir que todos os dígitos estejam corretos.

Autores originais: Alexander Memming

Publicado 2026-07-22
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Alexander Memming

Artigo original sob licença CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está assistindo a um show de mágica onde o mágico fica melhor em tirar coelhos de cartolas à medida que a cartola fica maior. Durante anos, cientistas observaram que, quando tornam os cérebros de IA (chamados de "transformers") maiores e os alimentam com mais dados, eles ficam mais inteligentes de uma forma muito previsível e suave. É como um motor de carro que se torna ligeiramente mais potente cada vez que você adiciona um cilindro; a melhoria é constante e segue uma regra matemática clara. Mas então, as pessoas começaram a notar algo estranho: às vezes, os modelos de IA parecem "acordar" subitamente e aprender uma habilidade totalmente nova da noite para o dia. Um dia eles não conseguem fazer uma conta simples, e no outro, com apenas um pouco mais de tamanho, conseguem resolver problemas complexos perfeitamente. Esse salto repentino é chamado de "emergência", e é assustador porque, se as habilidades aparecem do nada, não podemos prever quando uma IA pode subitamente se tornar perigosa ou incrivelmente inteligente.

A grande questão é: essas habilidades estão realmente aparecendo do nada ou é apenas uma ilusão causada pela forma como as medimos? Pense nisso como um aluno fazendo uma prova. Se você o avaliar com base em "Ele acertou todas as questões?" (uma nota de passar/reprovar), eles podem parecer ter falhado completamente por um longo tempo e, de repente, passar. Mas se você olhar para "Quantas questões ele acertou em média?" (uma pontuação suave), poderá ver que eles estavam, na verdade, melhorando lentamente durante todo o tempo. Este artigo pergunta: o "salto repentino" é real ou é apenas um truço do teste que estamos usando?

O Grande Truque de Matemática

Um pesquisador chamado Alexander Memming decidiu investigar este mistério usando um experimento muito específico e controlado. Ele não treinou novos modelos de IA; em vez disso, usou vários modelos de IA existentes e públicos (chamados Pythia e OPT) que variavam de muito pequenos a bastante grandes. Ele pediu a eles uma tarefa simples: somar dois números grandes. A pegadinha é que ele podia controlar exatamente o quão longa a resposta precisava ser (de 1 dígito até 6 dígitos).

Quando ele observou o desempenho da IA usando a forma "suave" de medir (verificando com que frequência ele acertava cada dígito individualmente), os resultados foram banalmente previsíveis. À medida que os modelos ficavam maiores, eles ficavam ligeiramente melhores em adivinhar cada dígito, seguindo uma curva suave e gentil. Não houve nenhum salto repentino. Era como observar um corredor ficando mais rápido a cada milha percorrida.

No entanto, quando ele mudou para a forma "aguda" de medir (verificando se a resposta inteira estava perfeita), a história mudou completamente. Para respostas curtas, a IA era razoável. Mas para respostas longas, a IA parecia estar falhando miseravelmente por um longo tempo e então — poof — ela começou subitamente a obter pontuações perfeitas. Isso parecia exatamente com o famoso salto de "emergência" de que todos estavam falando.

O Ingrediente Secreto: Uma Fórmula Simples

Memming percebeu que esse "salto" não era mágica; era apenas matemática. Ele construiu um modelo simples para explicar isso. Imagine que você está tentando adivinhar uma senha de 6 dígitos. Se você tiver 90% de chance de acertar qualquer dígito individual corretamente, isso parece ótimo. Mas se você precisar acertar todos os seis dígitos para vencer, suas chances caem para cerca de 53%. Se você tiver apenas 50% de chance por dígito, sua chance de acertar a senha inteira é quase zero.

O artigo mostra que, conforme os modelos de IA ficam maiores, a precisão "por dígito" aumenta lentamente de 50% para 90%. Como o teste exige acertar cada dígito, a pontuação final permanece próxima de zero por um longo tempo, e então dispara para 100% assim que a precisão por dígito se torna alta o suficiente. Não é que a IA subitamente aprendeu um novo superpoder; é apenas que o teste de "tudo ou nada" faz com que uma melhoria lenta e constante pareça uma explosão repentina.

Prevendo o Futuro

A parte mais legal do estudo é que você pode prever esses "saltos" antes que eles aconteçam. Ele pegou os modelos de IA menores (que ainda estavam falhando nos problemas matemáticos longos) e mediu sua melhoria lenta e suave em dígitos individuais. Usando uma fórmula simples que leva em conta quantos dígitos existem na resposta, ele foi capaz de prever exatamente quando os modelos maiores começariam a passar no teste. Suas previsões foram incrivelmente precisas, acertando o ponto do "salto" dentro de uma margem de erro minúscula.

Ele também verificou se havia algum comportamento de "superpoder" oculto que a matemática não pudesse explicar. Ele procurou sinais de que a IA estava fazendo algo extraespecial no momento do salto, mas não encontrou nada. A "emergência" foi inteiramente explicada pela melhoria suave de pequenas partes que se somam para um grande resultado.

O Veredito

Então, o que isso significa? Para a tarefa específica de somar números grandes, o artigo sugere que os assustadores "saltos repentinos" na habilidade da IA são provavelmente uma ilusão criada pela forma como testamos. A IA não está ligando uma nova lâmpada; ela está apenas aumentando lentamente um interruptor de intensidade (dimmer), e nosso teste de "passar/reprovar" faz parecer que a luz simplesmente acendeu de uma vez.

Isso não significa que a IA nunca terá surpresas repentinas, mas nos dá uma ferramenta poderosa: se pudermos medir o progresso suave e constante das pequenas partes, podemos prever quando os grandes e assustadores saltos acontecerão. Isso transforma um mistério em um problema matemático, mostrando que, pelo menos por enquanto, o futuro da IA é mais previsível do que pensávamos.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →