← Últimos artigos
🤖 machine learning

Rethinking Generative Image Pretraining: How Far Are We From Scaling Up Next-Pixel Prediction?

Este artigo investiga as leis de escalonamento da previsão de próximo pixel autoregressiva para modelos de visão, revelando que as estratégias ótimas divergem entre tarefas de classificação e geração e prevendo que o escalonamento impulsionado por computação permitirá a modelagem de imagens pixel a pixel dentro de cinco anos.

Autores originais: Xinchen Yan, Chen Liang, Lijun Yu, Adams Wei Yu, Yifeng Lu, Quoc V. Le

Publicado 2026-05-19
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Xinchen Yan, Chen Liang, Lijun Yu, Adams Wei Yu, Yifeng Lu, Quoc V. Le

Artigo original dedicado ao domínio público sob CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando ensinar um robô a "ver" o mundo. Existem duas maneiras principais de fazer isso:

  1. O Método "Resumo Inteligente": Você mostra uma imagem ao robô, mas primeiro a comprime em algumas palavras-chave ou símbolos (como transformar uma foto de um gato na palavra "gato"). É assim que a maioria da IA moderna funciona hoje.
  2. O Método "Pixel Bruto": Você mostra a imagem ao robô exatamente como ela é, ponto por ponto, cor por cor, pedindo que ele adivinhe o próximo ponto com base nos anteriores. Isso é como tentar aprender um idioma memorizando cada letra de um livro, uma por uma, sem nunca ver uma palavra inteira.

Este artigo faz uma pergunta simples, mas difícil: Quão longe estamos de fazer o método "Pixel Bruto" funcionar muito bem?

Os autores decidiram testar isso treinando modelos de IA para prever o próximo pixel em uma imagem, começando com imagens pequenas e de baixa resolução (32x32 pixels, que parecem miniaturas pequenas e blocadas). Eles queriam ver se esse método simples e "burro" poderia eventualmente escalar para se tornar tão poderoso quanto os métodos de "resumo inteligente".

Aqui estão as quatro grandes descobertas que eles fizeram, explicadas com analogias do cotidiano:

1. A Lacuna "Pixel vs. Palavra"

A Descoberta: Para aprender efetivamente, pixels brutos precisam de 10 a 20 vezes mais dados do que as palavras.
A Analogia: Imagine ensinar uma criança a ler.

  • Palavras (Linguagem): Se você mostrar a palavra "Gato" a uma criança, ela entende instantaneamente um animal peludo que mia. É um pacote denso de informações.
  • Pixels (Imagens): Se você mostrar a uma criança um único ponto vermelho, ela não faz ideia do que é. É um nariz? Um sinal de pare? Um morango? É apenas um ponto.
    Como um único ponto carrega tão pouco significado, a IA precisa observar milhões de pontos a mais para descobrir o padrão. O artigo descobriu que, para atingir o mesmo nível de inteligência, a IA precisa "ler" uma quantidade massivamente maior de dados de pixels do que precisaria para ler texto.

2. Objetivos Diferentes Exigem Receitas Diferentes

A Descoberta: A melhor maneira de escalar a IA depende inteiramente do que você quer que ela faça.
A Analogia: Pense em treinar um atleta.

  • Se você quer que ele seja um Sprinter (Classificação de Imagem): Você precisa de um equilíbrio entre levantamento de peso (músculos maiores/modelo maior) e prática de corrida (dados).
  • Se você quer que ele seja um Maratonista (Geração de Imagem): Você precisa focar quase inteiramente na prática de corrida (mais dados).
    O artigo descobriu que, se você quer que a IA reconheça o que há em uma imagem, você pode simplesmente tornar o "cérebro" da IA maior. Mas, se você quer que a IA crie ou complete uma imagem (como preencher a metade inferior de uma foto), você precisa alimentá-la com uma biblioteca muito maior de exemplos (dados) em vez de apenas aumentar o cérebro. A "melhor" receita para uma tarefa é, na verdade, uma receita ruim para a outra.

3. A Armadilha da Resolução: Imagens Maiores Precisam de Cérebros Maiores

A Descoberta: À medida que as imagens ganham maior resolução (mais nítidas e detalhadas), a IA precisa ficar muito maior muito mais rápido do que a quantidade de dados que ela vê.
A Analogia: Imagine tentar aprender o mapa de uma cidade.

  • Baixa Resolução (32x32): É como olhar para o mapa de uma pequena cidade. Você pode aprender tudo andando muito (mais dados).
  • Alta Resolução (64x64 e acima): É como olhar para o mapa de uma metrópole massiva com arranha-céus e becos minúsculos. Apenas andar mais não ajudará se seu cérebro for pequeno demais para conter todos os detalhes complexos.
    O artigo descobriu que, à medida que as imagens ficam mais nítidas, a "complexidade" da tarefa explode. Para lidar com isso, você não pode apenas alimentar a IA com mais imagens; você precisa construir um cérebro de IA muito, muito maior para lidar com os detalhes intrincados.

4. O Gargalo é Poder de Processamento, Não Livros

A Descoberta: Não estamos esperando por mais imagens para fazer isso funcionar; estamos esperando por computadores mais rápidos.
A Analogia: Imagine que você tem uma biblioteca com todos os livros já escritos (os dados visuais da internet). Você tem um estudante que pode lê-los todos. O problema não é que a biblioteca está vazia; o problema é que o estudante está lendo uma página por ano.
Os autores preveem que, como o poder computacional está crescendo tão rápido (dobrando a cada ano ou mais), conseguiremos treinar esses modelos de "Pixel Bruto" efetivamente dentro dos próximos cinco anos. Os dados já estão lá; só precisamos do músculo computacional para processá-los.

A Conclusão

O artigo conclui que treinar IA para aprender diretamente de pixels brutos não é um beco sem saída. Funciona, segue regras previsíveis e pode eventualmente atingir altos níveis de desempenho. No entanto, atualmente é muito caro e lento porque os pixels são pontos de dados "burros".

Para fazer isso funcionar no futuro, não precisamos inventar novas maneiras de comprimir imagens; precisamos apenas continuar construindo computadores maiores e alimentando-os com quantidades massivas de dados, especificamente adaptados para se queremos que a IA reconheça coisas ou as crie.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →