← Últimos artigos
🤖 machine learning

Abra: Scaling Diffusion Image Training

Este artigo apresenta o Abra, uma família controlada de transformers de correspondência de fluxo (flow-matching) usada para estabelecer leis de escala computacionalmente otimizadas para modelos de difusão de texto para imagem, revelando que eles escalam de forma previsível como modelos de linguagem, mas requerem significativamente mais dados por parâmetro e são robustos ao sobretreinamento.

Autores originais: Kyle Chickering, Wei-An Lin, Swayam Bhanded, Dan Saunders, Akshat Tripathi, Jiaming Song, Shyamal Buch, Xinchen Yan

Publicado 2026-08-19
📖 6 min de leitura🧠 Leitura aprofundada

Autores originais: Kyle Chickering, Wei-An Lin, Swayam Bhanded, Dan Saunders, Akshat Tripathi, Jiaming Song, Shyamal Buch, Xinchen Yan

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Na era moderna da inteligência artificial, uma revolução silenciosa tem ocorrido na forma como os cientistas constroem os programas de computador mais poderosos. Durante anos, pesquisadores confiaram em um conjunto de regras conhecidas como leis de escala para decidir como gastar seu poder computacional. Essas regras atuam como um guia de orçamento, dizendo aos engenheiros se eles devem construir um cérebro ligeiramente maior para seu software ou alimentá-lo com uma biblioteca de informações muito maior. No mundo da IA baseada em texto, essas regras têm sido notavelmente claras: para obter os melhores resultados, você deve dividir seu orçamento computacional de forma aproximadamente igual entre o tamanho do modelo e a quantidade de dados que ele lê. Esse equilíbrio permitiu que as máquinas aprendessem a linguagem com uma eficiência surpreendente, levando às ferramentas sofisticadas que vemos hoje. No entanto, quando se trata de ensinar computadores a criar imagens, as regras permaneceram um mistério. Os dados visuais são muito mais complexos e ruidosos do que o texto, e as tentativas anteriores de mapear essas regras para geradores de imagem foram limitadas pela falta de experimentos em grande escala. Sem um guia claro, os desenvolvedores estavam adivinhando como equilibrar o tamanho do modelo e o volume de dados, muitas vezes desperdiçando vastas quantidades de energia e tempo.

Uma equipe de pesquisadores da Luma AI interveio agora para resolver esse enigma com um experimento massivo e sistemático. Eles construíram uma família controlada de modelos geradores de imagem, variando de muito pequenos a bastante grandes, e os treinaram usando uma quantidade estonteante de poder computacional — muito mais do que qualquer estudo anterior sobre este tópico. Ao conduzir esses modelos através de três ordens de magnitude diferentes de custo computacional, eles puderam observar exatamente como o desempenho muda à medida que os modelos crescem. O trabalho deles revela que as regras para criar imagens são fundamentalmente diferentes das regras para processar linguagem. Enquanto os modelos de texto atingem seu pico de eficiência após ler cerca de vinte palavras para cada unidade de seu tamanho, os modelos de imagem exigem uma dieta muito mais pesada. Os pesquisadores descobriram que, para atingir o ponto de eficiência ideal, um modelo de texto para imagem precisa ver cerca de duzentos tokens de imagem para cada único parâmetro em sua estrutura. Isso significa que, para a geração de imagens, os dados são dez vezes mais críticos do que são para os modelos de linguagem. O antigo conselho de equilibrar o tamanho do modelo e os dados igualmente não se aplica aqui; em vez disso, a estratégia mais eficaz é priorizar a alimentação do modelo com mais imagens, mesmo que isso signifique usar um cérebro menor.

O estudo também descobriu uma rede de segurança surpreendente para os desenvolvedores. No mundo dos modelos de linguagem, se você treinar um sistema por muito tempo em muitos dados, seu desempenho pode sofrer e o esforço extra é desperdiçado. Mas para geradores de imagem, os pesquisadores descobriram que os modelos são incrivelmente tolerantes. Se um praticante decidir treinar um modelo por mais tempo do que o estritamente necessário, a qualidade das imagens não cai significativamente. Na verdade, a perda de desempenho é tão pequena que é quase negligenciável. Essa descoberta oferece uma regra prática para a indústria: é muito mais seguro treinar um modelo menor em uma quantidade massiva de dados do que arriscar treinar um modelo enorme com poucos dados. O tempo de treinamento extra atua como um amortecedor, garantindo resultados de alta qualidade sem a penalidade de recursos desperdiçados que assombra outros tipos de IA.

Além apenas da qualidade final da imagem, a equipe observou como esses modelos aprendem a entender o mundo dentro de seus cérebros digitais. Eles testaram se os modelos eram bons em reconhecer objetos e padrões, uma habilidade conhecida como aprendizado de representação. Eles descobriram que o ponto de eficiência ideal para compreender imagens acontece em um volume de dados muito menor do que o ponto para gerá-las. Um modelo pode se tornar muito bom em reconhecer um gato ou uma paisagem muito antes de se tornar perfeito em pintá-los. Isso sugere que o conhecimento interno do modelo e sua capacidade de criar arte crescem em taxas diferentes. Além disso, os pesquisadores observaram que, à medida que a resolução das imagens aumenta, a necessidade de dados cresce ainda mais. Treinar um modelo para criar imagens de alta definição requer significativamente mais informação visual por unidade de tamanho de modelo do que treinar para criar esboços de baixa resolução.

Talvez a descoberta mais profunda tenha sido que esses modelos geradores de imagem seguem um padrão universal em suas curvas de aprendizado. Quando os pesquisadores ajustaram os dados para contabilizar o tamanho do modelo e a quantidade de computação usada, o progresso do treinamento de cada um dos modelos, do menor ao maior, colapsou em uma única linha suave. Esse fenômeno, conhecido como colapso de escala, significa que o comportamento de um modelo minúsculo pode prever com precisência o comportamento de um gigante. Isso sugere que a mecânica subjacente do aprendizado é consistente em todos os tamanhos, fornecendo uma ferramenta poderosa para engenheiros preverem como um futuro modelo massivo se comportará sem ter que construí-lo e treiná-lo primeiro.

Os pesquisadores também examinaram como diferentes medidas de sucesso, como o quão bem a imagem corresponde a uma descrição de texto ou o quão realista ela parece, escalam com o poder computacional. Eles descobriram que esses diferentes objetivos não atingem o pico ao mesmo tempo. Algumas métricas, como o quão bem a imagem segue um comando, preferem um equilíbrio diferente de dados e tamanho do que outras, como o quão proximamente a imagem corresponde à distribuição de fotos do mundo real. Isso indica que não existe uma configuração única "perfeita" para um gerador de imagem; a melhor configuração depende inteiramente do que o usuário deseja que o modelo faça. Adicionalmente, descobriram que as configurações usadas para guiar o processo de geração, que controlam o quão estritamente o modelo segue instruções, precisam ser ajustadas conforme o modelo cresce. Uma capacidade generativa mais forte na verdade requer menos orientação para produzir bons resultados.

No fim, este trabalho fornece um mapa claro e baseado em dados para o futuro da geração de imagens. Ele move o campo longe das suposições e em direção a uma compreensão precisa de como alocar recursos. A conclusão central é que, para a criação de imagens, os dados são o rei. O caminho mais eficiente não é construir o modelo mais possível, mas garantir que qualquer modelo que seja construído seja alimentado com uma vasta quantidade de informação visual. Ao seguir estas novas regras, os desenvolvedores podem construir sistemas melhores e mais eficientes que criam imagens deslumbrantes sem desperdiçar a imensa energia necessária para treiná-los. O estudo confirma que, embora o caminho para a geração de imagens perfeita seja diferente do caminho para a linguagem perfeita, ele é tão previsível e tão aberto à descoberta quanto o outro.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →