← Últimos artigos
⚡ electrical engineering

Mage-Flow: An Efficient Native-Resolution Foundation Model for Image Generation and Editing

O Mage-Flow é uma família de modelos de fundação compacta de escala 4B que alcança geração de texto para imagem de alta resolução e edição baseada em instruções de forma eficiente através do co-design de um VAE leve de alta fidelidade, um transformer de difusão de resolução nativa e otimizações de nível de sistema, entregando desempenho competitivo com latência ultra-baixa em uma única GPU.

Autores originais: Xinjie Zhang, Peng Zhang, Shicheng Zheng, Jinghao Guo, Zhaoyang Jia, Yifei Shen, Xun Guo, Yuxuan Luo, Jiahao Li, Wenxuan Xie, Fanyi Pu, Xiaoyi Zhang, Kaichen Zhang, Zongyu Guo, Tianci Bi, Dongnan Gui
Publicado 2026-07-22
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Xinjie Zhang, Peng Zhang, Shicheng Zheng, Jinghao Guo, Zhaoyang Jia, Yifei Shen, Xun Guo, Yuxuan Luo, Jiahao Li, Wenxuan Xie, Fanyi Pu, Xiaoyi Zhang, Kaichen Zhang, Zongyu Guo, Tianci Bi, Dongnan Gui, Zhening Liu, Zimo Wen, Zihan Zheng, Senqiao Yang, Xiao Li, Jinglu Wang, Bin Li, Yan Lu

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você esteja tentando construir um robô artista. Durante anos, a única maneira de tornar este artista verdadeiramente brilhante era construir um cérebro tão massivo que precisava de um armazém cheio de supercomputadores para funcionar. Esses "cérebros gigantes" podiam pintar imagens deslumbrantes ou editar fotos com detalhes incríveis, mas eram tão pesados e caros que apenas algumas grandes empresas podiam pagar por eles. Eram como uma Ferrari que requer uma equipe de mecânicos apenas para dar a partida no motor.

O campo da "IA generativa" trata de ensinar computadores a criar coisas novas, como imagens, do zero. Para fazer isso, o computador precisa de duas ferramentas principais. Primeiro, ele precisa de um tokenizador, que é como um tradutor que transforma uma foto bagunçada e de alta definição em uma lista compacta de instruções que o computador consegue entender. Segundo, ele precisa de uma espinha dorsal (backbone), o motor principal que realmente desenha a imagem baseada nessas instruções. O grande problema tem sido que o tradutor (tokenizador) é frequentemente lento e desajeitado, especialmente com imagens grandes e detalhadas, tornando todo o processo lento. A pergunta que os pesquisadores têm feito é: Podemos construir um robô artista que seja tão talentoso quanto os gigantes, mas pequeno o suficiente para caber em um único laptop, sem perder nenhuma da magia?

Apresentamos o Mage-Flow, um novo projeto da equipe Microsoft Mage que diz: "Sim, nós podemos". Em vez de tentar construir um céreão maior, a equipe decidiu reconstruir todo o sistema do zero para ser incrivelmente eficiente. Eles criaram um "artista" compacto com apenas 4 bilhões de parâmetros (uma medida de seu tamanho), o que é minúsculo comparado aos gigantes de 80 bilhões de parâmetros que dominam o campo atualmente.

Eles fizeram isso usando alguns truques inteligentes:

1. O Tradutor Super-Rápido (Mage-VAE)
Pense no tokenizador como um tradutor que transforma uma foto em um código secreto. Os tradutores antigos eram como malas pesadas e lentas; levavam muito tempo para embalar e desembalar, especialmente para imagens de alta resolução. O Mage-Flow introduziu um novo tradutor chamado Mage-VAE. Imagine que, em vez de uma mala pesada, eles construíram uma máquina de origami mágica. Ela pode dobrar uma foto complexa em um pacote pequeno e organizado e desdobrá-la de volta em uma imagem perfeita em um único passo, extremamente rápido. Este novo tradutor é tão eficiente que faz o mesmo trabalho dos antigos pesados, mas usa cerca de 22 vezes menos energia para desembalar a imagem. Isso significa que o robô artista passa quase nenhum tempo esperando o tradutor terminar seu trabalho.

2. A Tela Flexível (Resolução Nativa)
Normalmente, quando os computadores desenham imagens, eles as forçam em uma grade rígida, como tentar encaixar um retângulo longo e um quadrado alto na mesma caixa quadrada. Isso desperdiça espaço e limita a criatividade. O Mage-Flow usa uma técnica chamada Empacotamento de Resolução Nativa (Native-Resolution Packing). Imagine uma tela flexível que estica e encolhe para se ajustar ao formato exato da imagem que você deseja desenhar, seja um pôster de filme largo ou um papel de parede de celular alto. O computador não perde tempo espremendo imagens em caixas; ele as desenha exatamente como elas são. Isso torna o processo de treinamento muito mais rápido e permite que o artista lide com formas extremas sem ficar confuso.

3. O Motor Turbo
Mesmo com um tradutor rápido e uma tela flexível, desenhar uma imagem passo a passo pode demorar um pouco. A equipe usou uma técnica especial de "destilação" para criar versões Turbo de seus modelos. Pense nisso como ensinar o artista a dar saltos gigantes em vez de passos pequenos e cautelosos. Enquanto um artista padrão pode levar 30 passos para terminar uma pintura, a versão Turbo pode fazê-lo em apenas 4 passos. Apesar de dar menos passos, a qualidade permanece incrivelmente alta.

Os Resultados
A equipe testou seu novo artista de 4 bilhões de parâmetros contra os gigantes de 80 bilhões de parâmetros. Os resultados foram surpreendentes. Em um único chip de computador potente (um NVIDIA A100), o Mage-Flow conseguiu gerar uma imagem de alta qualidade em 1024x1024 de resolução em apenas 0,59 segundos. Para editar uma foto existente, levou apenas 1,02 segundo.

Talvez o mais impressionante seja que a versão Turbo pode editar uma foto em cerca de um segundo enquanto usa pouca memória (cerca de 18 GB), enquanto os modelos gigantes frequentemente precisam do dobro ou triplo dessa quantidade de memória e levam muito mais tempo para rodar. O artigo sugere que esta abordagem prova que você não precisa de um cérebro enorme e caro para criar arte de alta qualidade; você só precisa de um design inteligente e eficiente.

O artigo também mostrou que este sistema funciona muito bem para edição. Você pode dizer ao robô para "mudar o fundo para uma praia", "remover a pessoa" ou "adicionar texto", e ele o faz fielmente. Eles até testaram em uma tarefa muito específica: desenhar diagramas científicos com setas e texto. O modelo pequeno de 4 bilhões, após um treinamento extra, conseguia desenhar esses diagramas complexos quase tão bem quanto um modelo muito maior e especializado.

Em resumo, o Mage-Flow sugere que o futuro da arte por IA não é sobre tornar as coisas maiores e mais pesadas. É sobre torná-las mais inteligentes, leves e rápidas, para que a geração e edição de imagens poderosas possam acontecer diretamente no seu desktop, ou até mesmo no seu bolso, sem precisar de um supercomputador para rodar.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →