← Últimos artigos
💻 computer science

MACRO: Advancing Multi-Reference Image Generation with Structured Long-Context Data

O artigo apresenta o MACRO, uma abordagem que supera as limitações atuais na geração de imagens com múltiplas referências ao introduzir o MacroData, um conjunto de dados em larga escala com 400 mil amostras estruturadas, e o MacroBench, um novo padrão de avaliação, demonstrando melhorias significativas no desempenho através do ajuste fino e do treinamento conjunto entre tarefas.

Autores originais: Zhekai Chen, Yuqing Wang, Manyuan Zhang, Xihui Liu

Publicado 2026-03-27
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Zhekai Chen, Yuqing Wang, Manyuan Zhang, Xihui Liu

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando ensinar um artista de inteligência artificial (IA) a pintar. Até agora, a maioria desses artistas só era treinada para olhar uma foto de referência e tentar copiar ou modificar algo nela. Era como pedir a um pintor: "Pinte um cachorro baseado nesta foto".

Mas a vida real é mais complexa. Às vezes, você quer criar uma cena onde dez pessoas diferentes, cinco objetos específicos e três estilos de pintura se misturem perfeitamente. Ou talvez você queira ver um objeto girar em 360 graus, ou prever o próximo quadro de um filme.

O problema é que os artistas de IA atuais ficam confusos quando você dá mais de 3 ou 4 referências. Eles esquecem quem é quem, misturam as roupas ou perdem a lógica da história.

Aqui entra o MACRO, o novo "super-treinamento" apresentado neste artigo. Vamos explicar como funciona usando analogias simples:

1. O Problema: A "Fome de Dados"

Pense nos modelos de IA atuais como estudantes que só leram livros com uma única imagem por página. Quando você pede para eles criarem algo baseado em 10 imagens, eles entram em pânico. Eles não sabem como conectar a "história" entre a imagem 1 e a imagem 10.

Os pesquisadores descobriram que o problema não é a inteligência do modelo, mas a falta de material de estudo. Não existiam "livros didáticos" com muitas imagens organizadas de forma lógica para ensinar a IA a fazer essas conexões complexas.

2. A Solução: O "MacroData" (A Biblioteca Gigante)

Para resolver isso, a equipe criou o MacroData. Imagine que eles construíram uma biblioteca gigante com 400.000 exemplos de como lidar com múltiplas referências. Eles organizaram esses exemplos em 4 "salas de aula" principais:

  • Sala de Personalização (Customization): Imagine que você quer criar um quadro onde o rosto de um amigo, a roupa de um modelo de moda, o fundo de uma paisagem e o estilo de um pintor famoso se misturem. O MacroData ensina a IA a fazer esse "mix" perfeito sem perder a identidade de ninguém.
  • Sala de Ilustração (Illustration): Pense em um livro de histórias. Você tem o texto e algumas imagens anteriores. O MacroData ensina a IA a ler o contexto e criar a próxima imagem que faz sentido na história, como um ilustrador profissional.
  • Sala de Espaço (Spatial): Imagine que você tem fotos de um objeto tiradas de frente, de lado e de cima. O MacroData ensina a IA a "girar" esse objeto na mente dela e desenhar como ele se parece de um ângulo que você nunca viu antes (como se fosse um holograma 3D).
  • Sala de Tempo (Temporal): Imagine um filme. Você mostra 5 quadros de uma ação e pede para a IA prever o 6º quadro. O MacroData ensina a IA a entender o movimento e a lógica do tempo, não apenas a estática.

O Segredo: Ao contrário de outros conjuntos de dados que são apenas "lixo" coletado da internet, o MacroData foi construído com cuidado, usando modelos avançados para garantir que as imagens façam sentido lógico e visual. É como ter um professor particular que verifica cada exemplo antes de entregar ao aluno.

3. O Exame: O "MacroBench"

Antes, não havia um teste padronizado para ver se a IA conseguia lidar com 10 imagens. Era como tentar medir a velocidade de um carro sem um velocímetro.

Os pesquisadores criaram o MacroBench, um "exame final" com 4.000 questões difíceis. Eles testam a IA com 1 imagem, depois 5, depois 10, para ver se ela se mantém coerente. É como subir uma escada: se a IA cai no degrau 6, sabemos que ela não está pronta para o topo.

4. Os Resultados: O "Super-Aprendizado"

Quando eles treinaram modelos de IA (como o Bagel e o OmniGen2) usando o MacroData, a mágica aconteceu:

  • Antes: Com 6 imagens, a IA ficava confusa e o resultado era ruim (nota baixa).
  • Depois: Com o MacroData, a IA conseguiu lidar com 10 imagens mantendo a coerência, a identidade dos objetos e a lógica da cena.

Eles descobriram também que, para lidar com tantas imagens, a IA precisa aprender a "focar". É como se ela tivesse que ler 10 livros ao mesmo tempo; em vez de tentar ler cada palavra de cada livro, ela aprende a identificar as palavras-chave mais importantes para não se perder.

Resumo em uma frase

O MACRO é como dar a um artista de IA um "curso intensivo" com 400.000 exemplos práticos de como misturar, girar e prever cenas baseadas em muitas referências ao mesmo tempo, transformando uma IA que se perde com 3 fotos em uma que consegue criar obras complexas com 10 fotos sem perder o fio da meada.

Isso abre portas para criar filmes, jogos e designs personalizados muito mais complexos e realistas no futuro!

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →