← Últimos artigos
💻 computer science

Images in Sentences: Scaling Interleaved Instructions for Unified Visual Generation

O artigo apresenta o INSET, um modelo unificado de geração visual que incorpora imagens como tokens de vocabulário nativos dentro de instruções textuais e aproveita um motor de dados escalável de 15 milhões de amostras intercaladas para superar significativamente os métodos existentes em consistência de múltiplas imagens e seguimento de instruções complexas.

Autores originais: Yabo Zhang, Kunchang Li, Dewei Zhou, Xinyu Huang, Xun Wang

Publicado 2026-05-13
📖 4 min de leitura☕ Leitura rápida

Autores originais: Yabo Zhang, Kunchang Li, Dewei Zhou, Xinyu Huang, Xun Wang

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando dar uma ordem muito específica e complexa a um artista.

O Jeito Antigo (O Problema do "Cartão de Índice")
Atualmente, a maioria dos geradores de imagens por IA funciona como um bibliotecário que só entende números. Se você quiser uma imagem com um cachorro específico de uma foto, um chapéu específico de outra e um fundo específico de uma terceira, você terá que dizer: "Desenhe uma imagem usando o Cachorro da Imagem #1, o Chapéu da Imagem #2 e o Fundo da Imagem #3."

A IA precisa lembrar qual número corresponde a qual imagem enquanto tenta pintar. À medida que você adiciona mais imagens, a IA fica confusa. Ela esquece qual chapéu vai com qual cachorro, ou simplesmente ignora as imagens extras por completo. É como tentar malabarismo com cinco bolas de olhos vendados; eventualmente, você as deixa cair.

O Novo Jeito: "Imagens em Frases" (Inset)
O artigo apresenta um novo modelo chamado Inset (Imagens em Frases). Em vez de tratar imagens como arquivos separados com números, o Inset trata imagens como palavras em uma frase.

Imagine que você está escrevendo uma história, mas, em vez de escrever a palavra "cachorro", você cola uma pequena e perfeita foto daquele cachorro específico diretamente na frase.

  • Jeito antigo: "Coloque o cachorro da Imagem 1 na cadeira."
  • Jeito Inset: "Coloque [Foto do Cachorro] na cadeira."

Como a foto está logo ao lado da palavra "cadeira" na frase, a IA não precisa adivinhar ou lembrar um número. O significado está ali mesmo, bem na frente e no centro. Isso permite que a IA lide com instruções complexas com muitas imagens diferentes sem ficar confusa.

Como Eles Treinaram a IA (A "Fábrica de Dados")
Para ensinar a IA a fazer isso, os pesquisadores não podiam apenas encontrar exemplos suficientes na internet porque são raros. Então, eles construíram um motor de dados escalável (uma fábrica de robôs para dados).

  1. Para Fotos: Eles pegaram milhões de fotos e usaram outras IAs inteligentes para desmontá-las. Eles identificaram cada objeto (como um "vaso vermelho" ou um "gato azul"), escreveram uma frase sobre ele e, em seguida, inseriram a foto real daquele objeto diretamente na frase onde estava a descrição.
  2. Para Vídeos: Eles analisaram vídeos para ensinar à IA como as coisas mudam. Se um vídeo mostra um gato pulando, eles criaram instruções que dizem: "Pegue o gato do início [Foto do gato sentado] e faça-o pular [Foto do gato pulando]." Isso ensina a IA a entender movimento e transformação, não apenas cópia estática.

Eles criaram 15 milhões dessas "frases-foto" para treinar o modelo.

Os Resultados
Eles testaram esse novo modelo em um desafio difícil chamado InterleaveBench, que envolve misturar muitas imagens diferentes em uma única solicitação complexa.

  • A Pontuação: Quando solicitado a usar 2 imagens, o Inset se saiu bem. Mas quando solicitado a usar 5 imagens, os modelos antigos desmoronaram, enquanto o Inset continuou a melhorar. Foi significativamente mais preciso em manter os objetos parecidos com os originais e seguir as instruções de texto.
  • O Bônus: Como a IA aprendeu a tratar imagens como parte da instrução, ela também pode fazer edição. Você pode mostrar a ela uma foto de uma camisa específica e dizer: "Coloque esta camisa na pessoa na foto", e ela copiará o design exato daquela camisa, em vez de apenas adivinhar como uma "camisa" parece.

Em Resumo
O artigo afirma que, ao impedir que a IA use "números" para referenciar imagens e, em vez disso, permitir que ela "leia" imagens como se fossem palavras, podemos criar ferramentas muito mais poderosas para gerar e editar imagens complexas. Eles provaram isso construindo uma biblioteca massiva de exemplos de prática e mostrando que seu novo modelo supera todos os concorrentes de código aberto atuais, especialmente quando as tarefas ficam complicadas.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →