DreamOmni3: Scribble-based Editing and Generation
O artigo apresenta o DreamOmni3, um modelo unificado que avança a criação baseada em GUI ao permitir a edição e geração flexíveis por meio de rabiscos através de um novo pipeline de síntese de dados e um framework de entrada conjunta que combina imagens originais e esboçadas para um controle visual preciso.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine que você está conversando com um artista superinteligente que consegue desenhar qualquer coisa que você descreva. Se você disser: "Desenhe um gato", ele o faz. Se você disser: "Faça o gato usar um chapéu", ele altera a imagem. Este é o mundo da geração e edição de imagens por IA, um campo onde computadores aprendem a criar e modificar imagens com base em suas palavras. Por muito tempo, a única maneira de falar com esses artistas digitais era através de texto. Mas aqui está o problema: as palavras às vezes são desajeitadas. Tentar descrever exatamente onde colocar um novo objeto, ou como mudar uma parte específica de um desenho bagunçado, pode ser como tentar dar direções a um amigo usando apenas um mapa sem pontos de referência. Você pode dizer: "Coloque a árvore à esquerda", mas a IA pode colocá-la no extremo esquerdo, ou no lado errado.
Para resolver isso, cientistas têm explorado uma nova maneira de falar com esses artistas: o rabisco. Em vez de apenas digitar, você pode pegar uma caneta digital e desenhar círculos, caixas ou rabiscos desordenados diretamente na tela para mostrar à IA exatamente o que você quer dizer. É como apontar para um lugar no mapa e dizer: "Aqui!", em vez de descrever o nome da rua. Este artigo, DreamOmni3, mergulha fundo em tornar esse método de "apontar e desenhar" perfeito. Ele aborda as partes complicadas de ensinar computadores a entender não apenas suas palavras, mas também seus rabiscos manuais desordenados, e combina tudo para criar ou editar imagens com uma precisão incrível.
O Problema: Quando as Palavras Não São Suficientes
Imagine que você está jogando um jogo onde tem que editar uma foto. Você quer substituir um brinquedo em um círculo vermelho por uma bolsa de mão. Se você apenas digitar "coloque uma bolsa de mão aqui", a IA pode ficar confusa. Qual brinquedo? Onde é "aqui"? O círculo é vermelho ou preto? É a primeira imagem ou a segunda? A linguagem é ótima para grandes ideias, mas é péssima para apontar para detalhes específicos e minúsculos em uma tela.
Os autores deste artigo perceberam que, embora a IA tenha ficado muito boa em seguir instruções de texto, ela frequentemente perde o "onde" e o "como" quando as coisas ficam complicadas. Os usuários precisam de uma maneira de serem mais diretos. Eles precisam ser capazes de desenhar um círculo ao redor de um rosto e dizer: "Mude este cabelo", ou desenhar uma linha sinuosa e dizer: "Coloque um carro aqui". Este é o conceito de edição e geração baseada em rabiscos. Trata-se de permitir que os usuários misturem texto, imagens e seus próprios desenhos à mão livre para controlar a IA.
A Solução: DreamOmni3
A equipe por trás do DreamOmni3 decidiu construir um modelo que trata os rabiscos como um cidadão de primeira classe, junto com o texto e as imagens. Mas houve um enorme obstáculo: os dados. Modelos de IA são como estudantes; eles precisam ver milhares de exemplos para aprender. Não existiam livros didáticos existentes (datasets) que mostrassem à IA como interpretar um círculo manual desordenado e transformá-lo em uma edição perfeita.
Então, a primeira coisa que os autores fizeram foi inventar uma fábrica de dados. Eles pegaram imagens existentes e usaram um pipeline inteligente para criar milhões de novos exemplos de treinamento.
- Para edição: Eles pegaram fotos, encontraram objetos e, então, desenharam manualmente (ou com uma IA auxiliar) círculos, caixas e rabiscos sobre eles. Eles criaram quatro tipos de tarefas:
- Rabisco + Texto: "Coloque um carro no círculo vermelho."
- Rabisco + Texto + Imagem: "Coloque o carro desta imagem dentro do círculo vermelho."
- Fusão de Imagem: Pegar um objeto de uma foto e colá-lo em outra, guiado por um rabisco.
- Edição de Desenho: Transformar um esboço bruto em um objeto realista na foto.
- Para geração: Eles fizeram o mesmo, mas começando com uma tela branca vazia em vez de uma foto, ensinando a IA a desenhar coisas novas com base em onde você rabiscou.
Eles geraram um conjunto massivo de dados com dezenas de milhares desses exemplos (32.000 para edição multimodal, 29.000 para geração multimodal e mais para as outras tarefas) para ensinar o modelo a ler a mente do usuário através de seus desenhos.
O Truque de Mágica: Como o Modelo "Vê" o Rabisco
É aqui que o artigo fica realmente inteligente. Normalmente, quando você quer que uma IA edite uma parte específica de uma imagem, você usa uma máscara binária. Pense em uma máscara como um estêncil: é uma imagem em preto e branco onde o branco significa "mude isto" e o preto significa "não mude isto".
Os autores argumentam que as máscaras são muito rígidas. Se você tem três coisas diferentes para mudar em uma única imagem, você precisa de três máscaras pretas e brancas diferentes. Isso é bagunçado e difícil de descrever em palavras. Em vez disso, o DreamOmni3 usa rabiscos coloridos. Você pode desenhar um círculo vermelho para o carro, um quadrado azul para a árvore e uma linha verde para o céu. A IA pode facilmente distingui-los pela cor.
Mas há um detalhe: se você desenhar um círculo vermelho sobre um carro, a IA não consegue mais ver o carro porque a tinta vermelha o está cobrindo! Para resolver isso, o DreamOmni3 usa um esquema de entrada conjunta.
- Ele fornece à IA duas imagens ao mesmo tempo: a foto original e a foto com os rabiscos por cima.
- Ele utiliza um sistema de codificação especial (uma forma de rotular pixels) que diz à IA: "Ei, o círculo vermelho nesta imagem está exatamente no mesmo lugar que o carro naquela imagem".
- Isso permite que a IA veja o rabisco (para saber o que você quer) e os pixels originais (para saber o que está mudando), garantindo que a edição seja precisa e que o resto da imagem permaneça perfeita.
O Cérebro: Ensinando a IA a Entender o "Desordenado"
Os autores também perceberam que os desenhos humanos são frequentemente desordenados. Um círculo pode parecer um ovo; uma linha pode ser trêmula. Para ajudar a IA a entender esses desenhos imperfeitos, eles introduziram um Modelo de Linguagem Visual (VLM) — um tipo de IA que é muito boa em raciocínio.
Eles treinaram este VLM junto com o gerador de imagens. O VLM atua como um tradutor. Ele olha para o seu rabisco e para o texto que você escreveu, descobre o que você realmente quis dizer (ex: "Ah, eles desenharam um círculo trêmulo, mas claramente querem um carro") e então diz ao gerador de imagens exatamente o que fazer. Este treinamento conjunto garante que a IA não apenas siga regras cegamente, mas que realmente entenda a intenção por trás do rabisco.
Os Resultados: Funciona?
A equipe testou o DreamOmni3 em um novo benchmark que criaram, repleto de imagens do mundo real e tarefas difíceis. Eles compararam-no com outros modelos de ponta, incluindo alguns gigantes comerciais como o GPT-4o e o Nano Banana.
Os resultados foram impressionantes. O DreamOmni3 superou consistentemente outros modelos de código aberto e igualou ou superou os gigantes comerciais em muitas áreas.
- Avaliadores Humanos (pessoas reais) classificaram a taxa de sucesso do DreamOmni3 em 55,88% para tarefas de edição, o que foi superior ao GPT-4o (59,56% em uma métrica, mas o DreamOmni3 foi mais consistente em outras) e significativamente superior a outros como o Omnigen2 (2,94%).
- Em tarefas de geração, o DreamOmni3 alcançou uma taxa de sucesso de 54,55%, novamente superando a maioria dos competidores.
- O artigo observa que, embora os modelos comerciais sejam fortes, eles às vezes têm dificuldade com instruções específicas de rabiscos, muitas vezes deixando os rabiscos na imagem final ou errando as proporções. O DreamOmni3, no entanto, foi projetado especificamente para lidar com essas nuances, produzindo resultados mais limpos onde os rabiscos desapareciam e as edições pareciam naturais.
Por Que Isso Importa
O DreamOmni3 não é apenas sobre tornar a IA mais inteligente; é sobre tornar a IA mais humana. Ele preenche a lacuna entre o que imaginamos e o que conseguimos descrever. Ao nos permitir desenhar, apontar e rabiscar, ele transforma a edição de imagens de uma tarefa técnica em uma conversa criativa. O artigo sugere que esta abordagem — combinando texto, imagens e desenho à mão livre com síntese de dados inteligente e treinamento conjunto — é o futuro de como interagiremos com ferramentas de criação digital. Mostra que, quando paramos de tentar forçar os computadores a entender nossas palavras vagas e começamos a deixá-los ver nossas ações diretas, os resultados são muito mais mágicos.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.