← Últimos artigos
🤖 AI

OpenGPT-4o-Image: A Comprehensive Dataset for Advanced Image Generation and Editing

O artigo apresenta o OpenGPT-4o-Image, um conjunto de dados de larga escala com 80.000 pares de instrução-imagem abrangendo 11 domínios e 51 subtarefas, que melhora significativamente o desempenho de modelos multimodais unificados em geração e edição de imagens por meio de uma construção de dados sistemática e automatizada.

Autores originais: Zhihong Chen, Xuehai Bai, Yang Shi, Chaoyou Fu, Huanyu Zhang, Haotian Wang, Xiaoyan Sun, Zhang Zhang, Liang Wang, Yuanxing Zhang, Pengfei Wan, Yi-Fan Zhang

Publicado 2026-08-18
📖 6 min de leitura🧠 Leitura aprofundada

Autores originais: Zhihong Chen, Xuehai Bai, Yang Shi, Chaoyou Fu, Huanyu Zhang, Haotian Wang, Xiaoyan Sun, Zhang Zhang, Liang Wang, Yuanxing Zhang, Pengfei Wan, Yi-Fan Zhang

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

No mundo da inteligência artificial, há uma ambição crescente de construir sistemas que façam mais do que apenas reconhecer o que veem. Por anos, os computadores tornaram-se excelentes em descrever uma foto ou responder a uma pergunta sobre uma imagem. Agora, pesquisadores estão se esforçando para criar um novo tipo de inteligência que possa não apenas entender uma imagem, mas também criar uma do zero ou alterá-la com base em uma frase simples. Essa habilidade, conhecida como geração e edição de imagens, depende de coleções massivas de exemplos. Assim como uma criança aprende a desenhar estudando inúmeras imagens e recebendo feedback, esses modelos de computador aprendem processando vastas quantidades de dados que pareiam descrições de texto com as imagens que elas representam. A qualidade desse material de aprendizagem é tudo; se os exemplos forem simples ou repetitivos, o modelo permanece limitado. Para realmente dominar a natureza complexa, bagunçada e variada das solicitações do mundo real, esses sistemas precisam de um currículo que seja tão rico e estruturado quanto o mundo que tentam emular.

Uma equipe de pesquisadores interveio para fornecer esse currículo com uma nova coleção de dados em larga escala chamada OpenGPT-4o-Image. Eles reconheceram que, embora os conjuntos de dados existentes cobrissem tarefas básicas como mudar a cor de um objeto ou copiar um estilo de pintura, eles frequentemente ficavam aquém quando confrontados com desafios mais difíceis. A vida real é cheia de solicitações que exigem múltiplas etapas ao mesmo tempo, como pedir um diagrama científico específico ou exigir que um personagem seja movido enquanto o fundo muda e um novo texto é adicionado. Para resolver isso, a equipe construiu um conjunto de dados contendo 80.000 pares de alta qualidade de instruções e imagens. Eles não apenas reuniram esses exemplos aleatoriamente; em vez disso, construíram uma estrutura sistemática que decompõe o vasto mundo da criação de imagens em 11 áreas principais e 51 subtarefas específicas. Essa estrutura garante que o computador aprenda não apenas a desenhar, mas a raciocinar sobre o espaço, seguir cadeias lógicas complexas e lidar com assuntos especializados, como ilustrações de química ou comandos de edição de múltiplas etapas.

Os pesquisadores organizaram seu trabalho em duas categorias principais: criar imagens do nada e alterar as existentes. Para o lado da criação, eles focaram em cinco habilidades centrais. Primeiro, ensinaram o modelo a imitar diversos estilos artísticos, variando de pinturas antigas de tinta lavada a estéticas cyberpunk modernas. Segundo, desafiaram-no com instruções complexas que exigem manter múltiplas ideias em mente ao mesmo tempo, como colocar um número específico de objetos em uma cena com relações espaciais precisas. Terceiro, abordaram a difícil tarefa de escrever texto diretamente dentro de uma imagem, garantindo que as palavras sejam escritas corretamente e colocadas naturalmente na cena. Quarto, testaram a habilidade do modelo de entender geometria e lógica, pedindo que ele conte objetos ou determine qual item é maior que outro. Finalmente, expandiram o alcance do modelo para campos especializados, gerando imagens para ciência e engenharia, como diagramas de magnetosferas planetárias ou engrenagens mecânicas, áreas onde a clareza visual é crítica para a educação e pesquisa.

No lado da edição, a equipe desenhou uma hierarquia semelhante para cobrir as muitas formas como as pessoas querem alterar uma imagem. Eles incluíram tarefas onde um usuário pode querer adicionar, remover ou trocar um objeto específico enquanto mantém o resto da cena intacto. Também criaram cenários onde o modelo deve editar o texto incorporado em uma imagem, alterando uma placa ou um rótulo sem distorcer a imagem ao redor. Talvez o mais notável, eles introduziram tarefas de edição complexas que exigem que o modelo siga várias instruções simultaneamente, como mudar o fundo, adicionar um novo personagem e alterar a iluminação, tudo em um único passo. Eles até incluíram interações de múltiplos turnos, onde um usuário dá uma primeira instrução, vê o resultado e depois dá um comando de acompanhamento para refinar a imagem ainda mais, imitando uma conversa natural entre um humano e um artista.

Para construir esta biblioteca massiva, os pesquisadores desenvolveram um pipeline automatizado que atua como um assistente incansável. Eles usaram um modelo de linguagem poderoso para gerar as instruções de texto e, em seguida, usaram um gerador de imagens de alto nível para criar as imagens correspondentes. Esse processo foi cuidadosamente controlado para garantir que os dados fossem diversos e que os níveis de dificuldade fossem equilibrados, movendo-se de solicitações simples para desafios altamente intrincados. O resultado é um conjunto de dados que cobre desde uma cena de rua movimentada capturada no estilo de um pintor famoso até um desenho técnico de um conjunto de engrenagens de rosca sem fim. Ao alimentar esses dados estruturados em modelos de computador líderes, os pesquisadores testaram se os modelos poderiam aprender com eles. Os resultados foram claros: modelos treinados com este novo conjunto de dados tiveram um desempenho significativamente melhor do que antes. Em testes medindo o quão bem um modelo conseguia seguir instruções para editar uma imagem, o desempenho melhorou em até 18 por cento. Para tarefas envolvendo a criação de imagens a partir de texto, a melhoria foi de cerca de 13 por cento.

Esses ganhos sugerem que a maneira como os dados são organizados é tão importante quanto a quantidade de dados em si. O estudo mostra que, quando os modelos são expostos a uma ampla variedade de desafios estruturados, eles se tornam mais capazes de lidar com as solicitações sutis e exigentes que ocorrem na vida real. Eles se tornam melhores em entender que um "pássaro gigante e fofinho" deve parecer diferente de um "pássaro pequeno", ou que um "diagrama científico" requer um nível de precisão diferente de uma "ilustração de fantasia". Embora os pesquisadores notem que seu trabalho depende das capacidades das ferramentas que usaram para gerar os dados, a evidência aponta para um caminho claro à frente. Ao decompor sistematicamente a tarefa complexa de criação de imagens em partes gerenciáveis e bem definidas, eles forneceram uma base que permite à inteligência artificial ir além da simples imitação e em direção a uma forma de compreensão visual mais robusta, confiável e versátil.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →