← Últimos artigos
💻 computer science

SI-Edit: Toward Sketch-Instruction Guided Local Image Editing with Pixel-Level Precision

Para superar a falta de benchmarks de alta qualidade para edição de imagens baseada em esboços ao nível de pixel, este artigo introduz o conjunto de dados SI-Data e o framework SI-Edit, que aproveitam modelos de linguagem de grande escala multimodais para sintetizar quadrupletos guiados por instruções e alcançar deformações locais precisas e semanticamente alinhadas através de uma abordagem de aprendizado espacial-semântico colaborativo.

Autores originais: Weixin Ye, Wei Wang, Hongguang Zhu, Xuecheng Nie

Publicado 2026-08-11
📖 7 min de leitura🧠 Leitura aprofundada

Autores originais: Weixin Ye, Wei Wang, Hongguang Zhu, Xuecheng Nie

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando dar uma instrução muito específica e minúscula a um artista mágico que pode pintar qualquer coisa que você desejar. Você poderia dizer: "Faça o caule daquela flor dobrar em um formato de S suave". Mas aqui está o problema: o artista é um pouco sonhador. Ele ouve "formato de S" e pode dobrar o caule no lugar errado, ou pode transformar a planta inteira em uma cobra em vez de apenas curvar o caule. Este é o desafio da edição de imagem usando inteligência artificial. Cientistas construíram modelos generativos poderosos — pense neles como artistas digitais treinados em milhões de imagens — que podem alterar imagens com base em texto. Mas quando você pede uma mudança pequena e precisa, como dobrar uma única folha ou esticar uma chama, esses artistas digitais costumam ficar confusos. Eles podem mudar a parte errada da imagem ou podem entender mal exatamente como você quer que ela mude.

Para corrigir isso, pesquisadores tentaram dois truques principais. Um é dar ao artista um esboço (sketch), como desenhar uma linha na tela para mostrar exatamente onde dobrar. O outro é dar instruções de texto, como escrever "dobre aqui". Mas cada truque tem uma falha. Se você der apenas um esboço, o artista não saberá o que fazer (você quer copiar a folha, movê-la ou apenas dobrá-la?). Se você der apenas texto, o artista não saberá onde fazer a mudança. O SI-Edit tenta resolver isso ensinando o artista a ouvir tanto o esboço quanto o texto ao mesmo tempo, agindo como um escultor digital superpreciso que pode remodelar uma imagem até o último pixel.

O Problema: O Artista "Perdido na Tradução"

Imagine que você está jogando um jogo onde tem que descrever um desenho para um amigo que só consegue desenhar o que você diz. Se você disser: "Faça o galho da árvore curvar", seu amigo pode curvar o galho errado, ou pode desenhar uma árvore inteira nova. Isso é o que acontece com as ferramentas de IA atuais que apenas ouvem instruções de texto. Elas são ótimas para grandes mudanças, como "deixe o céu azul", mas terríveis para mudanças pequenas e precisas. Elas carecem de uma "âncora espacial" — uma maneira de saber exatamente qual pixel mover.

Por outro lado, se você fornecer apenas um esboço (uma linha desenhada na tela), a IA saberá onde desenhar, mas não o que fazer. Aquela linha serve para mover uma folha? Copiá-la? Ou apenas dobrá-la? Sem uma instrução clara, a IA pode adivinhar errado, levando a resultados estranhos, como uma folha que de repente se transforma em uma cópia de si mesma, ou um caule que desaparece.

Os autores deste artigo perceberam que, para obter um controle perfeito ao nível do pixel, você precisa de ambos: um mapa (o esboço) e um destino (o texto). Mas havia um grande obstáculo: ninguém jamais havia construído um manual de treinamento para uma IA que combinasse essas duas coisas perfeitamente.

A Solução: Um Novo Manual de Treinamento e um Novo Artista

Para corrigir isso, a equipe primeiro teve que construir um conjunto de dados de treinamento massivo e de alta qualidade chamado SI-Data. Pense nisso como um livro de receitas gigante para a IA. Em vez de apenas mostrar à IA imagens "antes" e "depois" com uma descrição de texto, eles criaram quadrupletos — conjuntos de quatro elementos que andam juntos:

  1. A imagem original (o ponto de partida).
  2. A imagem alvo (como ela deve parecer após a edição).
  3. Um esboço (uma linha simples mostrando a mudança exata de forma).
  4. Uma instrução (o texto dizendo à IA o que fazer).

Eles não desenharam isso à mão; isso levaria uma eternidade. Em vez disso, usaram um pipeline automatizado inteligente. Eles pegaram fotos belas, pediram a uma IA inteligente (Qwen3-VL) para inventar uma instrução de edição específica (como "estique a tenda") e então usaram outra IA (Nano Banana Pro) para realmente fazer a mudança. Depois, usaram um truque matemático chamado fluxo óptico (optical flow) para desenhar automaticamente o "esboço", observando como os pixels se moveram da imagem original para a nova imagem. Isso lhes deu 6.500 exemplos perfeitos de como combinar um esboço e uma instrução de texto para fazer uma edição precisa.

Como o SI-Edit Funciona: O Truque da "Mesma Posição"

Com este novo conjunto de dados, eles construíram uma nova ferramenta de edição chamada SI-Edit. Esta ferramenta é projetada para ser um artista "colaborativo". Ela não olha apenas para o texto ou para o esboço; ela olha para ambos juntos.

O artigo introduz dois truques principais para fazer isso funcionar:

  1. O Token "Task-Trigger": Eles adicionaram um código secreto especial, escrito como <sk>, ao início de cada instrução. Pense nisso como um sino que toca antes de o artista começar a pintar. Quando a IA ouve o "sino" (<sk>), ela entende: "Oh, eu preciso prestar atenção extra às linhas do esboço que estou prestes a ver". Isso ajuda a IA a entender que o esboço não é apenas uma decoração; é uma regra estrita.
  2. Codificação de Mesma Posição (Same Position Encoding - SPE): Esta é a parte mais importante. Imagine que você está traçando um desenho sobre um pedaço de vidro. Você tem a imagem original por baixo e o seu esboço por cima. Se você não os alinhar perfeitamente, seu desenho ficará fora de lugar. A IA geralmente trata o esboço e a imagem original como duas coisas separadas, o que faz com que eles se "desloquem" um do outro. O SI-Edit força a IA a tratar o esboço e a imagem original como se estivessem no exato mesmo lugar em seu cérebro. Ele sobrepõe o esboço à imagem e diz à IA: "Essas duas coisas estão nas mesmas coordenadas". Isso impede que a IA se confunda sobre onde a dobra deve acontecer.

O Que Eles Descobriram: Precisão ao Nível do Pixel

A equipe testou o SI-Edit contra outras ferramentas populares como SketchEdit, MagicQuill e FramePainter. Os resultados foram claros: o SI-Edit foi muito melhor em seguir as regras.

  • Precisão Geométrica: Ao medir o quão de perto a IA seguiu as linhas do esboço, o SI-Edit obteve uma pontuação de 4,292 (quanto menor, melhor), enquanto a próxima melhor ferramenta, MagicQuill, pontuou 7,434. Isso significa que as dobras e curvas do SI-Edit estavam muito mais próximas do que o usuário realmente desenhou.
  • Compreensão Semântica: Ao verificar se a IA realmente fez o que o texto disse (como "esticar" vs. "copiar"), o SI-Edit obteceu 0,0174 em uma métrica chamada Δ\DeltaCS, superando todos os outros métodos.
  • Preferência do Usuário: Quando pessoas reais analisaram os resultados, elas preferiram o SI-Edit em relação aos outros 81,3% a 94,8% das vezes, dependendo do que estavam avaliando (consistência visual, precisão ou qualidade da imagem).

O artigo também mostrou que esta ferramenta pode fazer mais do que apenas dobrar coisas; ela pode até mudar a pose de uma pessoa, como fazer um artista de artes marciais mudar sua postura, mantendo o rosto e as roupas exatamente iguais.

A Conclusão

Os autores sugerem que, ao combinar um mapa claro (o esboço) com um destino claro (o texto), e ao ensinar a IA a tratar ambos como um guia unificado, podemos finalmente obter ferramentas de edição de imagem que sejam precisas o suficiente para lidar com mudanças pequenas e complexas sem estragar o resto da imagem. Eles não construíram apenas uma ferramenta melhor; eles construíram o primeiro conjunto de dados público que ensina a IA a fazer isso, abrindo as portas para que futuros pesquisadores criem artistas digitais ainda mais inteligentes. O artigo conclui que, embora o problema da "ambiguidade espacial" (não saber onde editar) e da "cegueira semântica" (não saber o que editar) tenha sido um grande obstáculo, essa abordagem colaborativa removeu com sucesso esse bloqueio para uma edição perfeita ao nível do pixel.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →