← Últimos artículos
💻 computer science

SI-Edit: Toward Sketch-Instruction Guided Local Image Editing with Pixel-Level Precision

Para superar la falta de referentes de alta calidad para la edición de imágenes basada en bocetos a nivel de píxel, este artículo introduce el conjunto de datos SI-Data y el marco SI-Edit, los cuales aprovechan modelos de lenguaje de gran escala multimodales para sintetizar cuadrupletas guiadas por instrucciones y lograr deformaciones locales precisas y semánticamente alineadas a través de un enfoque de aprendizaje espacial-semántico colaborativo.

Autores originales: Weixin Ye, Wei Wang, Hongguang Zhu, Xuecheng Nie

Publicado 2026-08-11
📖 7 min de lectura🧠 Análisis profundo

Autores originales: Weixin Ye, Wei Wang, Hongguang Zhu, Xuecheng Nie

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando dar una instrucción muy específica y diminuta a un artista mágico que puede pintar cualquier cosa que desees. Podrías decir: "Haz que el tallo de esa flor se doble en una forma de S suave". Pero aquí está el problema: el artista es un poco soñador. Escucha "forma de S" y podría doblar el tallo en el lugar equivero, o podría convertir toda la planta en una serpiente en lugar de solo curvar el tallo. Este es el desafío de la edición de imágenes utilizando inteligencia artificial. Los científicos han construido potentes "modelos generativos" —piensa en ellos como artistas digitales entrenados con millones de imágenes— que pueden cambiar imágenes basadas en texto. Pero cuando pides un cambio pequeño y preciso, como doblar una sola hoja o estirar una llama, estos artistas digitales suelen confundirse. Podrían cambiar la parte equivocada de la imagen, o podrían malinterpretar exactamente cómo quieres que cambie.

Para solucionar esto, los investigadores han probado dos trucos principales. Uno es darle al artista un esbozo (sketch), como dibujar una línea en la pantalla para mostrar exactamente dónde doblar. El otro es darle instrucciones de texto, como escribir "dobla aquí". Pero cada truco tiene un defecto. Si solo das un esbozo, el artista no sabe qué hacer (¿quieres copiar la hoja, moverla o solo doblarla?). Si solo das instrucciones de texto, el artista no sabe dónde hacerlo. Este artículo, SI-Edit, intenta resolver esto enseñando al artista a escuchar tanto el esbozo como el texto al mismo tiempo, actuando como un escultor digital superpreciso que puede remodelar una imagen hasta el último píxel.

El Problema: El Artista que se "Pierde en la Traducción"

Imagina que estás jugando un juego en el que tienes que describir un dibujo a un amigo que solo puede dibujar lo que tú digas. Si dices: "Haz que la rama del árbol se curve", tu amigo podría curvar la rama equivocada, o podría dibujar un árbol completamente nuevo. Esto es lo que sucede con las herramientas de IA actuales que solo escuchan instrucciones de texto. Son excelentes para cambios grandes, como "vuelve el cielo azul", pero terribles para los pequeños y precisos. Carecen de un "ancla espacial": una forma de saber exactamente qué píxel mover.

Por otro lado, si solo entregas un esbozo (una línea dibujada en la pantalla), la IA sabe dónde dibujar, pero no qué hacer. ¿Esa línea está destinada a mover una hoja? ¿A copiarla? ¿O solo a doblarla? Sin una instrucción clara, la IA podría adivinar mal, lo que lleva a resultados extraños como una hoja que de repente se convierte en una copia de sí misma, o un tallo que desaparece.

Los autores de este artículo se dieron cuenta de que para obtener un control perfecto a nivel de píxel, necesitas ambos: un mapa (el esbozo) y un destino (el texto). Pero hubo un gran obstáculo: nadie había construido antes un manual de entrenamiento para una IA que combinara estas dos cosas perfectamente.

La Solución: Un Nuevo Manual de Entrenamiento y un Nuevo Artista

Para solucionar esto, el equipo primero tuvo que construir un conjunto de datos de entrenamiento masivo y de alta calidad llamado SI-Data. Piensa en esto como un libro de cocina gigante para la IA. En lugar de solo mostrarle a la IA imágenes "antes" y "después" con una descripción de texto, crearon cuadrupletos: conjuntos de cuatro elementos que van juntos:

  1. La imagen original (el punto de partida).
  2. La imagen objetivo (cómo debería verse después de la edición).
  3. Un esbozo (una línea simple que muestra el cambio exacto de forma).
  4. Una instrucción (el texto que le dice a la IA qué hacer).

No dibujaron esto a mano; eso tomaría demasiado tiempo. En su lugar, utilizaron un proceso automatizado inteligente. Tomaron fotografías hermosas, le pidieron a una IA inteligente (Qwen3-VL) que inventara una instrucción de edición específica (como "estira la tienda") y luego usaron otra IA (Nano Banana Pro) para realizar el cambio real. Luego, utilizaron un truco matemático llamado flujo óptico (optical flow) para dibujar automáticamente el "esbozo" observando cómo se movieron los píxeles desde la imagen original a la nueva. Esto les dio 6,500 ejemplos perfectos de cómo combinar un esbozo y una instrucción de texto para realizar una edición precisa.

Cómo funciona SI-Edit: El Truco de la "Misma Posición"

Con este nuevo conjunto de datos, construyeron una nueva herramienta de edición llamada SI-Edit. Esta herramienta está diseñada para ser un artista "colaborativo". No solo mira el texto o el esbozo; los mira juntos.

El artículo introduce dos trucos principales para que esto funcione:

  1. El Token de "Activación de Tarea": Añadieron un código secreto especial, escrito como <sk>, al principio de cada instrucción. Piensa en esto como una campana que suena antes de que el artista comience a pintar. Cuando la IA escucha la "campana" (<sk>), sabe: "Ah, necesito prestar especial atención a las líneas del esbozo que voy a ver a continuación". Esto ayuda a la IA a entender que el esbozo no es solo un adorno, sino una regla estricta.
  2. Codificación de Misma Posición (SPE - Same Position Encoding): Esta es la parte más importante. Imagina que estás trazando un dibujo sobre un trozo de vidrio. Tienes la imagen original debajo y tu esbozo encima. Si no los alineas perfectamente, tu dibujo estará desviado. La IA suele tratar el esbozo y la imagen original como dos cosas separadas, lo que causa que se "desvíen" entre sí. SI-Edit obliga a la IA a tratar el esbozo y la imagen original como si estuvieran en la exacta misma posición en su cerebro. Superpone el esbozo en la imagen y le dice a la IA: "Estas dos cosas están en las mismas coordenadas". Esto evita que la IA se confunda sobre dónde debe ocurrir la curvatura.

Lo que Encontraron: Precisión al Nivel del Píxel

El equipo probó SI-Edit contra otras herramientas populares como SketchEdit, MagicQuill y FramePainter. Los resultados fueron claros: SI-Edit era mucho mejor siguiendo las reglas.

  • Precisión Geométrica: Al medir qué tan fielmente seguía la IA las líneas del esbozo, SI-Edit obtuvo una puntuación de 4.292 (menor es mejor), mientras que la siguiente mejor herramienta, MagicQuill, obtuvo 7.434. Esto significa que las curvas y dobleces de SI-Edit estaban mucho más cerca de lo que el usuario realmente dibujó.
  • Comprensión Semántica: Al verificar si la IA realmente hizo lo que decía el texto (como "estirar" frente a "copiar"), SI-Edit obtuvo una puntuación de 0.0174 en una métrica llamada Δ\DeltaCS, superando a todos los demás métodos.
  • Preferencia del Usuario: Cuando personas reales observaron los resultados, prefirieron SI-Edit sobre los otros del 81.3% al 94.8% de las veces, dependiendo de lo que estuvieran evaluando (consistencia visual, precisión o calidad de imagen).

El artículo también demostró que esta herramienta podía hacer más que solo doblar cosas; incluso podía cambiar la pose de una persona, como hacer que un artista marcial cambie su postura, manteniendo su rostro y su ropa exactamente iguales.

La Conclusión

Los autores sugieren que, al combinar un mapa claro (el esbozo) con un destino claro (el texto), y al enseñar a la IA a tratarlos como una guía unificada, finalmente podemos obtener herramientas de edición de imágenes que sean lo suficientemente precisas para manejar cambios pequeños y complejos sin arruinar el resto de la imagen. No solo construyeron una mejor herramienta; construyeron el primer conjunto de datos público que enseña a la IA cómo hacer esto, abriendo la puerta para que futuros investigadores creen incluso artistas digitales más inteligentes. El artículo concluye que, si bien el problema de la "ambigüedad espacial" (no saber dónde editar) y la "ceguera semántica" (no saber qué editar) fue un obstáculo importante, este enfoque colaborativo despeja con éxito el camino para una edición perfecta a nivel de píxel.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →