← Últimos artículos
💻 computer science

DreamOmni3: Scribble-based Editing and Generation

El artículo presenta DreamOmni3, un modelo unificado que hace avanzar la creación basada en GUI al permitir la edición y generación flexible mediante garabatos a través de un novedoso flujo de síntesis de datos y un marco de entrada conjunto que combina imágenes originales y garabateadas para un control visual preciso.

Autores originales: Bin Xia, Bohao Peng, Jiyang Liu, Sitong Wu, Jingyao Li, Junjia Huang, Xu Zhao, Yitong Wang, Ruihang Chu, Bei Yu, Jiaya Jia

Publicado 2026-08-12
📖 8 min de lectura🧠 Análisis profundo

Autores originales: Bin Xia, Bohao Peng, Jiyang Liu, Sitong Wu, Jingyao Li, Junjia Huang, Xu Zhao, Yitong Wang, Ruihang Chu, Bei Yu, Jiaya Jia

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás hablando con un artista superinteligente que puede dibujar cualquier cosa que le describas. Si dices: "Dibuja un gato", lo hace. Si dices: "Haz que el gato lleve un sombrero", cambia la imagen. Este es el mundo de la generación y edición de imágenes por IA, un campo donde las computadoras aprenden a crear y modificar imágenes basadas en tus palabras. Durante mucho tiempo, la única forma de hablar con estos artistas digitales era a través del texto. Pero aquí está el problema: las palabras a veces son torpes. Intentar describir exactamente dónde poner un nuevo objeto, o cómo cambiar una parte específica de un dibujo desordenado, puede ser como intentar darle direcciones a un amigo usando solo un mapa sin puntos de referencia. Podrías decir: "Pon el árbol a la izquierda", pero la IA podría ponerlo en el extremo izquierdo, o en el lado equivocado.

Para solucionar esto, los científicos han estado explorando una nueva forma de hablar con estos artistas: el garabateo. En lugar de solo escribir, puedes tomar un lápiz digital y dibujar círculos, cuadros o garabatos desordenados directamente en la pantalla para mostrarle a la IA exactamente lo que quieres decir. Es como señalar un punto en un mapa y decir: "¡Aquí!", en lugar de describir el nombre de la calle. Este artículo, DreamOmni3, profundiza en cómo hacer que este método de "señalar y dibujar" funcione perfectamente. Aborda las partes complicas de enseñar a las computadoras no solo a entender tus palabras, sino también tus líneas dibujadas a mano y desordenadas, y combina todo para crear o editar imágenes con una precisión increíble.


El Problema: Cuando las Palabras No Son Suficientes

Imagina que estás jugando un juego en el que tienes que editar una foto. Quieres reemplazar un juguete en un círculo rojo por un bolso de mano. Si solo escribes "pon un bolso de mano aquí", la IA podría confundirse. ¿Qué juguete? ¿Dónde es "aquí"? ¿El círculo es rojo o negro? ¿Es la primera imagen o la segunda? El lenguaje es genial para grandes ideas, pero es pésimo para señalar detalles específicos y diminutos en una pantalla.

Los autores de este artículo se dieron cuenta de que, aunque la IA se ha vuelto muy buena siguiendo instrucciones de texto, a menudo pierde de vista el "dónde" y el "cómo" cuando las cosas se complican. Los usuarios necesitan una forma de ser más directos. Necesitan poder dibujar un círculo alrededor de una cara y decir: "Cambia este cabello", o dibujar una línea ondulada y decir: "Pon un coche aquí". Este es el concepto de edición y generación basada en garabatos. Se trata de permitir que los usuarios mezclen texto, imágenes y sus propios dibujos a mano alzada para controlar la IA.

La Solución: DreamOmni3

El equipo detrás de DreamOmni3 decidió construir un modelo que trate a los garabatos como un ciudadano de primera clase, junto con el texto y las imágenes. Pero hubo un gran obstáculo: los datos. Los modelos de IA son como estudiantes; necesitan ver miles de ejemplos para aprender. No existían libros de texto existentes (conjuntos de datos) que mostraran a la IA cómo interpretar un círculo desordenado dibujado a mano y convertirlo en una edición perfecta.

Así que, lo primero que hicieron los autores fue inventar una fábrica de datos. Tomaron imágenes existentes y utilizaron un proceso ingenioso para crear millones de nuevos ejemplos de entrenamiento.

  • Para la edición: Tomaron fotos, encontraron objetos y luego, de forma manual (o con ayuda de otra IA), dibujaron círculos, cuadros y garabatos sobre ellos. Crearon cuatro tipos de tareas:
    1. Garabato + Texto: "Pon un coche en el círculo rojo".
    2. Garabato + Texto + Imagen: "Pon el coche de esta foto dentro del círculo rojo".
    3. Fusión de Imágenes: Tomar un objeto de una foto y pegarlo en otra, guiado por un garabato.
    4. Edición de Garabatos: Convertir un boceto tosco en un objeto realista en la foto.
  • Para la generación: Hicieron lo mismo pero empezando con un lienzo blanco vacío en lugar de una foto, enseñando a la IA a dibujar cosas nuevas basándose en dónde garabateaste.

Generaron un conjunto masivo de datos con decenas de miles de estos ejemplos (32,000 para edición multimodal, 29,000 para generación multimodal, y más para las otras tareas) para enseñar al modelo cómo leer la mente del usuario a través de sus dibujos.

El Truco de Magia: Cómo el Modelo "Ve" el Garabato

Aquí es donde el artículo se vuelve realmente ingenioso. Normalmente, cuando quieres que una IA edite una parte específica de una imagen, utilizas una máscara binaria. Piensa en una máscara como una plantilla: es una imagen en blanco y negro donde el blanco significa "cambia esto" y el negro significa "deja esto como está".

Los autores argumentan que las máscaras son demasiado rígidas. Si tienes tres cosas diferentes que cambiar en una sola imagen, necesitas tres máscaras distintas en blanco y negro. Eso es desordenado y difícil de describir con palabras. En su lugar, DreamOmni3 utiliza garabatos de colores. Puedes dibujar un círculo rojo para el coche, un cuadrado azul para el árbol y una línea verde para el cielo. La IA puede distinguirlos fácilmente por el color.

Pero hay un detalle: si dibujas un círculo rojo sobre un coche, la IA ya no puede ver el coche porque la tinta roja lo está cubriendo. Para resolver esto, DreamOmni3 utiliza un esquema de entrada conjunta.

  • Le entrega a la IA dos imágenes al mismo tiempo: la foto original y la foto con los garabatos encima.
  • Utiliza un sistema de codificación especial (una forma de etiquetar píxeles) que le dice a la IA: "Oye, el círculo rojo en esta imagen está exactamente en el mismo lugar que el coche en esa otra imagen".
  • Esto permite que la IA vea el garabato (para saber qué quieres) y los píxeles originales (para saber qué está cambiando), asegurando que la edición sea precisa y que el resto de la imagen se mantenga perfecta.

El Cerebro: Enseñando a la IA a Entender lo "Desordenado"

Los autores también se dieron cuenta de que los dibujos humanos suelen ser desordenados. Un círculo puede parecer un huevo; una línea puede ser temblorosa. Para ayudar a la IA a entender estos dibujos imperfectos, introdujeron un Modelo de Lenguaje Visual (VLM), un tipo de IA que es muy buena razonando.

Entrenaron este VLM junto con el generador de imágenes. El VLM actúa como un traductor. Observa tu garabato y el texto que escribiste, deduce lo que realmente quisiste decir (por ejemplo: "Ah, dibujó un círculo tembloroso, pero claramente quiere un coche") y luego le dice al generador de imágenes exactamente qué hacer. Este entrenamiento conjunto asegura que la IA no solo siga reglas ciegamente, sino que realmente comprenda la intención detrás del garabato.

Los Resultados: ¿Funciona?

El equipo probó DreamOmni3 en un nuevo benchmark que crearon, lleno de imágenes del mundo real y tareas complicas. Compararon el modelo con otros modelos de primer nivel, incluyendo algunos gigantes comerciales como GPT-4o y Nano Banana.

Los resultados fueron impresionantes. DreamOmni3 superó consistentemente a otros modelos de código abierto y igualó o superó a los gigantes comerciales en muchas áreas.

  • Evaluadores Humanos (personas reales) calificaron la tasa de éxito de DreamOmni3 en 55.88% para tareas de edición, lo cual fue superior al de GPT-4o (59.56% en una métrica, pero DreamOmni3 fue más consistente en otras) y significativamente mayor que otros como Omnigen2 (2.94%).
  • En tareas de generación, DreamOmni3 alcanzó una tasa de éxito del 54.55%, superando nuevamente a la mayoría de sus competidores.
  • El artículo señala que, aunque los modelos comerciales son fuertes, a veces tienen dificultades con instrucciones específicas de garabatos, dejando a menudo los garabatos en la imagen final o fallando en las proporciones. DreamOmni3, sin embargo, fue diseñado específicamente para manejar estos matices, produciendo resultados más limpios donde los garabatos desaparecen y las ediciones parecen naturales.

Por Qué Esto Importa

DreamOmni3 no se trata solo de hacer la IA más inteligente; se trata de hacer la IA más humana. Cierra la brecha entre lo que imaginamos y lo que podemos describir. Al permitirnos dibujar, señalar y garabatear, convierte la edición de imágenes de una tarea técnica en una conversación creativa. El artículo sugiere que este enfoque —combinar texto, imágenes y dibujos a mano alzada con una síntesis de datos inteligente y entrenamiento conjunto— es el futuro de cómo interactuaremos con las herramientas de creación digital. Demuestra que cuando dejamos de intentar forzar a las computadoras a entender nuestras vagas palabras y empezamos a dejar que vean nuestras acciones directas, los resultados pueden ser mucho más mágicos.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →