← Últimos artículos
💻 computer science

Images in Sentences: Scaling Interleaved Instructions for Unified Visual Generation

El artículo presenta INSET, un modelo unificado de generación visual que incrusta imágenes como tokens de vocabulario nativo dentro de instrucciones textuales y aprovecha un motor de datos escalable de 15 millones de muestras intercaladas para superar significativamente a los métodos existentes en consistencia multiimagen y seguimiento de instrucciones complejas.

Autores originales: Yabo Zhang, Kunchang Li, Dewei Zhou, Xinyu Huang, Xun Wang

Publicado 2026-05-13
📖 4 min de lectura☕ Lectura para el café

Autores originales: Yabo Zhang, Kunchang Li, Dewei Zhou, Xinyu Huang, Xun Wang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando dar una orden muy específica y compleja a un artista.

La Vieja Forma (El Problema de la "Tarjeta de Índice")
Actualmente, la mayoría de los generadores de imágenes por IA funcionan como un bibliotecario que solo entiende números. Si quieres una imagen con un perro específico de una foto, un sombrero específico de otra y un fondo específico de una tercera, tienes que decir: "Dibuja una imagen usando el Perro de la Imagen #1, el Sombrero de la Imagen #2 y el Fondo de la Imagen #3."

La IA tiene que recordar qué número corresponde a qué imagen mientras intenta pintar. A medida que agregas más imágenes, la IA se confunde. Olvida qué sombrero va con qué perro, o simplemente ignora las imágenes adicionales por completo. Es como intentar hacer malabares con cinco pelotas con los ojos vendados; eventualmente, las dejarás caer.

La Nueva Forma: "Imágenes en Frases" (Inset)
El artículo introduce un nuevo modelo llamado Inset (Imágenes en Frases). En lugar de tratar las imágenes como archivos separados con números, Inset trata las imágenes como palabras en una frase.

Imagina que estás escribiendo una historia, pero en lugar de escribir la palabra "perro", pegas una imagen diminuta y perfecta de ese perro específico directamente en la frase.

  • Vieja forma: "Pon el perro de la Imagen 1 en la silla."
  • Forma Inset: "Pon [Imagen del Perro] en la silla."

Como la imagen está justo al lado de la palabra "silla" en la frase, la IA no tiene que adivinar ni recordar un número. El significado está allí mismo, en primer plano y al centro. Esto permite que la IA maneje instrucciones complejas con muchas imágenes diferentes sin confundirse.

Cómo Entrenaron a la IA (La "Fábrica de Datos")
Para enseñar a la IA a hacer esto, los investigadores no pudieron simplemente encontrar suficientes ejemplos en internet porque son raros. Así que construyeron un motor de datos escalable (una fábrica de robots para datos).

  1. Para Fotos: Tomaron millones de fotos y utilizaron otras IAs inteligentes para descomponerlas. Identificaron cada objeto (como un "jarrón rojo" o un "gato azul"), escribieron una frase sobre ello y luego insertaron la imagen real de ese objeto directamente en la frase donde estaba la descripción.
  2. Para Videos: Observaron videos para enseñar a la IA cómo las cosas cambian. Si un video muestra a un gato saltando, crearon instrucciones que dicen: "Toma el gato del inicio [Imagen del gato sentado] y haz que salte [Imagen del gato saltando]". Esto enseña a la IA a comprender el movimiento y la transformación, no solo la copia estática.

Crearon 15 millones de estas "frases-imagen" para entrenar el modelo.

Los Resultados
Probaron este nuevo modelo en un desafío difícil llamado InterleaveBench, que implica mezclar muchas imágenes diferentes en una sola solicitud compleja.

  • La Puntuación: Cuando se pidió usar 2 imágenes, Inset lo hizo bien. Pero cuando se pidió usar 5 imágenes, los modelos antiguos se desmoronaron, mientras que Inset siguió mejorando. Fue significativamente más preciso al mantener que los objetos se vieran como los originales y al seguir las instrucciones del texto.
  • El Bonus: Como la IA aprendió a tratar las imágenes como parte de la instrucción, también puede realizar edición. Puedes mostrarle una foto de una camisa específica y decir: "Pon esta camisa en la persona de la foto", y copiará el diseño exacto de esa camisa, en lugar de simplemente adivinar cómo se ve una "camisa".

En Resumen
El artículo afirma que al evitar que la IA use "números" para referirse a imágenes y, en su lugar, permitirle "leer" las imágenes como si fueran palabras, podemos crear herramientas mucho más potentes para generar y editar imágenes complejas. Lo demostraron construyendo una biblioteca masiva de ejemplos de práctica y mostrando que su nuevo modelo supera a todos los competidores de código abierto actuales, especialmente cuando las tareas se complican.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →