← Últimos artículos
💻 computer science

MRT: Masked Region Transformer for Layered Image Generation and Editing at Scale

Este artículo presenta MRT, un modelo de difusión de regiones enmascaradas de 20 mil millones de parámetros entrenado en 10 millones de muestras que unifica las tareas de texto a capas, imagen a capas y capas a capas para lograr la generación y edición de imágenes transparentes multicapa en tiempo real con estado del arte, superando en calidad y eficiencia a los sistemas comerciales y concurrentes existentes.

Autores originales: Zhicong Tang, Zhao Zhang, Jingye Chen, Mohan Zhou, Yifan Pu, Yuchi Liu, Yalong Bai, Ethan Smith, Yuhui Yuan

Publicado 2026-05-27
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Zhicong Tang, Zhao Zhang, Jingye Chen, Mohan Zhou, Yifan Pu, Yuchi Liu, Yalong Bai, Ethan Smith, Yuhui Yuan

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes un editor de fotos digital, como Photoshop, donde puedes trabajar con "capas" separadas. Puedes mover un cuadro de texto, cambiar un fondo o intercambiar un icono sin estropear el resto de la imagen. Ahora, imagina una IA que no solo crea una imagen plana y terminada, sino que construye esa imagen capa por capa, tal como lo haría un diseñador humano.

Eso es exactamente de lo que trata el artículo "MRT: Masked Region Transformer". Aquí tienes una explicación sencilla de lo que construyeron y cómo funciona, utilizando algunas analogías cotidianas.

El Gran Problema: El "Pastel Plano" vs. El "Pastel por Capas"

La mayoría de los generadores de imágenes de IA actuales son como panaderos que solo hacen pastel planos. Te entregan una imagen terminada, pero si quieres cambiar la cereza del pastel, tienes que volver a pintar todo el pastel. No puedes mover fácilmente la cereza ni cambiar el glaseado sin arruinar el bizcocho.

Los investigadores querían una IA que hornee un pastel por capas. Querían un sistema que genere el bizcocho, el relleno, el glaseado y las cerezas como piezas separadas y móviles que puedan editarse más tarde. Esto se llama "Generación de Imágenes por Capas".

La Solución: MRT (El Chef Maestro)

El equipo de Canva Research construyó un modelo masivo de IA llamado MRT (Masked Region Transformer). Piensa en él como un Chef Maestro que ha estudiado más de 10 millones de diseños gráficos diferentes (pósters, folletos, anuncios) para aprender a construir estos pasteles por capas desde cero.

Estas son las tres principales "superpoderes" que tiene este chef:

1. La "Receta Mágica" (Texto a Capas)

Puedes darle a la IA una descripción de texto, como "Un póster para una fiesta de discoteca con una bola brillante y un letrero de '20% DE DESCUENTO'".

  • IA Antigua: Dibujaría una imagen plana de una discoteca.
  • MRT: Dibuja el fondo, la bola de discoteca y el texto como capas separadas y transparentes. Puedes tomar la capa de texto y moverla a la izquierda, o cambiar la bola de discoteca por una estrella, y el resto del póster permanece perfecto.

2. El "Ingeniero Inverso" (Imagen a Capas)

Esto es como tomar un pastel terminado y plano y separarlo mágicamente de nuevo en sus ingredientes.

  • La Tarea: Subes una imagen plana (como una captura de pantalla de un sitio web o un póster).
  • El Trabajo de MRT: Determina qué pertenece al fondo, qué es el texto y qué son las imágenes. Luego los "pelar" separándolos en capas individuales y editables.
  • El Truco: El artículo afirma que esto funciona increíblemente bien, incluso en diseños complejos con muchos elementos superpuestos, y es mucho más rápido y preciso que otras herramientas disponibles actualmente.

3. El "Mezcla y Combina" (Capas a Capas)

Esta es la parte de edición. Puedes darle a la IA un diseño y decir: "Añade una nueva capa aquí" o "Cambia el estilo de esta capa específica para que coincida con el resto".

  • Ejemplo: Tienes un póster con un cielo azul. Quieres añadir un nuevo sol. MRT añade el sol de una manera que se ajusta perfectamente a la iluminación y el estilo del cielo existente. O, subes una foto de un gato y dices: "Haz que este gato parezca una calcomanía de dibujos animados que encaje en este póster". MRT realiza la transformación instantáneamente.

El Secreto: Cómo lo Hicieron

1. El Truco del "Desbordamiento" (El Lienzo Gigante)
Por lo general, cuando la IA dibuja una imagen, corta cualquier cosa que se salga del marco (como una rama de árbol que sobresale del lado de una foto).

  • La Innovación de MRT: Enseñaron a la IA a dibujar sobre un lienzo gigante e invisible que es más grande que la imagen final. Esto permite que los elementos "desborden" los bordes.
  • Por qué importa: Si quieres mover esa rama de árbol que sobresale al otro lado del póster más tarde, la IA tiene toda la rama guardada, no solo la parte que era visible. Mantiene las piezas enteras y editables.

2. El Juego del "Enmascaramiento"
Imagina que estás jugando un juego donde tienes que adivinar qué hay bajo una manta.

  • Texto a Capas: La IA comienza con un lienzo en blanco y ruidoso (como el estático de un televisor antiguo) y rellena las capas.
  • Imagen a Capas: Se le da a la IA la imagen terminada (la manta se levanta) pero se le instruye para que "enmascare" (cubra) el fondo y el texto, y luego "redibuje" solo esas partes específicas para separarlas.
  • Al utilizar esta técnica de "enmascaramiento", el mismo cerebro de IA puede manejar la escritura desde cero, el desmontaje de cosas y la edición de cosas, todo a la vez.

3. Acelerándolo (La "Destilación")
Normalmente, generar una imagen compleja por capas lleva mucho tiempo (como esperar a que una computadora lenta renderice).

  • Los investigadores utilizaron una técnica llamada destilación. Piensa en esto como un chef maestro (el profesor lento y perfecto) enseñando a un aprendiz (el estudiante rápido) a cocinar el mismo plato en 8 pasos en lugar de 50.
  • Resultado: La IA ahora puede generar estos diseños complejos y por capas en tiempo real (aproximadamente de 3 a 6 segundos) sin perder mucha calidad.

Los Resultados

El artículo compara MRT con otros modelos de IA líderes y herramientas comerciales.

  • Calidad: En pruebas con usuarios, la gente prefirió los resultados de MRT sobre otros sistemas porque las capas eran más limpias, el texto era mejor y las piezas encajaban de manera más natural.
  • Velocidad: Es 10 a 100 veces más rápido que un modelo competidor llamado "Qwen-Image-Layered" al descomponer imágenes complejas.
  • Memoria: Utiliza significativamente menos memoria de computadora, lo que significa que puede ejecutarse en tarjetas gráficas potentes estándar sin bloquearse.

En Resumen

El artículo presenta una herramienta que trata las imágenes digitales no como pinturas estáticas, sino como sets de Lego editables. Puede construir estos sets a partir de una descripción de texto, desarmar una imagen terminada para revelar los bloques de Lego, o intercambiar bloques para cambiar el diseño, todo mientras mantiene las piezas enteras, incluso si sobresalen de los bordes de la caja.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →