← Últimos artículos
🤖 AI

InstructMoLE: Instruction-Guided Mixture of Low-rank Experts for Multi-Conditional Image Generation

InstructMoLE introduce un marco de mezcla de expertos de bajo rango guiado por instrucciones que sustituye el enrutamiento a nivel de token por una señal global derivada de las instrucciones para resolver la interferencia de tareas y la fragmentación espacial en la generación de imágenes multi-condicionales, logrando así un control composicional y una fidelidad semántica superiores en comparación con los métodos existentes.

Autores originales: Jinqi Xiao, Qing Yan, Liming Jiang, Zichuan Liu, Hao Kang, Shen Sang, Tiancheng Zhi, Jing Liu, Cheng Yang, Xin Lu, Bo Yuan

Publicado 2026-05-06
📖 4 min de lectura☕ Lectura para el café

Autores originales: Jinqi Xiao, Qing Yan, Liming Jiang, Zichuan Liu, Hao Kang, Shen Sang, Tiancheng Zhi, Jing Liu, Cheng Yang, Xin Lu, Bo Yuan

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes un artista superinteligente (una IA) que puede dibujar cualquier cosa que describas. Pero a veces, cuando le das a este artista una instrucción compleja como: "Dibuja un bebé gateando sobre la hierba, un caballo blanco pastando cerca y un casco de fútbol americano", el artista se confunde.

Si el artista intenta decidir qué dibujar para cada píxel diminuto de la imagen de forma independiente (píxel por píxel), podría dibujar correctamente la cabeza del bebé pero darle una pata de caballo al cuerpo, o hacer que el casco flote en el lugar equivocado. El resultado es una imagen desordenada y fragmentada donde las diferentes partes no encajan lógicamente.

Este artículo presenta una nueva forma de enseñar a este artista, llamada InstructMoLE. Así es como funciona, utilizando analogías simples:

1. El Problema: La Confusión "Píxel por Píxel"

Los métodos tradicionales (como LoRA) son como dar una instrucción diferente a cada píxel individual de la imagen.

  • La Analogía: Imagina un coro donde cada cantante lee una partitura diferente. Un cantante cree que está cantando sobre un caballo, el siguiente cree que está cantando sobre un casco. El resultado es ruido, no una canción.
  • El Problema: En la generación de imágenes, esto causa "fragmentación espacial". El bebé podría parecer un caballo, o el casco podría estar dentro de la hierba. El artista pierde la "gran imagen" de tu solicitud.

2. La Solución: El "Consejo de Expertos"

Los autores proponen un sistema llamado Mezcla de Expertos de Baja Rango (MoLE).

  • La Analogía: En lugar de un artista generalista, imagina un equipo de 8 expertos especializados.
    • El Experto A es excelente dibujando animales.
    • El Experto B es excelente dibujando ropa.
    • El Experto C es excelente con la iluminación y las sombras.
  • La Vieja Forma: El antiguo sistema pedía a cada píxel individual que eligiera su propio experto. El píxel de la hierba podría elegir al "Experto A", mientras que el píxel del caballo elige al "Experto B", lo que lleva a una mezcla caótica.
  • La Forma InstructMoLE: El sistema lee tu instrucción completa primero. Dice: "Vale, esta solicitud trata sobre una escena con animales y objetos. Necesito que todo el equipo se ponga de acuerdo en un plan".

3. El Ingrediente Secreto: "Enrutamiento Guiado por Instrucciones" (IGR)

Esta es la innovación central. En lugar de dejar que los píxeles elijan expertos, el sistema lee tu frase completa y elige un solo "Consejo de Expertos" para toda la capa de la imagen.

  • La Analogía: Piensa en un director de cine. Antes de filmar una escena, el director reúne al elenco y al equipo y dice: "Hoy vamos a filmar una escena con un bebé y un caballo. Todos, concentrense en este estilo y relación específicos".
  • Cómo ayuda: El director (el sistema de enrutamiento) asegura que cada parte de la imagen siga el mismo plan. El bebé se mantiene siendo un bebé, el caballo se mantiene siendo un caballo, y mantienen la relación correcta entre ellos. Esto evita el aspecto "fragmentado".

4. Manteniendo al Equipo Diverso: La "Pérdida de Ortogonalidad"

Existe el riesgo de que, si tienes un equipo de expertos, todos puedan empezar a hacer exactamente lo mismo (por ejemplo, los 8 expertos aprenden solo a dibujar caballos). Esto se llama "colapso de expertos".

  • La Analogía: Imagina un equipo deportivo donde el portero, el delantero y el defensa deciden simplemente quedarse parados en el arco. El equipo falla porque nadie está haciendo su trabajo específico.
  • La Solución: Los autores añadieron una regla especial (una penalización matemática) que obliga a los expertos a ser diferentes entre sí. Es como un entrenador diciendo: "Tú, debes ser el portero. Tú, debes ser el delantero. No puedes hacer el mismo trabajo que tu compañero".
  • Resultado: Esto asegura que, cuando el sistema elige un "Consejo", obtenga un grupo de expertos que realmente aporten habilidades diferentes a la mesa, haciendo que la imagen final sea mucho más rica y precisa.

La Conclusión

El artículo afirma que al utilizar este enfoque de "Director Global" (Enrutamiento Guiado por Instrucciones) y obligar al "Equipo Especializado" a mantenerse diverso, la IA puede seguir instrucciones complejas mucho mejor que antes.

  • Antes: La IA podría dibujar un bebé con la cabeza de un caballo o poner un casco en el personaje equivocado porque estaba pensando de forma demasiado local.
  • Ahora: La IA entiende toda la historia que le contaste y aplica esa historia de manera consistente en toda la imagen, resultando en imágenes coherentes y de alta calidad que coinciden exactamente con tu intención.

Los autores probaron esto en un modelo de IA potente (Flux.1) y descubrieron que funciona significativamente mejor manejando múltiples sujetos, cambiando estilos y siguiendo instrucciones espaciales complejas que los métodos anteriores.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →