← Últimos artículos
🤖 AI

MixFlow Training: Alleviating Exposure Bias with Slowed Interpolation Mixture

Este artículo presenta MixFlow, un nuevo enfoque de entrenamiento que alivia el sesgo de exposición en los modelos de difusión mediante el aprovechamiento de una estrategia de "mezcla de interpolación ralentizada" para alinear mejor las condiciones de entrenamiento y de prueba, logrando así resultados de generación de imágenes de vanguardia en ImageNet.

Autores originales: Hui Li, Fu-Yun Wang, Haoyuan Xia, Jiayue Lyu, Kaihui Cheng, Siyu Zhu, Jingdong Wang

Publicado 2026-07-14
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Hui Li, Fu-Yun Wang, Haoyuan Xia, Jiayue Lyu, Kaihui Cheng, Siyu Zhu, Jingdong Wang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que le estás enseñando a un robot a dibujar un cuadro girando lentamente una perilla que transforma una nube de estática en una imagen clara. Así es como funcionan los modelos de "difusión" modernos. Aprenden mirando una foto, añadiendo ruido estático a la misma y luego intentando adivinar cómo eliminar ese ruido paso a paso para recuperar la imagen original.

Aquí está el problema: Durante el entrenamiento (la fase de aprendizaje), el robot hace un poco de trampa. Cada vez que intenta adivinar el siguiente paso, se le muestra la versión perfecta de la imagen ruidosa del paso anterior. Es como un estudiante tomando un examen donde el profesor le susurra la respuesta correcta de la pregunta anterior antes de que siquiera escriba la suya propia.

Pero durante las pruebas (cuando el robot realmente dibuja una imagen nueva), el profesor deja de susurrar. El robot tiene que usar su propio cálculo previo para determinar el siguiente paso. Si comete un error minúsculo al principio, este error se arrastra, se hace más grande y, finalmente, la imagen se ve extraña o borrosa. Esto se llama "sesgo de exposición" (exposure bias): el robot está expuesto a datos perfectos mientras aprende, pero a datos desordenados cuando está por su cuenta.

El descubrimiento del "Flujo Lento" (Slow Flow)

Los autores de este artículo notaron algo extraño que sucedía mientras observaban al robot dibujar. Descubrieron que, cuando el robot generaba una imagen ruidosa en un momento determinado (llamémoslo "Tiempo T"), la versión perfecta de ese ruido (la que el robot debería haber estado mirando) en realidad pertenecía a un momento anterior en el proceso, un momento con más ruido.

Piénsalo de esta manera: Imagina que estás corriendo una carrera. A la marca de los 10 segundos, miras hacia atrás y te das cuenta de que tu posición "perfecta" ocurrió en realidad en la marca de los 8 segundos. Efectivamente, eres más "lento" que la verdad absoluta. La trayectoria generada por el robot se queda rezagada respecto a la trayectoria perfecta, atrapada en un estado "ralentizado" con más ruido del que debería tener.

La solución MixFlow

En lugar de intentar arreglar el estilo de carrera del robot después de la carrera (como intentaron otros métodos), los autores decidieron cambiar la forma en que el robot aprende la carrera. Introdujeron un nuevo método de entrenamiento llamado MixFlow.

En el entrenamiento estándar, el robot solo mira el ruido perfecto del momento exacto en el que se supone que debe estar. En MixFlow, el robot es entrenado para mirar una "mezcla" de ruidos perfectos. Mira el ruido perfecto para el momento actual, pero también los ruidos perfectos de esos momentos "ralentizados" con más ruido.

La Analogía:
Imagina que estás aprendiendo a montar en bicicleta.

  • Entrenamiento Estándar: Solo practicas en una carretera perfectamente plana y suave. Cuando sales al mundo real con baches y viento, te estrellas porque no estabas preparado para el retraso (lag).
  • Entrenamiento MixFlow: Practicas en la carretera suave, pero también practicas en una versión de la carretera ligeramente más accidentada y "más lenta" que imita el retraso que sentirás más tarde. Aprendes a manejar esa sensación de "lentitud" mientras todavía estás en la seguridad del entrenamiento.

Al entrenar con esta "mezcla de interpolación ralentizada", el robot aprende a lidiar con el hecho de que sus propios cálculos serán ligeramente "más lentos" y ruidosos que la verdad perfecta (ground truth). Deja de confundirse cuando tiene que confiar en sus propios cálculos previos.

Lo que descartaron

Los autores fueron muy cuidadosos al probar qué es lo que no funciona. Probaron un método llamado "Perturbación de la Entrada" (Input Perturbation), que consiste en añadir ruido aleatorio a los datos de entrenamiento para simular errores. Descubrieron que si solo añades ruido aleatorio sin entender el patrón de "flujo lento", podrías enseñar accidentalmente al robot con datos "más rápidos" (con menos ruido) que no coinciden con la realidad, o datos "más lentos" que están demasiado alejados. Sus experimentos demostraron que añadir ruido a ciegas a menudo empeora las cosas, mientras que su mezcla específica de "ralentización" es la clave.

También compararon su método con el de arreglar el problema durante el proceso de dibujo (inferencia) mediante el ajuste de los pasos. Descubrieron que, si bien esos ajustes ayudan un poco, son como intentar conducir un coche que ya se está desviando; es mejor arreglar el motor (el entrenamiento) desde el principio.

Los Resultados: ¿Qué tan seguros estamos?

Los autores no solo conjeturaron; realizaron experimentos masivos en conjuntos de datos de imágenes reales.

  • La Prueba: Probaron su método MixFlow en varios generadores de imágenes de alto nivel (como SiT, REPA y RAE) utilizando el conjunto de datos ImageNet, que contiene 1.2 millones de imágenes de 1,000 categorías diferentes de objetos.
  • Los Números: En las imágenes de 256 × 256 píxeles, su modelo MixFlow logró una puntuación de 1.43 (sin guía) y 1.10 (con guía). En las imágenes más grandes de 512 × 512, alcanzó 1.55 (sin guía) y 1.10 (con guía).
    • Nota: En este campo, una puntuación "FID" más baja es mejor. Estos números son increíblemente bajos, lo que significa que las imágenes generadas son casi indistinguibles de las fotos reales.
  • Texto a Imagen: También lo probaron en un modelo de texto a imagen (SD 3.5). Cuando se le pidió que dibujara escenas complejas, como "cinco pizzas sabrosas" o "un pájaro a la izquierda de un reloj", la versión MixFlow siguió las instrucciones mucho mejor que la versión estándar, logrando acertar tanto en el conteo como en las posiciones.

El artículo sugiere que este enfoque es un paso significativo hacia adelante porque aborda directamente la causa raíz de la acumulación de errores. No es un truco de magia; es una forma más inteligente de practicar. Al dejar que el robot practique con versiones "ralentizadas" de la verdad, se vuelve mucho más robusto cuando tiene que generar imágenes por su cuenta.

En resumen, el artículo demuestra que, al cambiar la dieta de entrenamiento para incluir datos "ralentizados", los modelos de difusión pueden dejar de tropezar con sus propios pies y empezar a correr una carrera mucho más fluida.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →