← Últimos artículos
🤖 machine learning

Generative Modeling via Drifting

Este artículo introduce los "Drifting Models", un nuevo paradigma de modelado generativo que evoluciona la distribución de pushforward durante el entrenamiento mediante un campo de deriva para alcanzar el equilibrio, permitiendo la generación de imágenes en un solo paso con estado del arte en ImageNet a una resolución de 256x256.

Autores originales: Mingyang Deng, He Li, Tianhong Li, Yilun Du, Kaiming He

Publicado 2026-02-09
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Mingyang Deng, He Li, Tianhong Li, Yilun Du, Kaiming He

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando enseñarle a un robot a dibujar la imagen perfecta de un gato.

En las formas antiguas de hacer esto (como los modelos de Difusión), el robot comenzaría con un lienzo en blanco lleno de ruido estático. Luego, daría un pequeño paso, limpiaría un poco de ese ruido, daría otro paso, limpiaría un poco más, y repetiría este proceso cientos de veces hasta que finalmente apareciera un gato. Es como esculpir una estatua quitando trozos de un gran bloque de piedra, un pequeño fragmento a la vez.

Este artículo propone una nueva forma llamada "Modelos de Deriva" (Drifting Models).

En lugar de ir quitando trozos de piedra paso a paso, imagina que el robot tiene un "viento" mágico que sopla el ruido directamente hacia la forma de un gato en un solo movimiento fluido.

Aquí es como el artículo lo explica, desglosado en conceptos simples:

1. El objetivo: Empujar una nube para darle forma

Piensa en el ruido con el que el robot comienza como una nube de polvo flotando en el aire. El objetivo es empujar esa nube para que se asiente en la forma exacta de un gato.

  • La forma antigua: Empujas la nube un poquito, te detienes, revisas la forma, empujas un poquito más, te detienes, revisas de nuevo. Haces esto una y otra vez.
  • La nueva forma (Deriva): Calculas la dirección y la velocidad de viento perfectas que empujarán la nube de "polvo" a "gato" en un solo aliento.

2. El ingrediente secreto: El "Campo de Deriva"

¿Cómo sabe el robot hacia dónde empujar? El artículo introduce un concepto llamado Campo de Deriva (Drifting Field).

Imagina que estás en una habitación con dos grupos de personas:

  • Grupo A (Los gatos reales): Estas son fotos reales de gatos.
  • Grupo B (Los dibujos del robot): Estos son los dibujos desordenados y borrosos que el robot está haciendo actualmente.

El "Campo de Deriva" es como una fuerza invisible que le dice al dibujo del robot hacia dónde moverse:

  • Atracción: El dibujo siente una atracción suave hacia los gatos reales (Grupo A).
  • Repulsión: El dibujo siente un empuje para alejarse de sus propias versiones malas y borrosas (Grupo B).

El robot calcula esta atracción y este empuje para cada uno de los dibujos. Si el dibujo está lejos de un gato real, la atracción es fuerte. Si el dibujo ya es bueno, la atracción es débil.

3. El "Equilibrio" (El punto ideal)

La magia ocurre cuando los dibujos del robot se vuelven tan buenos que se ven exactamente como los gatos reales.

  • En este punto, la "atracción" de los gatos reales y el "empuje" de los dibujos malos se cancelan entre sí perfectamente.
  • El "viento" deja de soplar porque el dibujo ya está en el lugar correcto.
  • El artículo llama a esto Equilibrio. Cuando el viento se detiene, el robot ha aprendido el mapa perfecto para convertir el ruido en un gato.

4. Entrenamiento vs. Inferencia (Aprendizaje vs. Ejecución)

Esta es la parte ingeniosa del artículo:

  • Entrenamiento (Aprendizaje): El robot aprende simulando este "viento" una y otra vez. Observa cómo sus dibujos derivan hacia los gatos reales, ajusta las matemáticas correctamente y actualiza su cerebro. Este es un proceso iterativo (toma tiempo aprender).
  • Inferencia (Ejecución): Una vez que el robot ha aprendido el mapa de viento perfecto, ya no necesita dar pequeños pasos. Simplemente aplica ese mapa una sola vez. Toma un soplo de ruido, aplica el "Campo de Deriva" una vez y, ¡puf!, aparece un gato perfecto.

5. Por qué esto es importante

El artículo afirma que este método es un cambio de juego porque:

  • Velocidad: Genera imágenes en un solo paso (llamado 1-NFE). No tienes que esperar 50 o 100 pasos para obtener un resultado.
  • Calidad: A pesar de ser de un solo paso, las imágenes son increíblemente de alta calidad. En una prueba estándar (ImageNet), lograron una puntuación (FID) de 1.54, que es mejor que casi cualquier otro método de un solo paso y compite con los métodos lentos de múltiples pasos.
  • Versatilidad: Funciona no solo para imágenes, sino también para controlar robots (como un brazo robótico recogiendo objetos), demostrando que es una forma general de generar datos.

Resumen de la analogía

  • Método antiguo (Difusión): Como caminar por un bosque oscuro para encontrar un tesoro. Das un paso, revisas tu mapa, das otro paso, revisas de nuevo. Toma mucho tiempo.
  • Modelo de Deriva: Como tener un GPS que calcula toda la ruta instantáneamente. Te subes al coche, presionas "Ir" y llegas al tesoro en un solo viaje fluido.

El artículo esencialmente dice: "Encontramos una manera de calcular esa ruta de GPS perfecta (el Campo de Deriva) durante el entrenamiento, para que en el momento de la ejecución, podamos simplemente conducir directamente allí de un solo golpe".

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →