← Últimos artículos
🤖 machine learning

Follow the Mean: Reference-Guided Flow Matching

Este artículo presenta "Follow the Mean", un marco de ajuste de flujo guiado por referencias que permite la generación de imágenes controlable mediante la adaptación de modelos preentrenados a través de desplazamientos de la media de los puntos finales basados en ejemplos, ofreciendo métodos sin entrenamiento y semiparamétricos para orientar las salidas sin ajuste fino ni búsqueda en tiempo de prueba.

Autores originales: Pedro M. P. Curvo, Maksim Zhdanov, Floor Eijkelboom, Jan-Willem van de Meent

Publicado 2026-05-12
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Pedro M. P. Curvo, Maksim Zhdanov, Floor Eijkelboom, Jan-Willem van de Meent

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes un artista muy talentoso que ha pasado años aprendiendo a pintar a partir de una biblioteca masiva de fotos. Este artista es tan bueno que puede pintar cualquier cosa que describas, como "un elefante en una selva". Sin embargo, una vez que el artista está entrenado, queda "congelado". No puedes enseñarle nuevos trucos fácilmente sin hacer que olvide sus habilidades anteriores o sin pasar meses reentrenándolo.

Por lo general, si quieres que este artista pinte un elefante rosa en lugar de uno gris, tienes que:

  1. Reentrenarlo: Mostrarle miles de elefantes rosas y esperar que aprenda (costoso y lento).
  2. Añadir un supervisor: Contratar a un crítico que le grite al artista cada vez que pinte algo gris, obligándolo a intentarlo de nuevo (lento y computacionalmente pesado).
  3. Buscar entre borradores: Pintar 100 versiones y elegir la mejor (desperdiciado).

Este artículo introduce una forma mucho más sencilla: Ajuste de Flujo Guiado por Referencia.

La Idea Central: "Sigue a la Multitud"

Los autores descubrieron un atajo inteligente. En lugar de cambiar el cerebro del artista (los pesos del modelo), simplemente cambias a quién está mirando el artista mientras pinta.

Piensa en el proceso de pintar como un barco navegando por un río (el "flujo"). El barco quiere llegar a un destino específico (la imagen final).

  • Pintura Estándar: El barco sigue un mapa basado en el entrenamiento del artista. Si pides un elefante, el mapa lleva a un elefante gris.
  • El Nuevo Truco: Los autores se dieron cuenta de que si muestras al barco un conjunto de referencia de fotos (por ejemplo, 20 imágenes de elefantes rosas) justo antes de que comience, el destino del barco se desplaza. La "corriente" del río cambia de dirección para guiarse hacia los elefantes rosas.

No necesitas enseñarle nada nuevo al artista. Solo le entregas una nueva pila de fotos de referencia, y las matemáticas del río atraen naturalmente la imagen final hacia el estilo, el color o la forma de esas fotos.

Dos Maneras de Hacerlo

El artículo propone dos versiones de esta "Guía de Referencia":

1. La "Guía Instantánea" (Guía de Media de Referencia)

Esta es la versión "sin entrenamiento".

  • Cómo funciona: Tomas un modelo preentrenado y congelado (como el modelo FLUX.2 mencionado en el artículo). Cuando quieres generar una imagen, le das tu prompt y un pequeño banco de imágenes de referencia (por ejemplo, 20 elefantes rosas).
  • La Magia: El modelo no solo mira el texto; calcula una "media" (un promedio) de hacia dónde apuntan las fotos de referencia. Luego, empuja suavemente el proceso de pintura hacia ese promedio.
  • Resultado: Obtienes un elefante rosa, una casa al estilo de Van Gogh o un gesto de mano específico, todo sin cambiar una sola línea del código del modelo ni reentrenarlo. Es como darle al artista un nuevo tablero de inspiración justo antes de empezar a pintar.

2. El "Asistente Inteligente" (Guía Semiparamétrica)

Esta versión es para modelos que están construidos para aprender de las referencias desde el principio.

  • Cómo funciona: Imagina que el artista tiene un "asistente inteligente" de pie a su lado. Este asistente mira las fotos de referencia y dice: "Oye, el promedio de estas fotos es un gato con una cola esponjosa".
  • El Refinamiento: El artista luego pinta basándose en ese promedio, pero añade su propio "residual" (su propio toque creativo) para corregir cualquier detalle extraño.
  • Resultado: Esto permite que el modelo aprenda a usar las referencias de manera eficiente. Puede cambiar entre generar gatos o perros simplemente intercambiando el banco de referencias, sin necesidad de reentrenar todo el sistema. Mantiene la alta calidad del modelo original pero añade la capacidad de adaptarse instantáneamente.

Por Qué Esto Importa (Según el Artículo)

El artículo afirma que este enfoque es superior porque:

  • Es Rápido: No necesitas esperar horas de reentrenamiento ni ejecutar búsquedas complejas. Solo cambias las imágenes de referencia.
  • Es Flexible: Puedes controlar el color, el estilo, la identidad del objeto e incluso estructuras complejas (como la forma de una mano o una cerradura) simplemente mostrando ejemplos al modelo.
  • Es Simple: Se basa en un principio matemático: si desplazas el "destino" (la media del punto final) del flujo, todo el viaje cambia.

Una Analogía del Mundo Real

Imagina que conduces un coche con un GPS muy estricto (el modelo de IA).

  • La Vieja Forma: Para cambiar tu destino, tienes que reprogramar todo el sistema de navegación del coche (Ajuste Fino) o pedirle a un pasajero que grite constantemente "¡Gira a la izquierda!" (Guía/Clasificadores).
  • La Forma de Este Artículo: Simplemente colocas una pila de fotos de tu destino deseado en el salpicadero. El sistema de navegación del coche es lo suficientemente inteligente como para mirar esas fotos, darse cuenta de "Oh, quieren ir allí" y redirigir automáticamente el coche. No cambiaste el coche; solo cambiaste el punto de referencia.

Lo Que Demostró el Artículo

Los autores probaron esto en:

  • Colores: Convertir elefantes grises en rosas.
  • Estilos: Convertir fotos en bocetos o pinturas de Van Gogh.
  • Estructuras: Corregir la forma de una mano o una cerradura.
  • Composición: Asegurar que dos objetos aparezcan en los lugares correctos en relación entre sí.

En cada caso, simplemente intercambiando el "Conjunto de Referencia" (la pila de fotos), pudieron dirigir el modelo de IA congelado para producir exactamente lo que querían, demostrando que los datos (las fotos de referencia) pueden controlar el modelo mejor que cambiar el modelo en sí.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →