Any-OPD: Heterogeneous On-Policy Distillation for Flow-Matching Models via Representation-Space Bridging
Any-OPD introduce un marco novedoso para la destilación on-policy heterogénea entre modelos arbitrarios de flujo de emparejamiento latente al conectarlos a través de una representación visual congelada y agnóstica al modelo y un emparejamiento continuo de niveles de ruido, permitiendo que un estudiante de 2.5B rivalice con el rendimiento de un profesor de 12B donde la regresión latente tradicional falla.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina un mundo donde los artistas no solo pintan con pinceles, sino con matemáticas. Este es el reino de la generación de imágenes por IA, un campo donde las computadoras aprenden a crear imágenes desde cero estudiando millones de ejemplos. Para lograr esto, los modelos de IA modernos utilizan un truco ingenioso llamado flow matching (ajuste de flujo). Piensa en ello como un río que fluye desde una cascada caótica y ruidosa (estática pura) hacia un lago tranquilo y cristalino (una imagen perfecta). La IA aprende el camino exacto de ese río para poder guiar cualquier gota de agua desde el ruido hacia una imagen hermosa.
Sin embargo, hay un inconveniente. Los artistas de IA más poderosos son como elefantes gigantes y de movimientos lentos: son masivos, requieren supercomputadoras para funcionar y tardan una eternidad en generar una sola imagen. Nosotros queremos la velocidad y eficiencia de una ardilla ágil, pero también queremos el genio artístico del elefante. La solución es la destilación: enseñar a un modelo estudiante, pequeño y rápido, a copiar al maestro, grande y lento. Pero aquí está el problema: usualmente, el maestro y el estudiante deben hablar exactamente el mismo lenguaje, usar el mismo mapa interno y seguir el mismo reloj. Si son de diferentes "familias" de IA, podrían estar hablando dialectos distintos o viviendo en diferentes zonas horarias. Hasta ahora, intentar enseñar a una ardilla a ser un elefante cuando usan planos completamente diferentes era imposible.
Este artículo presenta Any-OPD, un nuevo método que actúa como un traductor universal y un entrenador que dobla el tiempo. Los investigadores descubrieron que no es necesario que el maestro y el estudiante compartan sus mismos mapas internos o relojes para aprender el uno del otro. En lugar de forzarlos a comparar sus notas internas secretas (lo que sería un galimatías para el otro), Any-OPD les permite comparar las imágenes finales que crean utilizando un "crítico de arte" externo (un modelo de visión congelado llamado DINOv2) que entiende el significado de la imagen, no solo los píxeles.
El equipo probó esto tomando un modelo estudiante diminuto de 2.5 mil millones de parámetros (SD3.5-Medium) y enseñándole a imitar a un maestro masivo de 12 mil millones de parámetros (FLUX.1-dev). Estos dos modelos son completamente diferentes: usan estructuras internas distintas, diferentes formas de manejar el ruido y diferentes cronogramas. Los métodos estándar intentaban forzar una comparación directa entre sus datos internos, lo que causaba que el entrenamiento colapsara en un desastre borroso. Any-OPD, sin embargo, esquivó esto comparando únicamente las imágenes finales en un "espacio de significado" compartido.
Los resultados fueron sorprendentes. El pequeño estudiante, tras ser entrenado con Any-OPD, no solo mejoró un poco; se convirtió en un maestro artista. Mejoró su capacidad para crear imágenes que los humanos prefieren (medido por una puntuación llamada PickScore) de 0.846 a 0.884, y su puntuación de preferencia humana (HPSv3) saltó de 9.12 a 10.97. De hecho, este pequeño estudiante comenzó a rivalizar, y en algunos casos incluso a superar, el rendimiento de su gigante maestro de 12 mil millones de parámetros, todo esto mientras se ejecuta a una fracción de su tamaño y costo.
El artículo descarta explícitamente la idea de que se puedan comparar simplemente los datos internos brutos (latentes) o los detalles píxel por píxel de las imágenes cuando los modelos son diferentes. Demostraron que intentar una "regresión de píxeles" directa entre diferentes familias de modelos causa que el entrenamiento falle por completo. En su lugar, demostraron que, al anclar primero al estudiante y luego utilizar un sistema de emparejamiento de niveles de ruido para alinear sus pasos en el tiempo, se puede transferir con éxito el conocimiento entre cualquier par de modelos, sin importar cuán diferentes sean. Esto sugiere que, en el futuro, no estaremos limitados a un solo gigante de IA; podemos tomar al mejor maestro disponible, sin importar quién lo haya construido, y enseñar a cualquier modelo pequeño que necesitemos desplegar a ser igual de bueno.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.