Poly-OPD: Heterogeneous Multi-Teacher On-Policy Distillation for Capability-Selectable Flow Models
Poly-OPD es un marco de destilación on-policy de múltiples profesores heterogéneos que consolida las fortalezas complementarias de modelos de texto a imagen incompatibles en un único estudiante de concordancia de flujo compacto mediante el puente de los espacios latentes vía la recodificación a nivel de píxel y la supervisión de DINOv2, mientras emplea adaptadores compatibles con gradientes y un currículo consciente de las brechas para lograr un rendimiento superior tanto en el seguimiento de instrucciones compositivas como en la alineación estética.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina un mundo donde el arte es creado por máquinas que aprenden mediante el ensayo y error, un campo conocido como generación de texto a imagen. En este estudio de arte digital, los "maestros" son modelos masivos y complejos que convierten palabras en imágenes. Pero aquí está el truco: al igual que los expertos humanos, estas máquinas tienen diferentes especialidades. Algunos son maestros pintores que crean escenas impresionantes y bellas, muy realistas, pero podrían pasar por alto pequeños detalles como "tres gatos" o "una pelota roja a la izquierda". Otros son contadores estrictos que siguen las instrucciones perfectamente, pero podrían producir imágenes que se ven un poco planas o extrañas. El gran problema es que estos expertos hablan diferentes "lenguajes" internamente; utilizan diferentes planos y matemáticas para construir sus imágenes, por lo que no puedes simplemente pedirles que intercambien notas o combinen sus cerebros fácilmente. Si quieres una imagen que sea tanto hermosa como perfectamente precisa, normalmente tienes que ejecutar dos computadoras gigantes y costosas al mismo tiempo, lo cual es lento y un desperdicio. Los científicos han estado tratando de descubrir cómo fusionar a estos diferentes expertos en un solo modelo más pequeño y más inteligente que pueda hacer ambos trabajos sin confundirse.
Este artículo presenta un nuevo y astuto método llamado Poly-OPD que actúa como un maestro traductor y entrenador, fusionando con éxito a dos maestros de IA muy diferentes en un único modelo estudiante, compacto. Los investigadores tomaron a un maestro "bello" (FLUX.1-dev) y a un maestro "preciso" (Z-Image) y le enseñaron a un modelo estudiante más pequeño (una versión de 2.5 mil millones de parámetros de SD3.5) a ser ambos. El truco de magia es que, en lugar de obligar al estudiante a copiar los pensamientos internos de los maestros (que están en lenguajes incompatibles), el sistema permite que el estudiante haga un dibujo, convierte ese dibujo en un lenguaje de "píxeles" común que todos entienden, y luego le pide al maestro que lo corrija. El maestro no solo dice "buen trabajo"; de hecho, vuelve a dibujar la imagen para corregir errores, y el estudiante aprende de esa corrección. Para asegurar que el estudiante no se confunda al intentar aprender dos estilos diferentes a la vez, el sistema utiliza partes "conmutables" en su cerebro. Comparte las partes que manejan la atención general (como observar la escena completa) pero mantiene partes separadas para tareas específicas (como contar o colorear). Además, el sistema es inteligente sobre qué practicar: nota qué habilidades aún le faltan al estudiante y dedica más tiempo a entrenar en esas, en lugar de perder el tiempo en cosas que el estudiante ya sabe.
Los resultados son bastante impresionantes. Al usar este método, el pequeño modelo estudiante no solo aprendió a ser promedio; de hecho, se volvió mejor que ambos de sus gigantes maestros en tareas específicas. En una prueba llamada GenEval, que verifica si un modelo sigue instrucciones complejas como "un gato a la derecha de una raqueta de tenis", la puntuación del estudiante saltó de 67.3 a 73.3, superando tanto al maestro de 12 mil millones de parámetros como al maestro de 6 mil millones de parámetros. En una prueba de belleza visual y preferencia humana (HPSv3), la puntuación aumentó de 9.34 a 11.35. El artículo sugiere que este éxito proviene del enfoque "on-policy", donde el estudiante aprende de sus propios errores corregidos por el maestro, en lugar de solo memorizar los dibujos perfectos del maestro. Los investigadores descubrieron que si intentaban forzar al estudiante a aprender de los datos internos del maestro directamente, fallaba porque los "lenguajes" no coincidían. También descubrieron que si no usaban las partes conmutables especiales, las habilidades chocarían y el modelo empeoraría. En última instancia, Poly-OPD muestra que puedes construir un modelo único, pequeño y conmutable que puede alternar entre ser un artista hermoso y un arquitecto preciso, combinando lo mejor de ambos mundos sin necesidad de ejecutar dos computadoras masivas.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.