← Últimos artículos
🤖 AI

NanoFLUX: Distillation-Driven Compression of Large Text-to-Image Generation Models for Mobile Devices

NanoFLUX es un modelo de texto a imagen de 2.4B de parámetros destilado del FLUX.1-Schnell de 17B a través de un pipeline de compresión progresiva que presenta poda de transformadores, submuestreo de tokens basado en ResNet y destilación de codificador de texto guiada por señales visuales, permitiendo la generación de imágenes de alta calidad en dispositivos móviles en aproximadamente 2.5 segundos.

Autores originales: Ruchika Chavhan, Malcolm Chadwick, Alberto Gil Couto Pimentel Ramos, Luca Morreale, Mehdi Noroozi, Abhinav Mehrotra

Publicado 2026-02-09
📖 4 min de lectura☕ Lectura para el café

Autores originales: Ruchika Chavhan, Malcolm Chadwick, Alberto Gil Couto Pimentel Ramos, Luca Morreale, Mehdi Noroozi, Abhinav Mehrotra

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes a un maestro chef, FLUX.1-Schnell, que puede cocinar las comidas más deliciosas, complejas y visualmente deslumbrantes (imágenes) imaginables. Este chef es un genio, pero también es enorme: pesa 17 mil millones de "unidades" (parámetros) y requiere una cocina de tamaño industrial (servidores potentes en la nube) para operar. No puedes llevarte este chef a casa en tu pequeño apartamento (un teléfono móvil) porque la cocina es demasiado grande, la factura de la luz es demasiado alta y el chef se mueve demasiado lento para una cena rápida.

NanoFLUX es la solución. Es como crear un aprendiz de chef diminuto y súper eficiente que puede cocinar casi exactamente las mismas comidas deliciosas que el maestro, pero que cabe en tu bolsillo y cocina en segundos.

Aquí es donde la investigación explica cómo construyeron este pequeño chef, utilizando tres trucos:

1. La "Limpieza de Desorden" (Poda de partes redundantes)

El maestro chef tiene un cerebro con 12 mil millones de "neuronas" (el Transformer de Difusión). Los investigadores se dieron cuenta de que muchas de estas neuronas solo estaban repitiendo el mismo trabajo o no estaban haciendo mucho en absoluto.

  • La Analogía: Imagina una biblioteca con 12 millones de libros, pero 10 millones de ellos son solo fotocopias de las mismas tres páginas.
  • La Solución: Utilizaron un escáner inteligente para encontrar y desechar los libros duplicados. También se dieron cuenta de que algunos "chefs" (cabezales de atención) estaban haciendo exactamente el mismo trabajo, así que despidieron a los excedentes. Fusionaron otros chefs que realizaban tareas similares en un solo superchef.
  • El Resultado: Redujeron el cerebro de 12 mil millones de unidades a solo 2 mil millones, sin perder la capacidad de cocinar una gran comida.

2. La Estrategia de "Alejarse, Acercarse" (Submuestreo de Tokens)

Cuando el chef mira una imagen para recrearla, normalmente mira cada uno de los píxeles (o "tokens") a resolución completa todo el tiempo. Esto es lento y agotador.

  • La Analogía: Imagina que estás pintando un paisaje. Al principio, no necesitas ver cada hoja de un árbol; solo necesitas ver la forma general del bosque y las montañas. Solo necesitas hacer zoom y pintar las hojas cuando vas a añadir los detalles finales.
  • La Solución: NanoFLUX utiliza una lente especial "ResNet". En las etapas iniciales de la creación de la imagen, mira la foto desde lejos (baja resolución), lo cual es muy rápido. Solo cambia a la vista de alta resolución y primer plano cuando llega el momento de añadir los detalles finos.
  • El Resultado: El chef pasa menos tiempo mirando toda la imagen y más tiempo concentráéndose en lo que importa, lo que hace que el proceso sea mucho más rápido.

3. El "Asistente Inteligente" (Destilación del Codificador de Texto)

El maestro chef también tiene una enciclopedia masiva (un codificador de texto de 5 mil millones de unidades) para entender tus instrucciones. Si dices "un gato con un sombrero", la enciclopedia necesita saber exactamente qué significa eso.

  • La Analogía: El maestro chef tiene un diccionario de 5 mil millones de páginas. El aprendiz solo necesita un diccionario de 330 millones de páginas.
  • La Solución: En lugar de simplemente darle al aprendiz un diccionario más pequeño, le enseñaron cómo leer las notas del maestro. Le mostraron al aprendiz las pistas visuales que el maestro chef veía mientras leía las instrucciones. De esta manera, el pequeño diccionario aprende a entender el "vibrato" y el significado de las palabras tan bien como el gigante, sin necesidad de todas las páginas extra.
  • El Resultado: La parte de comprensión de texto del modelo se encogió de 5 mil millones de unidades a 330 millones, pero sigue entendiendo tus instrucciones perfectamente.

El Resultado Final

Al combinar estos tres trucos, los investigadores crearon NanoFLUX.

  • Tamaño: Pasó de un modelo masivo de 17 mil millones de parámetros a uno diminuto de 2.4 mil millones de parámetros (unas 7 veces más pequeño).
  • Velocidad: En un teléfono móvil, puede generar una imagen de alta calidad (512x512 píxeles) en unos 2.5 segundos.
  • Calidad: El artículo afirma que las imágenes se ven casi idénticas a las creadas por la versión gigante y costosa de la nube.

En resumen, no solo hicieron el modelo más pequeño; lo hicieron más inteligente sobre cómo funciona, demostiendo que ya no necesitas una supercomputadora para generar arte de IA hermoso.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →