← Derniers articles
🤖 AI

NanoFLUX: Distillation-Driven Compression of Large Text-to-Image Generation Models for Mobile Devices

NanoFLUX est un modèle de texte-en-image de 2,4 milliards de paramètres distillé à partir du modèle FLUX.1-Schnell de 17 milliards de paramètres via un pipeline de compression progressive comprenant l'élagage de transformateurs, le sous-échantillonnage de jetons basé sur ResNet et la distillation de l'encodeur de texte guidée par le signal visuel, permettant une génération d'images de haute qualité sur des appareils mobiles en environ 2,5 secondes.

Auteurs originaux : Ruchika Chavhan, Malcolm Chadwick, Alberto Gil Couto Pimentel Ramos, Luca Morreale, Mehdi Noroozi, Abhinav Mehrotra

Publié 2026-02-09
📖 4 min de lecture☕ Lecture pause café

Auteurs originaux : Ruchika Chavhan, Malcolm Chadwick, Alberto Gil Couto Pimentel Ramos, Luca Morreale, Mehdi Noroozi, Abhinav Mehrotra

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous avez un chef maître, FLUX.1-Schnell, capable de cuisiner les plats les plus délicieux, complexes et visuellement époustouflants (images) imaginables. Ce chef est un génie, mais il est aussi énorme : il pèse 17 milliards d'« unités » (paramètres) et nécessite une cuisine de taille industrielle (puissants serveurs cloud) pour fonctionner. Vous ne pouvez pas emmener ce chef chez vous dans votre petit appartement (un téléphone portable) car la cuisine est trop grande, la facture d'électricité est trop élevée et le chef est trop lent pour un dîner rapide.

NanoFLUX est la solution. C'est comme créer un petit apprenti chef, super efficace, capable de cuisiner presque exactement les mêmes plats délicieux que le maître, mais qui tient dans votre poche et cuisine en quelques secondes.

Voici comment le document explique comment ils ont construit ce petit chef, en utilisant trois astuces :

1. Le « Nettoyage du Désordre » (Élagage des parties redondantes)

Le maître chef possède un cerveau avec 12 milliards de « neurones » (le Transformer de Diffusion). Les chercheurs se sont rendu compte que beaucoup de ces neurones répétaient le même travail ou ne faisaient pas grand-chose du tout.

  • L'analogie : Imaginez une bibliothèque avec 12 millions de livres, mais 10 millions d'entre eux ne sont que des photocopies des trois mêmes pages.
  • La solution : Ils ont utilisé un scanner intelligent pour trouver et jeter les livres en double. Ils ont également réalisé que certains « chefs » (têtes d'attention) faisaient exactement le même travail, alors ils ont licencié les suppléants. Ils ont fusionné d'autres chefs qui accomplissaient des tâches similaires en un seul super-chef.
  • Le résultat : Ils ont réduit le cerveau de 12 milliards d'unités à seulement 2 milliards, sans perdre la capacité de cuisiner un excellent repas.

2. La stratégie « Dézoomer, Zoomer » (Sous-échantillonnage de tokens)

Lorsque le chef regarde une image pour la recréer, il regarde généralement chaque pixel (ou « token ») à pleine résolution tout au long du processus. Cela est lent et épuisant.

  • L'analogie : Imaginez que vous peignez un paysage. Au tout début, vous n'avez pas besoin de voir chaque feuille d'un arbre ; vous avez juste besoin de voir la forme générale de la forêt et des montagnes. Vous n'avez besoin de zoomer et de peindre les feuilles que lorsque vous ajoutez les détails finaux.
  • La solution : NanoFLUX utilise une lentille « ResNet » spéciale. Dans les premières étapes de la création de l'image, il regarde l'image de loin (basse résolution), ce qui est très rapide. Il ne passe à la vue rapprochée, haute résolution, que lorsqu'il est temps d'ajouter les détails fins.
  • Le résultat : Le chef passe moins de temps à fixer l'ensemble de l'image et plus de temps à se concentrer sur ce qui compte, ce qui rend le processus beaucoup plus rapide.

3. L'« Assistant Intelligent » (Distillation de l'encodeur de texte)

Le maître chef possède également une encyclopédie massive (un encodeur de texte de 5 milliards d'unités) pour comprendre vos instructions. Si vous dites « un chat portant un chapeau », l'encyclopédie doit savoir exactement ce que cela signifie.

  • L'analogie : Le maître chef possède un dictionnaire de 5 milliards de pages. L'apprenti n'a besoin que d'un dictionnaire de 330 millions de pages.
  • La solution : Au lieu de simplement donner à l'apprenti un dictionnaire plus petit, ils lui ont appris à lire les notes du maître. Ils lui ont montré les indices visuels que le maître chef voyait en lisant les instructions. De cette façon, le petit dictionnaire apprend à comprendre l'« ambiance » et le sens des mots aussi bien que le géant, sans avoir besoin de toutes les pages supplémentaires.
  • Le résultat : La partie compréhension du texte du modèle est passée de 5 milliards d'unités à 330 millions, mais elle comprend toujours parfaitement vos requêtes.

Le Résultat Final

En combinant ces trois astuces, les chercheurs ont créé NanoFLUX.

  • Taille : Il est passé d'un modèle massif de 17 milliards de paramètres à un minuscule modèle de 2,4 milliards de paramètres (environ 7 fois plus petit).
  • Vitesse : Sur un téléphone portable, il peut générer une image de haute qualité (512x512 pixels) en environ 2,5 secondes.
  • Qualité : Le document affirme que les images sont presque identiques à celles produites par la version géante et coûteuse sur le cloud.

En résumé, ils n'ont pas seulement rendu le modèle plus petit ; ils l'ont rendu plus intelligent dans sa manière de fonctionner, prouvant qu'on n'a plus besoin d'un supercalculateur pour générer de magnifiques œuvres d'art par IA.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →