← Nieuwste papers
🤖 AI

NanoFLUX: Distillation-Driven Compression of Large Text-to-Image Generation Models for Mobile Devices

NanoFLUX is een tekst-naar-beeldmodel met 2,4 miljard parameters dat is gedestilleerd uit de 17 miljard parameters tellende FLUX.1-Schnell via een progressieve compressiepipeline bestaande uit transformer-pruning, ResNet-gebaseerde token-downsampling en visueel-signaalgestuurde tekstencoder-distillatie, wat hoogwaardige beeldgeneratie op mobiele apparaten mogelijk maakt in ongeveer 2,5 seconden.

Oorspronkelijke auteurs: Ruchika Chavhan, Malcolm Chadwick, Alberto Gil Couto Pimentel Ramos, Luca Morreale, Mehdi Noroozi, Abhinav Mehrotra

Gepubliceerd 2026-02-09
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Ruchika Chavhan, Malcolm Chadwick, Alberto Gil Couto Pimentel Ramos, Luca Morreale, Mehdi Noroozi, Abhinav Mehrotra

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een meesterkok hebt, FLUX.1-Schnell, die de meest heerlijke, complexe en visueel verbluffende maaltijden (afbeeldingen) kan bereiden die je je kunt voorstellen. Deze chef is een genie, maar hij is ook enorm: hij weegt 17 miljard "eenheden" (parameters) en vereist een enorme, industriële keuken (krachtige cloudservers) om te kunnen werken. Je kunt deze chef niet mee naar huis nemen naar je kleine appartement (een mobiele telefoon) omdat de keuken te groot is, de elektriciteitsrekening te hoog is en de chef te langzaam beweegt voor een snelle avondmaaltijd.

NanoFLUX is de oplossing. Het is alsof je een piepkleine, superefficiënte leerling-kok creëert die bijna exact dezelfde heerlijke maaltijden kan bereiden als de meester, maar die in je broekzak past en binnen enkele seconden kookt.

Hier is hoe het paper uitlegt hoe ze deze kleine chef hebben gebouwd, met behulp van drie trucjes:

1. De "Opruimactie" (Redundante onderdelen wegknippen)

De meesterkok heeft een brein met 12 miljard "neuronen" (de Diffusion Transformer). De onderzoekers realiseerden zich dat veel van deze neuronen simpelweg hetzelfde werk herhaalden of eigenlijk niets deden.

  • De Analogie: Stel je een bibliotheek voor met 12 miljoen boeken, maar 10 miljoen daarvan zijn slechts fotokopieën van dezelfde drie pagina's.
  • De Oplossing: Ze gebruikten een slimme scanner om de dubbele boeken op te sporen en weg te gooien. Ze realiseerden zich ook dat sommige "chefs" (attention heads) precies hetzelfde werk deden, dus ontsloegen ze de overbodigen. Ze voegden andere chefs die vergelijkbare taken uitvoerden samen tot één superchef.
  • Het Resultaat: Ze krompen het brein van 12 miljard eenheden naar slechts 2 miljard eenheden, zonder het vermogen te verliezen om een geweldige maaltijd te bereiden.

2. De "Uitzoomen, Inzoomen" Strategie (Token Downsampling)

Wanneer de chef naar een afbeelding kijkt om deze te recreëren, kijkt hij meestal de hele tijd naar elke afzonderlijke pixel (of "token") op volledige resolutie. Dit is traag en uitputtend.

  • De Analogie: Stel je voor dat je een landschap aan het schilderen bent. In het begin hoef je niet elk afzonderlijk blaadje aan een boom te zien; je moet alleen de algemene vorm van het bos en de bergen zien. Je moet pas inzoomen en de blaadjes schilderen wanneer je de fijne details toevoegt.
  • De Oplossing: NanoFLUX gebruikt een speciale "ResNet"-lens. In de vroege stadia van het creëren van de afbeelding kijkt het van een afstandje naar de afbeelding (lage resolutie), wat zeer snel gaat. Pas wanneer het tijd is om de fijne details toe te voegen, schakelt het over naar de hoge-resolutie, close-up weergave.
  • Het Resultaat: De chef besteedt minder tijd aan het staren naar de hele afbeelding en meer tijd aan het focussen op wat belangrijk is, waardoor het proces veel sneller gaat.

3. De "Slimme Assistent" (Text Encoder Distillation)

De meesterkok heeft ook een enorme encyclopedie (een tekstencoder van 5 miljard eenheden) om jouw instructies te begrijpen. Als je zegt "een kat met een hoed op", moet de encyclopedie precies weten wat dat betekent.

  • De Analogie: De meesterkok heeft een woordenboek van 5 miljard pagina's. De leerling heeft slechts een woordenboek van 330 miljoen pagina's nodig.
  • De Oplossing: In plaats van de leerling gewoon een kleiner woordenboek te geven, hebben ze de leerling geleerd hoe hij de aantekeningen van de meester moet lezen. Ze lieten de leerling de visuele aanwijzingen zien die de meesterkok zag terwijl hij de instructies las. Op deze manier leert het kleine woordenboek de "vibe" en de betekenis van de woorden net zo goed te begrijpen als het reusachtige woordenboek, zonder al die extra pagina's nodig te hebben.
  • Het Resultaat: Het tekstbegrip van het model kromp van 5 miljard eenheden naar 330 miljoen eenheden, maar het begrijpt je prompts nog steeds perfect.

De Einduitkomst

Door deze drie trucs te combineren, hebben de onderzoekers NanoFLUX gecreëerd.

  • Grootte: Het ging van een massief model van 17 miljard parameters naar een piepklein model van 2,4 miljard parameters (ongeveer 7 keer kleiner).
  • Snelheid: Op een mobiele telefoon kan het een afbeelding van hoge kwaliteit (512x512 pixels) genereren in ongeveer 2,5 seconden.
  • Kwaliteit: Het paper beweert dat de afbeeldingen er bijna identiek uitzien aan de afbeeldingen gemaakt door de gigantische, dure cloudversie.

Kortom, ze hebben het model niet alleen kleiner gemaakt; ze hebben het slimmer gemaakt in de manier waarop het werkt, waarmee ze bewijzen dat je geen supercomputer meer nodig hebt om prachtige AI-kunst te genereren.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →