← Nieuwste papers
🤖 AI

LESA: Learnable Stage-Aware Predictors for Diffusion Model Acceleration

Deze paper introduceert LESA, een trainbaar framework met stage-bewuste voorspellers op basis van Kolmogorov-Arnold-netwerken dat de inferentie van Diffusion Transformers aanzienlijk versnelt zonder in te leveren op de generatiekwaliteit.

Oorspronkelijke auteurs: Peiliang Cai, Jiacheng Liu, Haowen Xu, Xinyu Wang, Chang Zou, Linfeng Zhang

Gepubliceerd 2026-03-17
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Peiliang Cai, Jiacheng Liu, Haowen Xu, Xinyu Wang, Chang Zou, Linfeng Zhang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een kunstenaar bent die een prachtig schilderij maakt, maar in plaats van elke penseelstreek zelf te doen, gebruik je een magische machine die het werk voor je doet. Deze machine heet een Diffusiemodel. Het werkt stap voor stap: het begint met een potje modder (ruis) en maakt er langzaam een helder beeld van.

Het probleem? Deze machine is traag. Om één mooi plaatje te maken, moet hij honderden kleine stappen zetten. Het is alsof je een hele berg moet beklimpen, maar je moet elke stap heel langzaam en voorzichtig zetten.

De onderzoekers van dit paper (LESA) hebben een slimme oplossing bedacht om deze klim te versnellen, zonder dat het schilderij er minder mooi uitziet. Hier is hoe ze het doen, vertaald naar alledaags taal:

1. Het Probleem: De "Vaste Voorspelling" werkt niet

Vroeger probeerden mensen de machine te versnellen door te zeggen: "Hé, de stap die we net hebben gedaan, lijkt wel erg op de volgende stap. Laten we die volgende stap gewoon kopiëren!" of "Laten we een rechte lijn trekken en voorspellen waar we over 5 stappen zijn."

Dit werkt soms, maar het heeft een groot nadeel. Het leven (en het maken van een schilderij) is niet altijd een rechte lijn.

  • Aan het begin (wanneer het nog modderig is) verandert er heel veel, heel snel. Het is een chaos.
  • In het midden gaat het rustiger, het is een gladde weg.
  • Aan het einde (wanneer het beeld bijna klaar is) moet je heel voorzichtig zijn met de kleine details, zoals de ogen van een kat of de glans op een appel.

Als je voor alle fases dezelfde voorspelling gebruikt (bijvoorbeeld "kopiëren" of "rechte lijn"), mis je de nuances. Je krijgt dan een schilderij dat wazig is of rare vlekken heeft.

2. De Oplossing: LESA (De Slimme Gids)

LESA is als een slimme gids die weet dat je verschillende strategieën nodig hebt voor verschillende delen van de berg.

In plaats van één vaste regel, heeft LESA drie gespecialiseerde experts in huis:

  1. De Chaos-expert: Voor het begin, waar het nog heel onrustig is. Deze expert weet dat er grote sprongen nodig zijn en dat de veranderingen wild zijn.
  2. De Rust-expert: Voor het midden, waar het rustig gaat. Deze expert weet dat de veranderingen soepel en voorspelbaar zijn.
  3. De Detail-expert: Voor het einde, waar de fijne details worden toegevoegd. Deze expert is superzorgvuldig en kijkt precies naar wat er nodig is om het plaatje perfect te maken.

3. De Magische Tool: KAN (De Chameleons)

Hoe leren deze experts zo goed te zijn? Ze gebruiken een nieuw type hersenen voor computers, genaamd KAN (Kolmogorov-Arnold Netwerk).

Stel je een gewone computer (MLP) voor als een stempel: hij kan alleen vormen stempelen die hij al kent. Als de vorm verandert, past hij zich niet goed aan.
Een KAN is meer als een chameleon. Hij kan zijn vorm en gedrag volledig aanpassen aan wat hij ziet. Hij leert de exacte manier waarop de "ruis" verandert in een helder beeld, precies op het moment dat het nodig is. Hij is niet star; hij is flexibel en leert van de data.

4. De Twee-Fase Training (Leren en Oefenen)

Om deze experts zo goed mogelijk te maken, trainen ze ze in twee fases:

  • Fase 1 (De Theorieles): Ze laten de experts kijken naar het perfecte schilderij (de "Ground Truth") en zeggen: "Kijk hoe dit eruitziet, en leer hoe je daar naartoe gaat."
  • Fase 2 (De Praktijkles): Nu laten ze de experts zelf proberen te voorspellen, maar dan met een twist. Als ze een foutje maken, gebruiken ze dat foutje als input voor de volgende stap. Dit is alsof je een fiets leert rijden: eerst op een vlakke weg, en dan op een weg met hobbels, zodat je leert hoe je je evenwicht houdt als je een beetje schuurt. Dit zorgt ervoor dat ze niet snel "uit balans" raken als ze echt snel moeten werken.

Het Resultaat: Snel en Mooi

Dankzij deze methode kan de machine nu 6 keer sneller werken!

  • Bij FLUX (een populaire beeldgenerator) is het 5 keer sneller, met bijna geen kwaliteitsverlies.
  • Bij Qwen-Image is het 6,25 keer sneller, en het resultaat is zelfs beter dan de vorige beste methoden.
  • Bij HunyuanVideo (voor video's) werkt het ook fantastisch, met veel scherper beeld en minder ruis.

Kort samengevat:
LESA is als het hebben van een team van drie gespecialiseerde schilders in plaats van één algemene schilder. De één is goed voor de ruwe schets, de ander voor de basisverf, en de derde voor de fijne details. Door de juiste expert op het juiste moment in te schakelen, en door ze te leren met een slimme "chameleon-methode", kunnen ze het schilderij in een flits maken, zonder dat het er minder mooi uitziet.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →