← Nieuwste papers
💻 computer science

DiffSparse: Accelerating Diffusion Transformers with Learned Token Sparsity

DiffSparse is een nieuwe methode die de inferentie van Diffusion Transformers versnelt door een leerbaar, differentieerbaar raamwerk voor laagsgewijze token-sparsiteit te gebruiken, waardoor de rekentijd aanzienlijk wordt verminderd zonder in te leveren op de generatiekwaliteit.

Oorspronkelijke auteurs: Haowei Zhu, Ji Liu, Ziqiong Liu, Dong Li, Junhai Yong, Bin Wang, Emad Barsoum

Gepubliceerd 2026-04-07
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Haowei Zhu, Ji Liu, Ziqiong Liu, Dong Li, Junhai Yong, Bin Wang, Emad Barsoum

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

DiffSparse: De Slimme Chef die de Kooktijd Versnelt

Stel je voor dat het maken van een prachtige foto met kunstmatige intelligentie (AI) net zo is als het koken van een ingewikkeld gerecht in een groot restaurant. De AI (een "Diffusion Transformer") moet stap voor stap een beeld "ontwikkelen", net zoals een chef die eerst grof gemalen ingrediënten heeft en die stap voor verfijnt tot een perfect gerecht.

Het probleem? Deze AI moet vaak 20 tot 50 keer dezelfde berekening doen om één foto te maken. Dat is alsof de chef 50 keer hetzelfde gerecht moet proberen voordat hij zeker weet dat het goed is. Dit kost enorm veel tijd en energie (rekenkracht).

Vroeger probeerden andere methoden dit te versnellen door te zeggen: "Oké, we slaan de resultaten van stap 3 op en gebruiken die gewoon weer in stap 4, 5 en 6." Dit heet caching (opslaan). Maar de oude methoden hadden twee grote nadelen:

  1. Ze deden dit op een stijve manier: ze moesten handmatig worden ingesteld (alsof je een recept opschrijft dat nooit verandert).
  2. Ze moesten soms toch volledig koken in bepaalde stappen om de kwaliteit te behouden, waardoor ze niet echt snel werden.

DiffSparse is de nieuwe, slimme oplossing van de onderzoekers. Hier is hoe het werkt, vertaald naar alledaagse taal:

1. De Slimme Chef die Bespaart (Token Sparsity)

In plaats van dat de AI elk detail van het beeld opnieuw berekent, kijkt DiffSparse naar de "stukjes" van het beeld (de tokens).

  • De Analogie: Stel je voor dat je een schilderij maakt. Sommige stukjes (zoals de lucht of een egaal grasveld) veranderen nauwelijks van de ene naar de andere stap. Andere stukjes (zoals de ogen van een persoon) veranderen heel snel en zijn cruciaal.
  • De Oplossing: DiffSparse leert automatisch welke stukjes "saai" genoeg zijn om te hergebruiken (uit de koelkast te halen) en welke stukjes nieuw moeten worden berekend. Het doet dit niet op een vast patroon, maar leert continu wat het beste werkt.

2. De Dynamische Menukaart (Dynamic Programming)

Hoe weet de AI precies wanneer en waar hij moet besparen?

  • De Analogie: Stel je voor dat je een reis plant. Je wilt zo snel mogelijk van A naar B, maar je wilt ook niet te veel geld uitgeven. Je gebruikt een slimme app (een Dynamic Programming Solver) die alle mogelijke routes doorrekent.
  • De Oplossing: De app berekent: "Als we in stap 5 de lucht hergebruiken en in stap 10 de ogen opnieuw tekenen, besparen we 50% tijd zonder dat het resultaat er slechter uitziet." Het vindt de perfecte balans tussen snelheid en kwaliteit.

3. De Twee-Fase Training (Two-Stage Training)

Oude methoden leerden vaak door eerst alles perfect te doen en dan pas te versnellen. DiffSparse is slimmer.

  • De Analogie: Een student die eerst een examen maakt met een open boek (om de theorie te begrijpen) en daarna een examen doet zonder boek, maar dan wel met de slimme tips die hij heeft geleerd.
  • De Oplossing: Het systeem leert eerst waar de "veilige plekken" zijn (waar je kunt besparen) en past dit dan direct toe. Hierdoor hoeft het systeem niet meer die dure, volledige berekeningen te doen die andere methoden nodig hadden.

Wat is het resultaat?

De onderzoekers hebben dit getest op verschillende krachtige AI-modellen (zoals PixArt-α en FLUX).

  • Snelheid: Ze konden de rekenkosten met 54% verlagen. Dat betekent dat de foto's bijna twee keer zo snel worden gemaakt.
  • Kwaliteit: Het verrassende is dat de foto's vaak beter zijn dan de originele, langzame versie! Omdat de AI zich concentreert op de belangrijke details en niet tijd verspillen aan saaiere stukjes, wordt het eindresultaat scherper.

Kort samengevat:
DiffSparse is als een super-efficiënte chef die precies weet welke ingrediënten hij al klaar heeft staan en welke hij pas op het laatste moment moet snijden. Hierdoor wordt het diner (de AI-foto) niet alleen veel sneller geserveerd, maar smaakt het ook nog eens lekkerder dan voorheen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →