← Nieuwste papers
🤖 AI

Kaleido: Algorithm-Hardware Co-Design for Video Diffusion Transformers by Exploiting Latent Space Correlations

Kaleido is een algoritme-hardware co-design dat Video Diffusion Transformers versnelt door kanaal-gewijze spatio-temporele correlaties in de latente ruimte te exploiteren om een lichtgewicht hergebruikalgoritme en een herconfigureerbare systolische array-accelerator mogelijk te maken, waarbij tot 5,9x versnelling en 16,0x energiebesparing wordt bereikt terwijl de hoge generatieve kwaliteit behouden blijft.

Oorspronkelijke auteurs: Wenxuan Miao, Haosong Liu, Weiming Hu, Zihan Liu, Aiyue Chen, Jianlin Yu, Yiwu Yao, Yiming Gan, Jieru Zhao, Jingwen Leng, Minyi Guo, Yu Feng

Gepubliceerd 2026-07-16
📖 3 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Wenxuan Miao, Haosong Liu, Weiming Hu, Zihan Liu, Aiyue Chen, Jianlin Yu, Yiwu Yao, Yiming Gan, Jieru Zhao, Jingwen Leng, Minyi Guo, Yu Feng

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een wereld voor waarin computers hele films kunnen dromen uit een enkele zin, waarbij ze scènes creëren die zo echt zijn dat je ze bijna kunt aanraken. Deze magie wordt aangedreven door "video diffusiemodellen", een type kunstmatige intelligentie dat leert om video's te maken door te beginnen met een scherm vol statische ruis en dit stap voor stap langzaam op te schonen totdat er een helder beeld verschijnt. Denk aan een beeldhouwer die begint met een ruw blok steen en het overtollige wegbeitelt om een standbeeld te onthullen. Echter, dit proces is ongelooflijk traag en hongerig naar energie. De computer moet voor elk enkel frame miljoenen kleine berekeningen uitvoeren, keer op keer, zoals een chef die een soep honderden keren proeft voordat hij deze serveert. Naarmate deze AI-modellen beter worden in het maken van langere, kwalitatief hoogwaardigere video's, zijn de tijd en energie die nodig zijn om ze te draaien een enorme flessenhals geworden, wat alles van filmbewerking tot het creëren van virtuele werelden vertraagt. Wetenschappers en ingenieurs racen om manieren te vinden om dit te versnellen zonder de kwaliteit van de uiteindelijke film te ruïneren.

Maak kennis met Kaleido, een slimme nieuwe uitvinding van onderzoekers van de Shanghai Jiao Tong Universiteit en Huawei, die fungeert als een superintelligente afkorting voor deze video-makende computers. Het team ontdekte dat terwijl de AI bezig is met het "schoonmaken" van de video, deze vaak dezelfde berekeningen herhaaldelijk uitvoert omdat de videoframes op specifieke manieren zo sterk op elkaar lijken. In plaats van alles telkens opnieuw te berekenen, werkt het algoritme van Kaleido als een briljante bibliothecaris die zich herinnert: "Hé, dit deel heb ik voor het vorige frame al gedaan, dus laten we dat antwoord gewoon hergebruiken!" Maar er is een addertje onder het gras: deze afkortingen creëren een rommelig, onregelmatig werkpatroon waar standaard computerchips een hekel aan hebben, vergelijkbaar met een chef die probeert groenten te snijden met een bot mes dat steeds uitschiet. Om dit op te lossen, schreven de onderzoekers niet alleen een nieuw recept; ze bouwden een gloednieuwe keuken. Ze ontwierpen een aangepaste hardwarechip met een speciale "data dispatcher" die de rommelige afkortingen organiseert in nette, efficiënte batches, waardoor de computer redundante taken kan overslaan zonder ook maar één druppel kwaliteit te verliezen.

Het resultaat is een systeem dat aanzienlijk sneller en energiezuiniger is dan alles wat momenteel beschikbaar is. In hun tests maakte Kaleido video-generatie tot wel 5,9 keer sneller en bespaarde het 16,0 keer meer energie vergeleken met de beste bestaande versnellers en high-end grafische kaarten. Misschien wel het meest indrukwekkend is dat de video's die het produceerde niet alleen snel waren, maar ook scherper en nauwkeuriger dan die gemaakt door andere methode-afkortingen, waarbij het meer dan 17 dB hoger scoorde op beeldkwaliteitsmetrieken. De onderzoekers bewezen dat door precies te begrijpen hoe de videodata gestructureerd is — specifiek hoe verschillende delen van het beeld zich verhouden tot tijd en ruimte — ze een systeem konden bouwen dat de saaie delen van het werk overslaat terwijl het de creatieve delen perfect houdt. Dit is niet zomaar een kleine aanpassing; het is een fundamentele verandering in hoe we computers vertellen om films te maken, wat bewijst dat de beste manier om sneller te gaan soms is weten wat je precies niet hoeft te doen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →