← Ultimi articoli
🤖 AI

Kaleido: Algorithm-Hardware Co-Design for Video Diffusion Transformers by Exploiting Latent Space Correlations

Kaleido è un co-design algoritmo-hardware che accelera i Video Diffusion Transformer sfruttando le correlazioni spazio-temporali per canale nello spazio latente per abilitare un algoritmo di riutilizzo leggero e un acceleratore a matrice sistolica riconfigurabile, ottenendo fino a 5,9x di velocità in più e 16,0x di risparmio energetico pur mantenendo un'alta qualità generativa.

Autori originali: Wenxuan Miao, Haosong Liu, Weiming Hu, Zihan Liu, Aiyue Chen, Jianlin Yu, Yiwu Yao, Yiming Gan, Jieru Zhao, Jingwen Leng, Minyi Guo, Yu Feng

Pubblicato 2026-07-16
📖 3 min di lettura☕ Lettura da pausa caffè

Autori originali: Wenxuan Miao, Haosong Liu, Weiming Hu, Zihan Liu, Aiyue Chen, Jianlin Yu, Yiwu Yao, Yiming Gan, Jieru Zhao, Jingwen Leng, Minyi Guo, Yu Feng

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immaginate un mondo in cui i computer possono sognare interi film da una singola frase, creando scene così reali che si potrebbe quasi toccarle. Questa magia è alimentata dai "modelli di diffusione video", un tipo di intelligenza artificiale che impara a creare video partendo da uno schermo pieno di rumore statico e pulendolo lentamente, passo dopo passo, finché non emerge un'immagine nitida. Pensatelo come uno scultore che parte da un blocco di pietra grezza e scolpisce via l'eccesso per rivelare una statua. Tuttavia, questo processo è incredibilmente lento e vorace di energia. Il computer deve eseguire milioni di piccoli calcoli per ogni singolo fotogramma, ancora e ancora, come uno chef che assaggia una zuppa centinaia di volte prima di servirla. Man mano che questi modelli di IA diventano più bravi nel creare video più lunghi e di alta qualità, il tempo e l'energia richiesti per eseguirli sono diventati un enorme collo di bottiglia, rallentando tutto, dal montaggio cinematografico alla creazione di mondi virtuali. Scienziati e ingegneri stanno correndo per trovare modi per velocizzare questo processo senza rovinare la qualità del film finale.

Entra in scena Kaleido, un'invenzione intelligente dei ricercatori della Shanghai Jiao Tong University e di Huawei che agisce come una scorciatoia super intelligente per questi computer che creano video. Il team ha scoperto che mentre l'IA è impegnata a "pulire" il video, spesso ripete gli stessi calcoli ripetutamente perché i fotogrammi del video sono molto simili tra loro in modi specifici. Invece di ricalcolare tutto da zero, l'algoritmo di Kaleido agisce come un bibliotecario brillante che ricorda: "Ehi, ho già fatto questa parte per l'ultimo fotogramma, quindi riutilizziamo quella risposta!". Ma c'è un problema: queste scorciatoie creano un modello di lavoro disordinato e irregolare che i normali chip per computer odiano, proprio come uno chef che cerca di tagliare le verdure con un coltello smussato che continua a scivolare. Per risolvere questo, i ricercatori non si sono limitati a scrivere una nuova ricetta; hanno costruito una cucina completamente nuova. Hanno progettato un chip hardware personalizzato con un "dispatcher di dati" speciale che organizza le scorciatoie disordinate in lotti ordinati ed efficienti, permettendo al computer di saltare il lavoro ridondante senza perdere nemmeno una goccia di qualità.

Il risultato è un sistema significativamente più veloce ed efficiente dal punto di vista energetico rispetto a qualsiasi cosa attualmente disponibile. Nei loro test, Kaleido ha reso la generazione di video fino a 5,9 volte più veloce e ha risparmiato 16,0 volte più energia rispetto ai migliori acceleratori esistenti e alle schede grafiche di fascia alta. Forse la cosa più impressionante è che i video prodotti non erano solo veloci; erano più nitidi e accurati di quelli prodotti da altri metodi di scorciatoia, ottenendo oltre 17 dB in più nelle metriche di qualità dell'immagine. I ricercatori hanno dimostrato che comprendendo esattamente come i dati video sono strutturati — specificamente come le diverse parti dell'immagine si relazionano al tempo e allo spazio — potevano costruire un sistema che salta le parti noiose del lavoro mantenendo perfette le parti creative. Questo non è solo un piccolo accorgimento; è un cambiamento fondamentale nel modo in cui diciamo ai computer di fare film, dimostrando che a volte il modo migliore per andare più veloci è sapere esattamente cosa non serve fare.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →