← Ultimi articoli
🤖 machine learning

NeuroPrefetcher: Storage-Aware Sparse LLM Inference via Delta Prefetching

NeuroPrefetcher è un sistema di inferenza LLM consapevole dello storage che ottiene incrementi significativi di velocità su dispositivi edge con memoria limitata sfruttando la località temporale dell'attività dei neuroni MLP per pre-caricare predittivamente solo i delta dei pesi necessari dallo storage, invece di fare affidamento sul paging a domanda reattivo.

Autori originali: Nobel Dhar, Md Romyull Islam, Xuechen Zhang, Gongjin Sun, Sahidul Islam, Bobin Deng, Kun Suo

Pubblicato 2026-08-25
📖 6 min di lettura🧠 Approfondimento

Autori originali: Nobel Dhar, Md Romyull Islam, Xuechen Zhang, Gongjin Sun, Sahidul Islam, Bobin Deng, Kun Suo

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

I modelli linguistici di grandi dimensioni sono i motori che alimentano l'intelligenza artificiale moderna, capaci di scrivere, ragionare e tradurre con una fluidità che un tempo sembrava impossibile. Questi sistemi funzionano elaborando il testo una parola alla volta, prevedendo la parola successiva in una sequenza sulla base dei vasti schemi appresi durante l'addestramento. Per farlo, si affidano a massicce librerie digitali di numeri, chiamate pesi, che sono memorizzate nella memoria del computer. Più grande e capace è il modello, maggiore è la memoria di cui necessita. Tuttavia, è emersa una discrepanza significativa: mentre questi modelli sono cresciuti esponenzialmente in termini di dimensioni, la memoria disponibile nei dispositivi portatili come laptop, tablet e computer edge specializzati non è cresciuta allo stesso ritmo. Ciò crea un problema fondamentale per l'esecuzione di un'intelligenza avanzata al di fuori dei grandi data center. Quando un modello è troppo grande per entrare nella memoria di un dispositivo, il sistema deve scambiare costantemente dati tra la memoria veloce e l'unità di archiviazione più grande e lenta, un processo che di solito blocca le prestazioni.

Ricercatori della Kennesaw State University e di Samsung hanno sviluppato un nuovo approccio a questo problema, creando un sistema chiamato NeuroPrefetcher che consente a questi modelli sovradimensionati di funzionare efficientemente su dispositivi con memoria molto limitata. Invece di cercare di rimpicciolire il modello o di forzarlo a entrarvi, il loro sistema accetta che il modello sia più grande della memoria disponibile e tratta l'unità di archiviazione come una parte attiva del processo di calcolo. La chiave del loro successo risiede in un'osservazione semplice su come questi modelli "pensano". Quando il modello genera una parola, attiva un set specifico di percorsi interni. Quando genera la parola immediatamente successiva, utilizza quasi esattamente gli stessi percorsi. I ricercatori hanno scoperto che tra l'82 e l'85 per cento dei percorsi attivi rimane lo stesso da una parola all'altra. Ciò significa che per la stragrande maggioranza del lavoro, i dati necessari sono già presenti nella memoria del dispositivo, in attesa di essere utilizzati.

L'innovazione di NeuroPrefetcher risiede nel modo in cui gestisce la piccola quantità di dati che cambia. I sistemi tradizionali aspettano che il modello abbia bisogno di un dato prima di andare all'unità di archiviazione per recuperarlo, un processo reattivo che causa l'interruzione e l'attesa del computer. NeuroPrefetcher funziona diversamente, guardando avanti. Utilizza un piccolo predittore specializzato che analizza la parola corrente e indovina esattamente quali nuovi percorsi saranno necessari per la parola successiva. Poiché sa cosa sta per arrivare, può recuperare solo i pezzi specifici di dati mancanti dall'unità di archiviazione mentre il computer è impegnato a calcolare la parola corrente. Questo trasforma un processo caotico e a scatti in un flusso fluido e continuo. Il sistema essenzialmente pre-carica solo la minuscola frazione di nuova informazione richiesta, ignorando la massa enorme di dati che è già residente in memoria.

Per testare questa idea, il team ha costruito un sistema completo e lo ha eseguito su un potente dispositivo edge noto come Jetson AGX Orin, che possiede un'architettura di memoria unificata condivisa tra il processore e l'unità grafica. Hanno testato il sistema con modelli linguistici di grandi dimensioni come Mistral-7B e Llama-3-8B sotto rigidi limiti di memoria, simulando condizioni in cui il modello era significativamente più grande della memoria disponibile. In queste condizioni difficili, il metodo standard di esecuzione di questi modelli, che si affida al sistema operativo per gestire lo scambio di dati, ha fornito prestazioni scarse, spesso bloccando il dispositivo. Al contrario, NeuroPrefetcher ha mantenuto il dispositivo in movimento, ottenendo un'accelerazione di quasi otto o dodici volte rispetto al metodo standard. Il sistema è riuscito a generare parole a una velocità di oltre tre al secondo, mentre l'approccio standard faticava a produrne anche una al secondo.

I ricercatori hanno anche esaminato come il sistema si comportasse al variare della memoria disponibile. Hanno scoperto che il sistema può adattarsi spostando una parte maggiore del lavoro del modello verso l'unità di archiviazione quando la memoria è scarsa, e riportando una parte maggiore del lavoro nella memoria veloce quando c'è più spazio disponibile. Anche nelle condizioni di memoria più ristrette, il sistema ha mantenuto alte prestazioni perché ha evitato i massicci trasferimenti di dati che solitamente rallentano queste operazioni. Invece di spostare interi strati del "cervello" del modello avanti e indietro, ha spostato solo le piccole porzioni di dati variabili. Questo approccio si è rivelato così efficace che il sistema è rimasto l'opzione più veloce anche rispetto ad altri strumenti avanzati, molti dei quali non sono riusciti affatto a funzionare sotto questi specifici vincoli.

Una parte critica di questo lavoro è stata garantire che i guadagni di velocità non avvenissero a scapito dell'intelligenza. I ricercatori hanno misurato la qualità del testo prodotto dal sistema e hanno scoperto che rimane molto vicina alla qualità del modello completo e non compresso. Il sistema ha preservato l'accuratezza delle previsioni del modello, mantenendo oltre il 90 per cento delle prestazioni originali anche utilizzando le impostazioni di risparmio della memoria più aggressive. Ciò ha confermato che la strategia di spostare solo i dati necessari non ha degradato la capacità del modello di comprendere e generare il linguaggio. Il sistema ha imparato efficacementamente a ignorare i dati che non erano necessari per il passaggio successivo immediato, concentrando le proprie risorse solo su ciò che contava.

Lo studio evidenzia un cambiamento nel modo in cui potremmo pensare di eseguire l'intelligenza artificiale sui dispositivi quotidiani. Per anni, la soluzione per far girare grandi modelli su hardware piccoli è stata quella di rendere i modelli più piccoli o di comprimerli, il che può talvolta ridurne le capacità. NeuroPrefetcher suggerisce una strada diversa: mantenere intatto il modello completo e gestire il movimento dei suoi dati con estrema precisione. Prevedendo ciò di cui il modello ha bisogno successivamente e recuperando solo quel cambiamento specifico, il sistema trasforma l'unità di archiviazione da un collo di bottiglia a un utile partner. Questo approccio consente a un'intelligenza potente di operare su dispositivi che prima erano troppo piccoli per contenerla, aprendo la porta all'esecuzione locale di un'IA avanzata senza la necessità di una connessione a un server remoto. I risultati dimostrano che, con la giusta gestione del flusso di dati, i limiti fisici della memoria possono essere superati senza sacrificare la potenza del modello stesso.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →