SHIFT-LLM: Distribution Shift Correction in Depth-Pruned LLMs
SHIFT-LLM è un framework di post-pruning privo di addestramento che ripristina l'accuratezza nei modelli linguistici di grandi dimensioni sottoposti a pruning della profondità, inserendo leggeri Linear Residual Adapter calibrati tramite regressione a forma chiusa per correggere gli spostamenti distribuzionali causati dalla rimozione dei blocchi Transformer.
Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo
I grandi modelli linguistici sono i motori che alimentano molti degli strumenti di intelligenza artificiale più avanzati di oggi, capaci di scrivere storie, risolvere problemi e rispondere a domande complesse. Questi sistemi sono costruiti da strati di unità di elaborazione digitale impilati l'uno sull'altro, molto simile a un edificio multipiano dove ogni piano raffina l'informazione trasmessa a quello sottostante. Più piani ha un edificio, più dettagliato e sofisticato può essere il suo output finale, ma questo rende anche la struttura incredibilmente pesante e costosa da gestire. Per molte applicazioni pratiche, specialmente su dispositivi con energia o memoria limitate, questi modelli massicci sono semplicemente troppo grandi per essere utilizzati. Per renderli più piccoli, i ricercatori hanno sviluppato metodi per rimuovere interi piani dall'edificio, un processo noto come pruning della profondità (depth pruning). Sebbene questo alleggerisca con successo il carico e velocizzi il modello, spesso causa l'inciampo dei piani rimanenti. Poiché i piani rimossi erano progettati per trasmettere tipi specifici di informazioni a quelli superiori, la loro rimozione lascia gli strati superiori confusi, ricevendo segnali che non corrispondono più a ciò che erano stati addestrati ad aspettarsi. Questo disallineamento, noto come spostamento della distribuzione (distribution shift), causa la perdita di accuratezza del modello e la generazione di errori, costringendo gli sviluppatori a dedicare un tempo e una potenza di calcolo significativi per riaddestrare il modello al fine di correggere gli errori.
Un team di ricercatori presso l'Huawei Noah's Ark Lab ha introdotto un nuovo approccio chiamato SHIFT-LLM che risolve questo problema senza la necessità di riaddestramento. Invece di cercare di ricostruire i piani mancanti o di riinsegnare ai rimanenti, il loro metodo inserisce un modulo di correzione piccolo e leggero in ogni punto in cui è stato rimosso uno strato. Immaginate che, se aveste rimosso un piano da un edificio, installereste una rampa semplice e su misura che colmi perfettamente il vuoto, assicurando che le persone ai piani superiori ricevano ancora le stesse esatte istruzioni che avrebbero ricevuto se il piano mancante fosse ancora lì. Nel mondo digitale, questa rampa è un adattatore lineare che preserva il percorso diretto dell'informazione aggiungendo al contempo un piccolo aggiustamento calcolato. Questo aggiustamento è progettato per imitare il contributo specifico che lo strato rimosso avrebbe apportato, ingannando efficacemente il resto del modello facendogli credere che il piano mancante sia ancora presente.
La genialità di questo metodo risiede nel modo in cui calcola tale aggiustamento. Invece di eseguire migliaia di ore di addestramento per capire cosa avrebbe dovuto fare lo strato mancante, i ricercatori utilizzano un piccolo set di dati campionari per misurare esattamente quale informazione è stata persa. Successivamente, utilizzano un calcolo matematico diretto per determinare la correzione precisa necessaria per ripristinare quell'informazione perduta. Questo processo è interamente automatico e non richiede l'ottimizzazione basata sul gradiente, ovvero il complesso processo di apprendimento iterativo solitamente richiesto per correggere i modelli guasti. Utilizzando questo calcolo in forma chiusa (closed-form), il team può correggere lo stato interno del modello in pochi minuti utilizzando solo poche centinaia di esempi, invece di giorni di tempo di calcolo. Il risultato è un modello sottoposto a pruning che mantiene la velocità e l'efficienza di avere meno strati, ma opera con un'accuratezza quasi identica al modello originale massiccio.
Nei loro esperimenti, i ricercatori hanno testato questa tecnica su cinque diverse famiglie di modelli linguistici di grandi dimensioni, che vanno da modelli più piccoli da 1,5 miliardi di parametri a versioni più grandi da 14 miliardi di parametri. Hanno applicato sei metodi diversi per decidere quali strati rimuovere e hanno valutato i risultati su sette diversi benchmark progettati per testare la conoscenza generale e il ragionamento. Le scoperte sono state coerenti: i moduli di correzione hanno recuperato con successo l'accuratezza persa durante il pruning in quasi ogni configurazione. In un caso notevole che coinvolge un modello da 8 miliardi di parametri, il metodo ha recuperato un incredibile 15,7 punti di accuratezza su un benchmark standard, un guadagno che tipicamente richiederebbe un riaddestramento esteso ed costoso. Anche quando i modelli erano già in fase di fine-tuning dopo il pruning, l'aggiunta di questo modulo di correzione ha fornito una spinta extra, suggerendo che i due approcci funzionano bene insieme per spingere le prestazioni ancora più in alto.
I ricercatori hanno anche dimostrato che questi moduli di correzione possono essere ulteriormente compressi per risparmiare spazio e possono essere uniti quando vengono rimossi più strati in sequenza, garantendo che i guadagni di efficienza derivanti dal pruning non vadano persi a causa dell'overhead della correzione stessa. Questo lavoro suggerisce che l'ostacolo principale nel rendere i modelli linguistici di grandi dimensioni più piccoli non è solo la rimozione di parti, ma la interruzione del flusso di informazioni tra di esse. Concentrandosi sulla riparazione di quel flusso con aggiustamenti semplici e mirati, SHIFT-LLM offre un modo generale ed efficiente per rendere pratici i potenti modelli di IA per l'uso quotidiano. Lo studio conferma che con la giusta correzione, possiamo privare i cervelli digitali delle loro parti pesanti e ridondanti senza perdere la capacità di pensare chiaramente, aprendo la strada a un'intelligenza artificiale più veloce, economica e accessibile.
Sommerso dagli articoli nel tuo campo?
Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.