Low-Rank Ternary Adaptation for Fine-Tuning Transformers
Questo articolo propone la "ternary multiplicative adaptation", un nuovo metodo a basso rango che consente il fine-tuning efficiente di transformer ternari rappresentando gli aggiornamenti dei pesi discreti attraverso piccole matrici ternarie, preservando così il dominio ternario e consentendo la fusione diretta senza dequantizzazione, recuperando significativamente le prestazioni in modelli linguistici e di visione.
Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo
L'intelligenza artificiale moderna si basa su enormi programmi informatici chiamati transformer, che sono diventati il motore dietro tutto, dagli assistenti per la scrittura ai generatori di immagini. Questi programmi sono incredibilmente potenti, ma sono anche pesanti, richiedendo vaste quantità di memoria informatica ed energia per funzionare. Per renderli utilizzabili su dispositivi più piccoli come telefoni o laptop, i ricercatori hanno trascorso anni cercando di rimpicciolirli. Una strategia popolare è quella di comprimere i numeri all'interno del programma, trasformandoli da valori complessi ad alta precisione in versioni più semplici a basso bit. Immaginate di prendere una fotografia ad alta risoluzione e ridurla a pochi colori; l'immagine diventa più piccola e veloce da elaborare, sebbene si perda inevitabilmente qualche dettaglio. La forma più aggressiva di questa compressione prevede la limitazione dei numeri interni del programma a soli tre valori possibili: meno uno, zero e positivo uno. Questo approccio, noto come quantizzazione ternaria, riduce la memoria necessaria di un fattore di dieci, potenzialmente trasformando un modello che un tempo richiedeva un grande server in qualcosa che potrebbe girare su un normale laptop.
Tuttavia, un problema significativo ha bloccato il progresso di questi modelli ultra-compatti. Sebbene i modelli siano piccoli ed efficienti, sono difficili da insegnare nuovi compiti. I metodi standard per insegnare a questi programmi consistono nel fare piccoli aggiustamenti continui ai loro numeri. Ma quando un modello è limitato a soli tre valori, non può fare piccoli aggiustamenti; può solo invertire il segno di un numero da negativo a positivo, o spegnerlo completamente. Le tecniche esistenti per insegnare a questi modelli compressi spesso richiedono di espandere temporaneamente i numeri alla loro dimensione completa e pesante per effettuare le modifiche, e poi di comprimerli nuovamente. Questo processo di espansione e ri-compressione introduce errori che degradano le prestazioni del modello, rendendo spesso il risultato finale peggiore rispetto a se non fosse stato fatto alcun insegnamento affatto.
Un team di ricercatori della Delft University of Technology e di Amazon ha sviluppato un nuovo modo per insegnare a questi modelli ultra-compatti che evita questo ciclo di espansione ed errore. Invece di cercare di aggiungere piccoli numeri continui al modello, il loro metodo lavora direttamente all'interno del rigoroso sistema a tre valori. Hanno progettato un sistema che agisce come un insieme di interruttori, permettendo al modello di invertire il segno dei suoi numeri interni o di spegnerli completamente, senza mai lasciare lo stato compresso. Per rendere questo processo efficiente, non hanno cercato di regolare ogni singolo numero individualmente. Invece, hanno utilizzato una struttura matematica che permette a pochi schemi piccoli e semplici di controllare vaste sezioni del modello contemporaneamente. Questo approccio, che chiamano adattamento ternario a basso rango (low-rank ternary adaptation), permette al modello di apprendere nuove abilità rimanendo perfettamente compresso.
I ricercatori hanno testato questo metodo su diversi tipi di intelligenza artificiale, inclusi modelli linguistici capaci di ragionare e modelli di visione che riconoscono le immagini. Sono partiti da modelli che erano già stati compressi al limite dei tre valori e poi hanno applicato la loro nuova tecnica di insegnamento. I risultati hanno mostrato che i modelli hanno recuperato gran parte dell'accuratezza che avevano perso durante la compressione iniziale. Nei test riguardanti compiti linguistici, i modelli adattati hanno performato significativamente meglio dei tentativi precedenti che cercavano di forzare l'apprendimento attraverso l'espansione e la ri-compressione. Ad esempio, su un modello linguistico con tre miliardi di parametri, il nuovo metodo ha migliorato l'accuratezza media in nove diversi compiti da circa il 32 percento al 38 percento, rendendo anche le predizioni del modello molto più sicure.
Forse la cosa più importante è che il risultato finale di questo processo è un modello unico e unificato che rimane nella sua forma ultra-compatta. A differenza di altri metodi che lasciano dietro di sé un insieme separato e pesante di istruzioni che deve essere caricato insieme al piccolo modello, questo nuovo approccio fonde l'apprendimento direttamente nei pesi minuscoli. I ricercatori hanno scoperto che per i compiti di visione, come l'identificazione di oggetti nelle immagini, il loro metodo ha prodotto un modello molto più accurato di quelli creati ri-comprimendo dopo l'apprendimento. Hanno anche scoperto che il processo di apprendimento funzionava ridistribuendo i segni dei numeri esistenti piuttosto che cercare di riportare in vita i numeri azzerati. Ciò significa che il modello impara riorganizzando ciò che già possiede, invece di cercare di creare nuove connessioni dove non esistevano.
Questo lavoro dimostra che è possibile insegnare a modelli di intelligenza artificiale altamente compressi senza sacrificare la loro efficienza o accuratezza. Rispettando i limiti rigorosi del sistema a tre valori e trovando un modo per apprendere entro tali confini, i ricercatori hanno dimostrato che questi modelli minuscoli possono essere capaci quanto i loro corrispettivi più grandi per molti compiti. Il metodo non richiede memoria extra o potenza di calcolo durante l'uso, poiché l'apprendimento è completamente integrato nella struttura del modello. Ciò apre la porta all'esecuzione di un'intelligenza artificiale sofisticata su dispositivi con risorse molto limitate, portando capacità potenti in luoghi dove prima era impossibile dispiegarle.
Sommerso dagli articoli nel tuo campo?
Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.