Event-triggered Implicit Perturbation for Zeroth-Order Fine-Tuning of Spiking Transformers
Questo articolo propone un'architettura di perturbazione implicita attivata da eventi (IPZO) per il fine-tuning di ordine zero di Spiking Transformer su acceleratori di calcolo in-memory, la quale elimina le costose operazioni di read-modify-write e riduce l'overhead hardware generando perturbazioni solo per i pesi attivati dagli spike e impiegando uno schema di ricombinazione XOR per mantenere un'accuratezza paragonabile ai generatori di numeri casuali basati su software.
Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo
Nel mondo in rapida evoluzione dell'intelligenza artificiale, un tipo specifico di programma informatico noto come transformer è diventato la forza dominante, alimentando tutto, dalla traduzione linguistica al riconoscimento delle immagini. Questi sistemi sono incredibilmente potenti ma anche incredibilmente affamati di energia e memoria, richiedendo spesso enormi data center per funzionare. Per portare questa intelligenza su dispositivi più piccoli e quotidiani come smartphone o sensori, gli ingegneri si sono rivolti a un approccio diverso ispirato al cervello umano: le reti neurali spiking. A differenza dei programmi tradizionali che elaborano le informazioni in modo continuo, queste reti operano su eventi, attivandosi solo quando necessario, il che le rende naturalmente efficienti. Tuttavia, insegnare a queste reti nuove attività direttamente sul dispositivo è stato un problema ostico. Il metodo standard per addestrarle, che consiste nel calcolare come regolare ogni singola connessione della rete, è troppo complesso e dispendioso in termini di memoria per i piccoli chip. Esiste un'alternativa più semplice, una che stima come migliorare il sistema applicando minuscoli accenni casuali alle sue connessioni e osservando se il risultato migliora, ma questo metodo presenta i suoi severi ostacoli hardware che lo hanno reso poco pratico.
Un team di ricercatori ha ora progettato una nuova architettura che supera questi ostacoli, permettendo a queste reti efficienti di tipo cerebrale di apprendere direttamente su chip informatici specializzati senza dover riscrivere costantemente la loro memoria interna. La sfida principale che hanno affrontato è stata che il modo standard di applicare questi accenni casuali richiede che il chip legga ripetutamente le sue informazioni memorizzate, le modifichi e le riscriva. Questo processo, noto come read-modify-write (leggi-modifica-scrivi), è lento e consuma la batteria, annullando di fatto il risparmio energetico per cui i chip specializzati erano stati progettati. Inoltre, generare l'enorme quantità di numeri casuali necessari per questi accenni per ogni singola connessione della rete richiederebbe un generatore di numeri casuali così grande da occupare più spazio della memoria stessa. I ricercatori hanno proposto un espediente astuto: invece di cambiare direttamente i pesi memorizzati, iniettano le variazioni casuali nel processo di calcolo stesso, proprio dove i numeri vengono sommati. Questo mantiene i pesi memorizzati intatti e stazionari, preservando l'efficienza del chip.
Per far sì che questo funzioni, il team ha costruito un'unità specializzata che genera questi accenti casuali solo per le parti della rete che sono effettivamente attive in un dato momento. Poiché queste reti simili al cervello sono naturalmente sparse, il che significa che la maggior parte delle loro connessioni è silente in un singolo istante, questa unità deve essere solo una frazione della dimensione dell'intera rete. Tuttavia, riutilizzare semplicemente lo stesso piccolo insieme di numeri casuali per diverse parti della rete crea un problema nascosto: gli accenti diventano troppo simili tra loro, causando il blocco del processo di apprendimento o rendendolo impreciso. Per risolvere questo, i ricercatori hanno introdotto uno schema di miscelazione che combina questi numeri riutilizzati in un modo specifico basato sulla loro posizione, garantendo che ogni parte della rete riceva un accento unico e indipendente. Questo processo di miscelazione, che chiamano ricombinazione XOR guidata dall'indirizzo, ripristina l'indipendenza statistica necessaria affinché il sistema apprenda efficacemente.
Quando il team ha testato questo nuovo design, i risultati sono stati sorprendenti. In simulazioni e test hardware utilizzando un processo di produzione di chip standard, il loro sistema ha raggiunto la stessa alta precisione dei metodi basati su software che utilizzano numeri casuali perfetti e indipendenti. Al contrario, una versione più semplice che si limitava a riutilizzare i numeri casuali senza lo schema di miscelazione è fallita significativamente, perdendo quasi dieci punti percentuali di accuratezza nei compiti di riconoscimento delle immagini e richiedendo molto più tempo per l'apprendimento. Il nuovo design si è dimostrato anche straordinariamente efficiente dal punto di vista energetico. Poiché evita il costoso processo di riscrittura della memoria, consuma meno della metà dell'energia rispetto al metodo tradizionale nelle impostazioni tipiche. Nonostante la nuova unità di miscelazione aggiunga una piccola quantità di hardware extra, la velocità con cui il sistema apprende significa che l'energia totale utilizzata durante l'intero processo di addestramento è ridotta della metà rispetto al metodo di riutilizzo più semplice. Questo lavoro dimostra che spostando le regolazioni casuali dall'area di archiviazione all'area di calcolo e utilizzando una tecnica di miscelazione intelligente, è possibile addestrare complessi modelli di IA ispirati al cervello direttamente su hardware con vincoli energetici, aprendo la strada a dispositivi più intelligenti e adattivi capaci di apprendere in movimento.
Sommerso dagli articoli nel tuo campo?
Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.