← Ultimi articoli
💻 computer science

Mamba-CL: Optimizing Selective State Space Model in Null Space for Continual Learning

Questo articolo introduce Mamba-CL, un framework di apprendimento continuo che mitiga l'oblio catastrofico nei modelli Mamba applicando la proiezione nello spazio nullo per aggiornare i parametri ortogonalmente ai precedenti sottospazi dei task, garantendo così la coerenza dell'output tra i task e raggiungendo prestazioni superiori nei benchmark di incremento delle classi.

Autori originali: De Cheng, Yue Lu, Lingfeng He, Shizhou Zhang, Xi Yang, Nannan Wang, Xinbo Gao

Pubblicato 2026-07-28
📖 3 min di lettura☕ Lettura da pausa caffè

Autori originali: De Cheng, Yue Lu, Lingfeng He, Shizhou Zhang, Xi Yang, Nannan Wang, Xinbo Gao

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immagina di insegnare a un robot brillante a riconoscere diversi tipi di animali. Prima, gli mostri delle immagini di gatti. Impara perfettamente. Poi, gli mostri delle immagini di cani. Il robot impara i cani, ma nel processo dimentica accidentalmente che aspetto ha un gatto. Questo è un problema famoso nell'intelligenza artificiale chiamato "oblio catastrofico" (catastrophic forgetting). È come uno studente che studia intensamente per un esame di storia e dimentica immediatamente tutto ciò che ha imparato in matematica il giorno prima. Gli scienziati hanno cercato di costruire un'IA capace di imparare nuove cose senza perdere i vecchi ricordi, un gioco di equilibrio noto come "dilemma stabilità-plasticità". Per risolvere questo, i ricercatori usano spesso una tecnica chiamata "proiezione ortogonale". Pensala come un bibliotecario severo che ti permette di aggiungere nuovi libri allo scaffale solo in un corridoio completamente vuoto, assicurandosi di non far mai cadere i libri delle tue visite precedenti. Recentemente, un nuovo tipo di architettura IA chiamato "Mamba" è diventato molto popolare perché è veloce e ottimo nel comprendere le sequenze, come frasi o fotogrammi video. Ma, poiché Mamba funziona in modo diverso rispetto ai vecchi modelli di IA, le vecchie regole del "bibliotecario" non si adattavano bene alla sua struttura unica.

Questo articolo introduce un nuovo metodo chiamato Mamba-CL, che agisce come un bibliotecario specializzato addestrato specificamente per la biblioteca Mamba. I ricercatori hanno capito che per impedire a Mamba di dimenticare, non potevano limitarsi a usare le regole standard; dovevano capire esattamente come lo "stato" interno di Mamba (la sua memoria del passato) si aggiorna quando vede nuove informazioni. Hanno scoperto che l'oblio avviene quando il robot cambia il modo in cui elabora i vecchi input mentre impara nuovi input. Per risolvere il problema, hanno derivato quattro regole matematiche specifiche che fungono da guardrail. Queste regole assicurano che, quando Mamba impara un nuovo compito, aggiorni le sue "manopole e cursori" solo in direzioni che sono completamente invisibili per i vecchi compiti.

Il team ha testato questo metodo insegnando al modello Mamba una sequenza di diversi compiti di riconoscimento di immagini, come l'identificazione di oggetti in immagini provenienti da ImageNet-R e CIFAR-100. Hanno scoperto che Mamba-CL è incredibilmente efficace nel prevenire l'oblio del robot. Nei test con 10 compiti diversi, il nuovo metodo ha migliorato l'accuratezza di circa il 2% o il 3% rispetto ai migliori metodi esistenti, riducendo drasticamente la quantità di conoscenza persa. Ad esempio, in un benchmark, il tasso di oblio è sceso da oltre il 28% in una versione standard a solo il 4%. L'articolo suggerisce che, limitando attentamente il modo in cui il modello aggiorna il suo stato interno, esso può apprendere nuove abilità senza cancellare le precedenti, anche in lunghe sequenze di apprendimento. Gli autori osservano che questo approccio funziona bene sia che il modello sia pre-addestrato su enormi dataset, sia che sia addestrato da zero, dimostrando che questa strategia di "guardrail" è un modo robusto per mantenere i modelli di IA intelligenti e stabili nel tempo.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →