← Ultimi articoli
🤖 machine learning

Escaping Low-Dimensional Overlap: Multi-Task Model Merging via High-Dimensional Sparse Disentanglement

Questo articolo propone un nuovo framework di fusione di modelli che sfrutta gli Autoencoder Sparsi per proiettare i vettori di task in uno spazio di caratteristiche sparse ad alta dimensionalità per un efficace disincanto delle caratteristiche interferenti, combinato con un ottimizzatore leggero Group-Ranked Zeroth-Order per la fusione selettiva dei livelli, superando così significativamente i baseline esistenti attraverso diversi task.

Autori originali: Yihang Zhang, Shengke Sun, Junjie Wen, Feng Zeng

Pubblicato 2026-08-27
📖 6 min di lettura🧠 Approfondimento

Autori originali: Yihang Zhang, Shengke Sun, Junjie Wen, Feng Zeng

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Nel mondo in rapida evoluzione dell'intelligenza artificiale, i ricercatori cercano costantemente di costruire macchine che possano fare molte cose contemporaneamente. Immaginate uno studente che ha trascorso anni a padroneggiare la matematica, un altro che è diventato un mago della programmazione e un terzo che è un esperto nel seguire istruzioni complesse. In passato, per utilizzare tutte queste abilità, un computer avrebbe avuto bisogno di eseguire tre programmi separati, ciascuno dedicato a una materia. Questo è inefficiente, poiché richiede enormi quantità di memoria del computer ed energia. Una soluzione più elegante è quella di combinare questi esperti separati in un unico modello versatile. Questo processo, noto come fusione di modelli (model merging), tenta di fondere la "conoscenza" di diversi programmi specializzati in un unico cervello unificato senza doverlo riaddestrare da zero. Tuttavia, questa fusione è notoriamente difficile. Quando si mescolano due distinti set di istruzioni, esse spesso entrano in conflitto. Il computer si confonde e il modello risultante offre prestazioni scarse in tutti i compiti, come se le diverse abilità stessero combattendo per lo stesso spazio nella memoria della macchina.

Il nucleo di questo problema risiede nel modo in cui questi cervelli artificiali memorizzano le informazioni. All'interno di una rete neurale, diverse abilità spesso condividono gli stessi percorsi fisici, un fenomeno che i ricercatori chiamano sovrapposizione (superposition). È come se più idee distinte cercassero di occupare lo stesso stretto corridoio nello stesso momento. Quando i ricercatori provano semplicemente ad aggiungere i pesi di due modelli, queste idee sovrapposte interferiscono tra loro, creando un groviglio dove l'informazione utile viene persa. I tentativi precedenti per risolvere questo problema hanno consistito nel cercare di districare il groviglio all'interno dello spazio originale e affollato, spesso tagliando via parti del modello o riscalando i numeri. Ma quando l'interferenza è grave, questi metodi sono come cercare di ordinare un mucchio di fili aggrovigliati guardando solo i nodi; non possono separare completamente i singoli fili senza danneggiare il circuito.

Un team di ricercatori ha proposto un nuovo modo per risolvere questo problema cambiando completamente prospettiva. Invece di cercare di districare i fili in un corridoio affollato, suggeriscono di spostare i fili in una stanza molto più grande e vuota, dove c'è spazio a sufficienza per stenderli separatamente. Chiamano questo approccio "High-Dimensional Sparse Disentanglement Merging" (Fusione per Disentanglement Sparso ad Alta Dimensionalità). I ricercatori hanno utilizzato uno strumento noto come Autoencoder Sparso (Sparse Autoencoder), che funge da traduttore. Esso prende le istruzioni aggrovigliate di un compito specifico e le converte in una lunga lista di caratteristiche semplici e distinte. Poiché questa nuova lista è molto più lunga del set di istruzioni originale, ogni caratteristica ottiene il proprio spazio dedicato, permettendo al computer di vedere esattamente quali parti della conoscenza appartengano alla matematica, quali alla programmazione e quali al seguire le istruzioni. Una volta che l'informazione è stata separata in questa spaziosa stanza ad alta dimensionalità, i ricercatori possono combinare con cura le parti rilevanti senza che le diverse abilità si calpestino i piedi a vicenda. Una volta completata la combinazione, il traduttore riconverte la lista pulita e separata nel formato originale affinché il modello possa utilizzarla.

Tuttavia, tradurre ogni singolo strato di un modello massiccio in questo nuovo formato sarebbe incredibilmente lento e costoso. Per risolvere questo problema, i ricercatori hanno introdotto un metodo di selezione intelligente chiamato "Group-Ranked Zeroth-Order Optimizer". Questo strumento agisce come una sentinella, testando rapidamente quali parti del modello siano più critiche per un compito specifico. Lo fa apportando piccoli aggiustamenti casuali a diverse sezioni del modello e osservando quanto cambia la prestazione, senza la necessità di calcolare gradienti complessi. Identificando solo gli strati più importanti, il sistema applica il costoso processo di traduzione e separazione solo dove è veramente necessario, lasciando il resto del modello da fondere con metodi più semplici e veloci. Ciò assicura che il sistema rimanga efficiente pur ottenendo i benefici della separazione profonda.

I ricercatori hanno testato questo nuovo framework utilizzando la serie di modelli linguistici Qwen2.5, che sono sistemi di intelligenza artificiale potenti. Hanno creato modelli esperti per compiti come il ragionamento matematico, la generazione di codice e il seguire istruzioni complesse. Quando hanno fuso questi esperti usando i metodi tradizionali, i risultati sono stati spesso deludenti, con un calo significativo delle prestazioni nei compiti difficili. Al contrario, il loro nuovo metodo ha costantemente superato le tecniche esistenti. Su un modello da 7 miliardi di parametri, il loro approccio ha raggiunto un punteggio medio di 68,49 nei compiti di matematica, programmazione e rispetto delle istruzioni, superando il precedente miglior metodo con un margine netto. Il miglioramento è stato ancora più drammatico in scenari altamente conflittuali. Quando hanno provato a fondere quattro compiti diversi, inclusa l'allineamento alla sicurezza, su un modello più piccolo da 1,5 miliardi di parametri, i metodi tradizionali hanno visto i loro punteggi medi crollare fino a 15,45. Il nuovo metodo ha mantenuto un punteggio di 36,48, preservando efficacementamente la capacità del modello di fare matematica e programmazione pur aderendo a rigorose linee guida di sicurezza.

Lo studio suggerisce che la chiave per una fusione di modelli di successo non risiede solo in come mescoliamo i numeri, ma in dove li mescoliamo. Proiettando l'informazione del compito in uno spazio ad alta dimensionalità dove le caratteristiche possono essere chiaramente distinte, i ricercatori sono riusciti a ridurre l'interferenza che di solito affligge questi sistemi. Hanno scoperto che il loro autoencoder migliorato, che utilizza una tecnica specifica per mantenere attive le caratteristiche più importanti ignorando le altre, è stato cruciale per questo successo. Inoltre, il loro strumento di selezione degli strati ha dimostrato che non è necessario applicare questa complessa separazione a ogni parte del modello; concentrarsi sugli strati critici è stato sufficiente per catturare i benefici. I risultati indicano che questo approccio offre un modo robusto per costruire modelli generalisti che possono gestire più compiti conflittuali senza la necessità di ulteriori dati di addestramento o di un costoso riaddestramento. Sebbene il metodo richieda un certo sforzo computazionale iniziale per configurare gli strumenti di traduzione, il vantaggio è un modello che conserva le sue abilità specializzate molto meglio rispetto a quelli creati con tecniche più vecchie. Questo lavoro fornisce una strada concreta per la creazione di sistemi di intelligenza artificiale più capaci e versatili, in grado di navigare nel complesso panorama di molteplici compiti umani senza smarrire la strada.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →