Fast-Slow Efficient Training for Multimodal Large Language Models via Visual Token Pruning
Questo articolo propone DualSpeed, un framework di addestramento fast-slow che combina il pruning dei token visivi per l'efficienza con una modalità ausiliaria a sequenza completa e l'auto-distillazione per risolvere i disallineamenti tra addestramento e inferenza, accelerando così l'addestramento degli MLLM fino a 4,0 senza compromettere le prestazioni.
Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo
Immagina di cercare di insegnare a uno studente molto intelligente (un Modello Linguistico Multimodale di Grandi Dimensioni) a comprendere il mondo mostrandogli migliaia di immagini.
Il Problema: Il collo di bottiglia del "Troppe Informazioni"
Attualmente, questi modelli sono come studenti che si sentono sopraffatti. Quando mostri loro un'immagine, il computer la scompone in centinaia o addirittura migliaia di piccoli pezzi chiamati "token visivi". È come se avessi consegnato allo studente un libro di 1.000 pagine per ogni singola immagine, anche se la maggior parte di quelle pagine sono solo spazi bianchi inutili o schemi ripetitivi.
Cercare di leggere tutte quelle pagine richiede un tempo infinito. Questo rende l'addestramento di questi modelli incredibilmente lento, costoso e vorace di energia.
La Vecchia Idea: L'errore del "Taglia e Incolla"
I ricercatori si sono resi conto che molte di quelle pagine sono inutili. Hanno provato una tecnica chiamata Visual Token Pruning (Potatura dei Token Visivi), che è come usare un evidenziatore per sbarrare le pagine noiose e ridondanti prima di mostrarle allo studente. Questo funziona molto bene per testare lo studente in seguito (inferenza), rendendolo più veloce.
Ma quando hanno provato a usare questo metodo durante l'addestramento, ha avuto l'effetto opposto. Ha creato un "disallineamento".
- L'Analogia: Immagina di aver addestrato lo studente solo su un riassunto di 10 pagine di un libro. Poi, all'esame finale, gli consegni il libro completo di 1.000 pagine. Lo studente andrebbe nel panico e fallirebbe perché non ha mai imparato a gestire la versione completa. Si è abituato troppo alla versione breve.
La Soluzione: DualSpeed (Il campo di addestramento "Fast-Slow")
Gli autori di questo articolo, Dingkun Zhang e il suo team, hanno creato un nuovo framework di addestramento chiamato DualSpeed. Pensa a un campo di addestramento a due corsie che passa da una all'altra casualmente per risolvere il problema del disallineamento.
La Corsia Veloce (La pratica rapida):
- La maggior parte del tempo (circa il 90% delle sessioni), il modello si addestra in "Modalità Fast".
- Qui, utilizzano la tecnica di "potatura" per tagliare via i token visivi inutili. Il modello impara velocemente dai riassunti brevi ed efficienti.
- Per aiutare il modello a ricordare quale versione sta guardando, aggiungono un piccolo "cartellino identificativo" invisibile (chiamato Mode Isolator) all'inizio del riassunto breve. Questo dice al modello: "Ehi, questa è la versione condensata; concentrati sui dettagli chiave".
La Corsia Lenta (La revisione del libro completo):
- Occasionalmente (circa il 10% delle volte), il modello passa alla "Modalità Slow".
- Qui, mostrano al modello l'immagine completa, non potata (tutte le 1.000 pagine).
- Per garantire che il modello non diventi pigro durante queste rare sessioni, usano un trucco chiamato Self-Distillation (Auto-distillazione). La "Modalità Fast" (che ha già imparato molto) agisce come un insegnante, sussurrando le risposte allo studente della "Modalità Slow". Questo assicura che lo studente apprenda la versione completa in modo efficace, anche se la vede meno spesso.
Il Risultato: Il meglio di entrambi i mondi
Mescolando questi due modi, il modello ottiene la velocità della Corsia Veloce ma mantiene la capacità di gestire il mondo completo e complesso della Corsia Lenta.
- Velocità: Hanno addestrato i modelli da 2,1 a 4,0 volte più velocemente rispetto a prima.
- Prestazioni: Nonostante la velocità, i modelli non sono diventati meno intelligenti. Hanno mantenuto oltre il 99% delle loro prestazioni originali.
- Flessibilità: Il modello finale è abbastanza intelligente da gestire sia i riassunti brevi (se desideri velocità in seguito) sia le immagini complete (se desideri la massima accuratezza).
In sintesi
L'articolo sostiene che, utilizzando un sistema di commutazione "Fast-Slow", è possibile addestrare questi enormi modelli di IA molto più velocemente senza far loro dimenticare come leggere i libri completi. Hanno scoperto che circa il 90% dei token visivi è in realtà ridondante durante l'addestramento e che, tagliandoli via in modo intelligente (pur praticando occasionalmente con la versione completa), possono risparmiare una quantità enorme di tempo e denaro senza perdere intelligenza.
Sommerso dagli articoli nel tuo campo?
Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.