← Ultimi articoli
🤖 machine learning

Uncovering Intra-expert Activation Sparsity for Efficient Mixture-of-Expert Model Execution

Questo articolo rivela che i modelli pre-addestrati esistenti basati su Mixture-of-Experts (MoE) possiedono intrinsecamente una sostanziale sparsità di attivazione intra-expert, che può essere sfruttata modificando la pipeline di esecuzione vLLM per saltare i calcoli dei neuroni inattivi, ottenendo un aumento di velocità fino a 2,5 volte nell'esecuzione del layer MoE e un aumento di velocità end-to-end di 1,2 volte senza alcun riaddestramento del modello o modifica dei parametri.

Autori originali: Jongseok Park, Sunga Kim, Zhenyu Gu, Ion Stoica, Alvin Cheung

Pubblicato 2026-05-12
📖 5 min di lettura🧠 Approfondimento

Autori originali: Jongseok Park, Sunga Kim, Zhenyu Gu, Ion Stoica, Alvin Cheung

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

L'Idea Principale: Trovare i "Giganti Dormienti" nell'IA

Immagina una cucina di lusso enorme e sofisticata (il modello di IA) che dispone di centinaia di chef specializzati (chiamati Esperti). In una configurazione standard "Mixture of Experts" (MoE), quando un cliente ordina un piatto, lo chef principale (il Router) sceglie solo alcuni esperti specifici per lavorare su quell'ordine. Ad esempio, se l'ordine è "curry piccante", il router potrebbe risvegliare l'"Esperto Spezie" e l'"Esperto Curry", mentre l'"Esperto Dolci" e l'"Esperto Pane" restano addormentati.

Questo è già efficiente perché la cucina non fa lavorare tutti e 100 gli chef per ogni singolo ordine. Tuttavia, i ricercatori di questo documento hanno posto una nuova domanda: "Anche quando uno chef è sveglio e al lavoro, sta usando tutta la sua energia?"

Hanno scoperto che anche gli chef "svegli" passano la maggior parte del tempo semplicemente in piedi senza fare nulla. Hanno rilevato che all'interno di un singolo esperto, fino al 90% dei neuroni (le singole cellule cerebrali dell'IA) sono effettivamente "addormentati" o producono un output nullo per un dato input.

Il Problema: Perché Non Possiamo semplicemente Aggiungere Più Chef

In passato, per rendere l'IA più veloce, i ricercatori hanno cercato di rendere la cucina più efficiente aggiungendo più chef e risvegliandone meno (aumentando la "sparsità inter-esperto"). Ma questo sta diventando molto difficile.

  • La Lotta dell'Addestramento: Se hai troppi chef e ne risvegli solo pochi, la cucina diventa caotica. Alcuni chef ricevono tutto il lavoro (squilibrio del carico), mentre altri non vengono mai addestrati e diventano inutili (collasso dell'esperto).
  • Il Limite: Stiamo raggiungendo un muro dove non possiamo rendere più efficiente la selezione di "chi può lavorare" senza rompere il modello.

La Soluzione: La Strategia dello "Chef Pigro"

Invece di cercare di scegliere meno chef, gli autori hanno deciso di rendere più efficienti i singoli chef. Hanno realizzato che anche quando uno chef sta lavorando, non ha bisogno di usare ogni singolo strumento nel suo kit.

L'Analogia:
Immagina un maestro falegname (un Esperto) che costruisce una sedia.

  • Vecchio Metodo: Il falegname prende ogni singolo martello, sega e cacciavite nel capannone, anche se ha bisogno solo di un martello e di un cacciavite. Trasporta l'intero capannone al cantiere.
  • Nuovo Metodo (Questo Documento): Il falegname guarda il lavoro, si rende conto di aver bisogno solo del martello e del cacciavite, e lascia la sega e il restante 90% degli attrezzi nel capannone. Trasporta solo ciò che gli serve.

I ricercatori hanno scoperto che nei modelli di IA pre-addestrati esistenti (come Qwen, Llama e DeepSeek), questo comportamento "pigro" sta già avvenendo naturalmente. La matematica all'interno del modello annulla naturalmente la maggior parte del lavoro. Avevano solo bisogno di insegnare al computer a saltare quel lavoro sprecato.

Come l'Hanno Fatto: Il Sistema "Skip-List"

Il team ha preso un motore di IA veloce e popolare chiamato vLLM (immaginalo come il servizio di consegna che porta il cibo dalla cucina al cliente) e lo ha aggiornato.

  1. Il Controllo: Prima che lo "chef" inizi a cucinare, il sistema controlla rapidamente quali strumenti (neuroni) sono effettivamente necessari.
  2. Il Salto: Se uno strumento non è necessario (il suo valore è troppo basso), il sistema non lo carica nemmeno nella memoria o tenta di usarlo. Salta letteralmente il calcolo.
  3. Il Risultato: Hanno costruito una "corsia preferenziale" speciale nel software. Se il lotto di ordini è piccolo (come un pranzo tranquillo), il sistema usa questa corsia preferenziale e salta i lavori pesanti. Se la cucina è super affollata (un enorme rush serale), torna alla modalità standard e pesante per mantenere la stabilità.

Cosa Hanno Trovato (I Risultati)

Hanno testato questo approccio su otto diversi modelli di IA giganti, che vanno da quelli piccoli (1 miliardo di parametri) a quelli enormi (400 miliardi di parametri).

  • Accuratezza: Hanno potuto saltare fino al 90% del lavoro all'interno di un esperto e l'IA ha comunque dato le risposte corrette il 95% delle volte. Era come saltare il 90% degli ingredienti in una ricetta e il piatto risultava comunque buono al 95%.
  • Velocità:
    • Per la parte specifica di "cottura" dell'IA (il livello MoE), hanno visto accelerazioni fino a 2,5 volte.
    • Per l'intero sistema (end-to-end), hanno visto un'accelerazione di 1,2 volte.
  • Hardware: L'accelerazione è stata più drammatica su schede grafiche più piccole e meno potenti (come una scheda da gaming consumer), dimostrando che questo è un ottimo modo per eseguire grandi modelli di IA su hardware meno costoso.

Il Rovescio della Medaglia (Limitazioni)

Il documento è onesto riguardo ai limiti:

  • Il Guardiano: Il sistema deve ancora controllare quali strumenti sono necessari prima di poterli saltare. Questo "controllo" richiede tempo e non può ancora essere saltato. È come se un manager dovesse ancora girare per la cucina per dire agli chef quali strumenti prendere, anche se gli chef non li usano tutti.
  • Dimensione del Lotto: L'accelerazione è migliore quando l'IA elabora poche richieste alla volta. Se si elaborano migliaia di richieste simultaneamente, l'overhead del "controllo" diventa un collo di bottiglia e l'accelerazione diminuisce.

Riepilogo

Questo documento non ha inventato un nuovo tipo di IA né ha addestrato un nuovo modello da zero. Invece, hanno esaminato modelli di IA esistenti e potenti e hanno realizzato: "Ehi, questi modelli stanno già facendo un sacco di lavoro inutile, anche quando sono 'attivi'."

Costruendo un sistema che riconosce questo sforzo sprecato e semplicemente lo salta, hanno fatto sì che questi massicci modelli di IA funzionassero significativamente più velocemente ed efficientemente, specialmente su hardware che non è super costoso. È una tecnica di "salto intelligente" che rende la generazione attuale di modelli di IA più pratica da eseguire.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →