← Ultimi articoli
💻 computer science

Predatory MoE: Serving Mixture-of-Experts with a Sequence-Local Expert Roster

Questo articolo propone una strategia di roster degli esperti locale alla sequenza che fissa un piccolo insieme di esperti per sequenza per ridurre drasticamente l'impronta di memoria e i trasferimenti di esperti durante il serving di modelli MoE, ottenendo un throughput vicino alla piena residenza con significativamente meno pesi residenti applicando questo vincolo in modo coerente sia durante l'addestramento che durante l'inferenza.

Autori originali: ChaeWoo Son

Pubblicato 2026-08-19
📖 5 min di lettura🧠 Approfondimento

Autori originali: ChaeWoo Son

Articolo originale sotto licenza CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

I moderni sistemi di intelligenza artificiale che generano testo si affidano spesso a un design chiamato "miscela di esperti" (mixture of experts). Immaginate una vasta biblioteca di lavoratori specializzati in conoscenze specifiche, dove ogni lavoratore è un esperto in un argomento ristretto e particolare. Quando il sistema deve rispondere a una domanda, non attiva tutti i lavoratori contemporaneamente. Invece, seleziona solo un piccolo manipolo dei più rilevanti esperti per quel preciso momento. Questo approccio permette al sistema di essere incredibilmente grande e capace pur utilizzando una potenza di calcolo relativamente ridotta per ogni parola che produce. Tuttavia, esiste un significativo collo di bottiglia nel modo in cui questi sistemi vengono gestiti sui computer standard. Anche se vengono utilizzati solo pochi esperti in un dato momento, la memoria del computer deve contenere l'intera biblioteca di esperti pronta all'uso, poiché il sistema non sa in anticipo quali saranno necessari successivamente. Questo requisito costringe la dimensione totale della memoria a corrispondere alla dimensione dell'intera biblioteca, anziché solo al piccolo gruppo in uso, rendendo difficile eseguire questi modelli potenti su dispositivi con memoria limitata.

I ricercatori hanno cercato di risolvere questo problema memorizzando gli esperti non utilizzati su un disco rigido e caricandoli in memoria solo quando necessario. Ma questo crea un nuovo problema: poiché il sistema sceglie gli esperti in modo sparso e imprevedibile, finisce per richiederne continuamente di nuovi, rallentando il processo. Un team guidato dal ricercatore indipendente ChaeWoo Son ha posto una domanda diversa: invece di cercare di rendere il computer più veloce nel recuperare esperti sparsi, si potrebbe cambiare il sistema in modo che aderisca naturalmente a un piccolo e costante gruppo di esperti per la durata di una singola conversazione? Volevano vedere se potevano addestrare il sistema a diventare "sequenza-locale", ovvero che una volta iniziata una conversazione, lo stesso piccolo team di esperti gestisca l'intero thread, permettendo al computer di mantenere solo quel team in memoria.

I ricercatori hanno prima tentato di insegnare questo comportamento direttamente al sistema. Hanno cercato di addestrare il modello a favorire gli esperti che aveva già utilizzato nella conversazione corrente, sperando che questa abitudine diventasse una parte permanente dell'intelligenza del sistema. Hanno scoperto che, sebbene questo trucco funzionasse durante l'addestramento, il comportamento non rimaneva. Non appena la pressione dell'addestramento veniva rimossa, il sistema tornava alle sue vecchie abitudini sparse. Anche quando hanno cercato di rinforzare il comportamento facendo sì che il sistema imparasse dalle proprie scelte distorte, il processo è diventato instabile e la qualità del testo ne ha sofferto. Lo studio ha concluso che il sistema non stava imparando una nuova abilità, ma stava semplicemente reagendo a una regola temporanea. I ricercatori si sono resi conto che cercare di forzare il sistema a interiorizzare questo comportamento era l'approccio sbagliato.

Invece di cercare di cambiare il cervello del sistema, i ricercatori hanno deciso di cambiare le regole del gioco. Hanno imposto una regola rigida e permanente che si applicava sia durante l'addestramento che durante l'uso effettivo del sistema. Sotto questa nuova regola, ogni conversazione viene assegnata a un piccolo team fisso di esperti basato sulle prime parole del testo. Una volta selezionato questo team, al sistema non è permesso passare a nessun altro per il resto di quella conversazione. Questa regola agisce come un budget: il computer deve mantenere solo quel piccolo team specifico nella sua memoria veloce, mentre il resto della biblioteca può rimanere sull'unità di archiviazione più lenta. Poiché il team è fisso per l'intera conversazione, il computer non ha bisogno di scambiare costantemente esperti in entrata e in uscita.

I risultati di questo approccio sono stati sorprendenti. Quando i ricercatori hanno applicato questa regola a un modello di prova e gli hanno concesso un breve periodo di riaddestramento per adattarsi ai nuovi vincoli, il sistema ha performato quasi come faceva senza la regola, ma con una riduzione massiccia dell'uso della memoria. Nei loro test, sono stati in grado di mantenere solo un quarto del totale degli esperti in memoria e hanno comunque ottenuto quasi la stessa velocità di quando li avrebbero mantenuti tutti. Il sistema ha ridotto il numero di volte in cui doveva recuperare dati dall'unità di archiviazione lenta di un fattore di trentadue rispetto al vecchio metodo. Sebbene la qualità del testo sia scesa leggermente — di circa il cinque per cento nello scenario di massimo risparmio di memoria — il compromesso ha permesso al modello di girare su hardware molto più piccoli e accessibili.

Lo studio ha anche rivelato un'intuizione inaspettata su come questi sistemi apprendono. I ricercatori hanno scoperto che più un modello viene addestrato senza questi vincoli di memoria, più diventa difficile forzarlo in questo schema efficiente in un secondo momento. La tendenza naturale del sistema a disperdere la propria attenzione sembra rafforzarsi nel tempo, rendendo più costoso adattarsi ai limiti di memoria in un secondo momento. Ciò suggerisce che, se vogliamo che questi modelli siano efficienti sui dispositivi quotidiani, potremmo dover insegnare loro a essere efficienti fin dall'inizio, piuttosto che cercare di correggere il problema dopo che si è già diffuso.

Questo lavoro non sostiene di aver risolto il problema per ogni possibile situazione, e i ricercatori sono stati attenti a notare che i loro test sono stati condotti su dati sintetici e modelli più piccoli. Hanno osservato che se una conversazione cambia argomento bruscamente nel mezzo, il team fisso di esperti potrebbe avere difficoltà, sebbene i loro test abbiano dimostrato che anche con un cambio di argomento, il sistema può adattarsi con una piccola penalità nella qualità. Lo studio funge da prova di concetto che, trattando il vincolo di memoria come una regola piuttosto che come un obiettivo di apprendimento, possiamo rendere questi enormi modelli molto più pratici da utilizzare. Sposta l'attenzione dalla costruzione di hardware più veloci al design di regole più intelligenti su come il sistema utilizza le proprie risorse, aprendo la porta affinché la potente intelligenza artificiale possa girare su dispositivi che attualmente sono troppo piccoli per contenerla.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →