← Ultimi articoli
🤖 AI

Towards Multi-Model LLM Schedulers: Empirical Insights into Offloading and Preemption

Questo articolo presenta uno studio empirico che rivela come lo scheduling di LLM multi-modello su hardware eterogeneo subisca un significativo degrado delle prestazioni, dipendente dal modello, dovuto allo scaricamento CPU-GPU e a un sostanziale sovraccarico di preemption guidato dal ricaricamento dello stato, individuando così fattori critici per la progettazione di schedulatori efficienti di prossima generazione.

Autori originali: Mert Yildiz, Pietro Spadaccino, Alexey Rolich, Francesca Cuomo, Andrea Baiocchi

Pubblicato 2026-05-20
📖 5 min di lettura🧠 Approfondimento

Autori originali: Mert Yildiz, Pietro Spadaccino, Alexey Rolich, Francesca Cuomo, Andrea Baiocchi

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immagina di gestire una cucina affollata (un server informatico) con alcuni chef super-veloci (GPU) e un assistente della dispensa più lento, ma molto spazioso (la CPU). Il tuo obiettivo è cucinare molti tipi diversi di piatti complessi (Large Language Models o LLM) contemporaneamente. A volte, la cucina diventa così affollata che gli chef veloci rimangono senza spazio sul bancone, quindi devi chiedere all'assistente della dispensa di aiutare a tenere alcuni ingredienti o addirittura a fare parte del tritamento.

Questo articolo è come uno studio dettagliato di ciò che accade quando si cerca di dividere il lavoro di cucina tra gli chef veloci e l'assistente lento, o quando si deve improvvisamente fermare un piatto per cucinarne uno più urgente.

Ecco le principali scoperte dello studio, spiegate in modo semplice:

1. Il problema del "mezzo chef" (Offloading)

Quando un piatto è troppo grande per il bancone dello chef, si spostano alcuni passaggi della ricetta all'assistente della dispensa.

  • La scoperta: Non è un compromesso fluido. Se si sposta solo un po' di lavoro all'assistente lento, la velocità di cottura non diminuisce leggermente; crolla drasticamente.
  • L'analogia: Pensala come una staffetta. Se il corridore veloce (GPU) deve passare il testimone a un camminatore lento (CPU) anche per una piccolissima parte della gara, l'intera squadra rallenta in modo drammatico.
  • La sorpresa: I piatti piccoli (modelli AI più piccoli) soffrono di più. Se si tenta di scaricare anche una piccola parte di un modello piccolo, diventa molto lento. I piatti più grandi (modelli più grandi) gestiscono la divisione meglio, rallentando in modo più graduale.
  • La lezione: Non puoi semplicemente indovinare quanto lavoro dare alla CPU. Devi sapere esattamente quale "piatto" stai cucinando, perché alcuni modelli odiano essere divisi più di altri.

2. Il "costo di cambio" (Preemption)

A volte, un cliente VIP ordina un nuovo piatto e devi fermare lo chef attuale, liberare la sua postazione e iniziare il nuovo. Questo si chiama "preemption" (interruzione).

  • La scoperta: Il tempo necessario per cambiare piatto è quasi lo stesso sia che tu fermi il piatto corrente dopo 1 minuto sia dopo 1 ora.
  • L'analogia: Immagina di dipingere un enorme murale. Se devi fermarti per permettere a qualcun altro di dipingere, il tempo necessario per pulire i tuoi pennelli e preparare quelli del nuovo pittore è lo stesso, sia che tu abbia dipinto 3 metri che 300 metri. Il tempo passato a dipingere non conta; il tempo necessario per cambiare è fisso.
  • La grande rivelazione: La maggior parte delle persone pensava che il tempo speso a spostare le "note" (la memoria di ciò che era già stato dipinto, chiamata cache KV) fosse la parte lenta. Lo studio ha scoperto che spostare le note è in realtà istantaneo (meno dell'1% del tempo). Il vero spreco di tempo è disimballare gli attrezzi dello chef vecchio e disimballare gli attrezzi dello chef nuovo (caricare i pesi del modello dall'hard disk).
  • La lezione: Cambiare attività è costoso, ma il costo è prevedibile. Dipende interamente da quanto è pesante il "kit degli attrezzi" (la dimensione del modello), non da quanto tempo è durata l'attività.

3. Il "traffico" (Movimento dei dati)

Quando si spostano cose tra lo chef veloce e l'assistente lento, devono attraversare un corridoio (il cavo dati).

  • La scoperta: Anche quando le "note" (memoria) diventano enormi perché il piatto è molto lungo, spostarle è comunque super veloce rispetto a disimballare gli attrezzi.
  • L'analogia: È come spostare un singolo foglio di carta rispetto a spostare un'intera libreria. Spostare il foglio (le note) è così veloce che quasi non conta. Spostare la libreria (gli attrezzi del modello) richiede un'eternità.
  • La lezione: Non preoccuparti troppo della dimensione delle "note" quando decidi di cambiare attività. Preoccupati della dimensione della "libreria".

4. La "personalità dell'hardware"

Lo studio ha testato due diversi tipi di cucine (due diverse GPU).

  • La scoperta: Una cucina era più veloce a cucinare ma più lenta a cambiare attività rispetto all'altra.
  • L'analogia: Una cucina ha uno chef super-veloce ma un corridoio stretto, rendendo difficile scambiare gli attrezzi rapidamente. L'altra ha uno chef leggermente più lento ma un corridoio ampio, rendendo gli scambi più facili.
  • La lezione: Non puoi usare una regola "taglia unica". Il modo migliore per pianificare le attività dipende esattamente dall'hardware che possiedi.

Riepilogo per il futuro

Gli autori concludono che la prossima generazione di "Manager di Cucina" (scheduler) deve essere più intelligente. Non dovrebbero guardare solo quanti ordini ci sono nella coda. Devono sapere:

  1. Di quale modello si tratta? (Alcuni odiano essere divisi).
  2. Quanto è grande il kit degli attrezzi? (Questo determina quanto dura un cambio).
  3. Che tipo di cucina è questa? (Hardware diverso cambia le regole).

Comprendendo queste peculiarità specifiche, i manager possono smettere di cercare di forzare un chiodo quadrato in un buco rotondo e invece creare un sistema che esegue molti modelli AI diversi in modo efficiente senza far crollare la cucina.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →