← Ultimi articoli
🤖 AI

Doing More with Less: A Survey on Routing Strategies for Resource Optimisation in Large Language Model-Based Systems

Questa survey fornisce una panoramica completa delle strategie di routing nei sistemi basati su Large Language Model, analizzando come l'indirizzamento dinamico delle query verso i modelli appropriati possa ottimizzare il consumo di risorse, ridurre i costi e migliorare le prestazioni affrontando le inefficienze delle architetture monolitiche.

Autori originali: Clovis Varangot-Reille, Christophe Bouvard, Antoine Gourru, Mathieu Ciancone, Marion Schaeffer, François Jacquenet

Pubblicato 2026-07-16
📖 8 min di lettura🧠 Approfondimento

Autori originali: Clovis Varangot-Reille, Christophe Bouvard, Antoine Gourru, Mathieu Ciancone, Marion Schaeffer, François Jacquenet

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immaginate un mondo in cui, ogni volta che fate una domanda, un team di esperti corre a rispondere. Alcuni sono brillanti ma lenti e costosi, come un professore premio Nobel che si fa pagare a ore. Altri sono rapidi ed economici, come un amico esperto che può gestire la maggior parte delle cose ma potrebbe inciampare su un indovinello davvero difficile. Nel mondo dell'intelligenza artificiale, questi "esperti" sono i Large Language Models (LLM). In questo momento, la maggior parte dei sistemi informatici è costruita come un ristorante testardo che invia ogni singolo ordine, da un semplice bicchiere d'acqua a un complesso pasto di cinque portate, allo chef più costoso della cucina. Questo funziona, ma è uno spreco, è lento e consuma molta energia. La grande domanda che gli scienziati si pongono è: come possiamo costruire un "maître" più intelligente che guardi il vostro ordine e decida istantaneamente se inviarlo all'assistente veloce ed economico o al genio costoso? Questo è il cuore di un nuovo campo chiamato "routing" (instradamento), ed è tutto incentrato sul fare di più con meno.

Questo articolo, intitolato "Doing More with Less" (Fare di più con meno), è un immenso tour attraverso i diversi modi in cui i ricercatori stanno cercando di costruire quel maître intelligente. Gli autori, un team proveniente dalla Francia, non hanno solo inventato un nuovo trucco; hanno raccolto e organizzato l'intero panorama delle strategie attualmente in fase di test. Hanno scoperto che il modo migliore per risparmiare denaro ed energia non è usare un unico cervello gigante per tutto, ma creare un sistema che instradi le domande allo strumento giusto in base alla difficoltà della domanda stessa. Hanno scoperto che spesso si può usare un modello piccolo e poco costoso per i saluti semplici e riservare i modelli grandi ed costosi solo per i veri enigmi logici complessi. Tuttavia, avvertono anche che questo non è ancora una bacchetta magica. Alcuni metodi sono ottimi per risparmiare denaro ma potrebbero mancare l'obiettivo in termini di accuratezza, mentre altri sono troppo complicati da gestire nel mondo reale. L'articolo suggerisce che il futuro risiede nei sistemi "adattivi" che possono imparare e cambiare idea man mano che nuovi strumenti diventano disponibili, piuttosto che rimanere bloccati in un insieme rigido di regole.

Il Grande Problema: Lo Chef "Taglia Unica"

Pensate a un Large Language Model (LLM) come a uno chef super intelligente. Alcuni chef sono generalisti; possono cucinare quasi tutto, da un sandwich a un soufflé. Ma sono costosi da assumere e impiegano molto tempo per lavorare. Altri chef sono specialisti; forse sono incredibili nel fare la pizza ma terribili nel preparare torte.

Attualmente, la maggior parte dei sistemi di IA è come un ristorante che ignora il menù. Se chiedete un bicchiere d'acqua, il sistema chiama lo chef più costoso e potente (come GPT-4 o Claude) per farlo. Questo è un enorme spreco. Costa molto denaro, consuma un sacco di elettricità e richiede più tempo del necessario. L'articolo sostiene che abbiamo bisogno di un "router" — un cameriere intelligente — che guardi la vostra richiesta e decida: "Ehi, questa è solo una domanda semplice. Mandiamola al tirocinante veloce ed economico". Ma se fate una domanda matematica complessa, il cameriere dovrebbe dire: "Ok, questo richiede lo chef capo".

Le Tre Grandi Domande a cui l'Articolo Risponde

Gli autori scompongono il problema in tre domande semplici: Cosa dobbiamo ottimizzare? Quando dobbiamo prendere la decisione? e Come costruiamo effettivamente il router?

1. Cosa stiamo cercando di risparmiare?

Molte persone pensano che l'unica cosa che conta sia il denaro. Ma l'articolo sottolinea che dobbiamo preoccuparci anche del tempo (latenza) e dell'ambiente (energia).

  • Denaro: Ogni volta che un'IA risponde a una domanda, costa una piccola frazione di denaro per parola (token).
  • Tempo: Aspettare che un'IA potente e lenta risponda a un semplice "Ciao" è irritante.
  • Il Pianeta: I grandi modelli di IA consumano molta elettricità. Se possiamo usare un modello più piccolo per l'80% delle nostre domande, risparmiamo una quantità enorme di energia e riduciamo la nostra impronta di carbonio.

2. Quando decidiamo?

L'articolo identifica due momenti principali in cui il "cameriere" può fare una scelta:

  • Prima della generazione (Pre-generation): Il cameriere guarda la vostra domanda prima che qualcuno inizi a cucinare. Indovina: "Questa sembra un ordine per una pizza semplice", e la invia immediatamente allo chef economico. Questo è veloce e fa risparmiare denaro perché lo chef grande non viene mai coinvolto.
  • Dopo la generazione (Post-generation/Cascade): Il cameriere lascia che lo chef economico provi prima. Se la risposta sembra scadente o lo chef sembra incerto, allora il cameriere invia la domanda allo chef costoso. È come ordinare una pizza, assaggiarne una fetta e, se è bruciata, chiamare lo chef capo per farne una nuova. Questo è più sicuro ma più lento e può costare di più se lo chef economico fallisce spesso.

3. Come costruiamo il cameriere?

Questa è la parte più divertente. L'articolo recensisce decine di diversi approcci per il "cameriere", che vengono raggruppati in quattro famiglie principali:

  • Il Cameriere "Somigliante" (Basato sulla similarità): Questo cameriere tiene un album di foto delle domande passate. Se fate una domanda che somiglia a una domanda fatta la scorsa settimana, il cameriere la invia allo stesso chef che ha risposto a quella domanda. È come dire: "L'ultima volta che hai chiesto dei gatti, l'esperto di gatti è stato bravo, quindi invierò anche questa domanda sui gatti a lui".
  • Il Cameriere "Insegnante" (Supervisionato): Questo cameriere è addestrato come uno studente. Impara a riconoscere i pattern. Ad esempio, impara che le domande sulla "matematica" di solito richiedono un modello specializzato in matematica, e le domande sulle "barzellette" richiedono un modello creativo. È come uno studente che ha memorizzato un libro di testo su "Quale chef gestisce quale piatto".
  • Il Cameriere "Giocatore d'azzardo" (Reinforcement Learning): Questo cameriere impara per tentativi ed errori, come un personaggio di un videogioco. Prova diversi chef, vede se la risposta è stata buona e riceve un "premio" se ha risparmiato denaro e ottenuto una buona risposta. Col tempo, impara la strategia migliore senza bisogno di un libro di testo.
  • Il Cameriere "Auto-riflessivo" (Generativo): Qui l'IA parla con se stessa. Il cameriere chiede allo chef economico: "Sei sicuro di poter rispondere a questo?". Se lo chef dice: "Non ne sono sicuro", il cameriere invia immediatamente la domanda allo chef grande. È come chiedere a un amico: "Lo sai questo?", e se esita, chiami l'esperto.

Ciò che l'Articolo Esclude (La lista dei "Non disturbare")

Gli autori sono molto chiari su ciò che non conta come una buona strategia di routing. Dicono esplicitamente che il semplice fatto di raccogliere le risposte da cinque chef diversi e scegliere la migliore (metodi chiamati "ensemble") non è la stessa cosa del routing. È come ordinare cinque pizze e buttare via quelle cattive; è troppo costoso. L'obiettivo è scegliere lo chef giusto prima di iniziare a cucinare, non cucinare tutto e poi scegliere.

Notano anche che alcuni metodi, come chiedere all'IA di indovinare la propria fiducia, possono essere complicati. A volte l'IA è eccessivamente sicura di sé e dice: "Lo so!", quando in realtà non lo sa. Questo può portare a risposte errate se il sistema si fida dello chef sbagliato.

Il Verdetto: È Promettente, Ma Non Perfetto

L'articolo conclude che il routing è uno strumento potente, ma non è ancora un mistero risolto.

  • Funziona: In molti test, un routing intelligente può tagliare i costi anche della metà o più, mantenendo le risposte altrettanto buone rispetto all'uso dei modelli grandi.
  • È complicato: La migliore strategia dipende dalla situazione. A volte un approccio "somigliante" funziona meglio; altre volte un approccio "insegnante" è preferibile.
  • Il futuro: Gli autori suggeriscono che il prossimo grande passo sia rendere questi router "adattivi". Attualmente, se aggiungete un nuovo chef in cucina, dovete spesso riaddestrare l'intero sistema del cameriere. L'obiettivo futuro è un cameriere che possa capire istantaneamente le abilità di un nuovo chef e iniziare a usarlo immediatamente, senza bisogno di un lungo periodo di addestramento.

In breve, questo articolo è una guida per costruire sistemi di IA più intelligenti, economici e rispettosi per il pianeta. Ci dice che non abbiamo bisogno di usare un martello pneumatico per rompere una noce. Costruendo un sistema intelligente che sappia quando usare un piccolo martello e quando usarne uno grande, possiamo rendere l'IA più veloce, più economica e migliore per il pianeta.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →