← Ultimi articoli
💻 computer science

Scalable Inference Architectures for Compound AI Systems: A Production Deployment Study

Questo articolo presenta uno studio di deployment in produzione di un'architettura di inferenza modulare e agnostica rispetto alla piattaforma presso Salesforce, che abilita un servizio scalabile, economicamente efficiente e a bassa latenza di sistemi di IA composti come Agentforce e ApexGuru, ottenendo miglioramenti significativi nel throughput, nella latenza di coda e nei costi operativi, affrontando al contempo sfide uniche come il fan-out multi-modello e gli avvii a freddo a cascata.

Autori originali: Srikanta Prasad S V, Utkarsh Arora

Pubblicato 2026-04-29
📖 5 min di lettura🧠 Approfondimento

Autori originali: Srikanta Prasad S V, Utkarsh Arora

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immagina di gestire un ristorante esclusivo e affollato chiamato Agentforce. In passato, questo ristorante aveva un'unica cucina enorme (una configurazione "statica") dove un unico capo chef tentava di fare tutto: tagliare le verdure, grigliare bistecche, preparare dolci e lavare i piatti. Se il ristorante si riempiva, la cucina si intasava. Se lo chef aveva bisogno di una pausa per riposarsi (un "avvio a freddo"), l'intero ristorante smetteva di servire cibo. E, cosa peggiore di tutte, dovevi pagare lo stipendio dello chef 24 ore su 24, 7 giorni su 7, anche quando nessuno stava mangiando.

Questo documento descrive come Salesforce ha ricostruito il proprio "ristorante" per gestire i Sistemi AI Composti. Invece di una singola grande cucina, hanno costruito una rete modulare di consegne alimentari su richiesta.

Ecco come hanno fatto, spiegato in termini semplici:

1. Il Problema: La Cucina "Adatta a Tutto"

Le applicazioni AI moderne (come Agentforce o ApexGuru) sono complesse. Quando un cliente fa una domanda, il sistema non chiede a un solo robot di rispondere. È più simile a un team di specialisti che lavora insieme:

  • Specialista A (Modello di Embedding) consulta la storia del cliente.
  • Specialista B (LLM) scrive la risposta.
  • Specialista C (Esecutore SQL) controlla il database.
  • Specialista D (Classificatore) decide cosa vuole realmente il cliente.

Nella vecchia configurazione "statica", tutti questi specialisti erano bloccati nella stessa stanza sullo stesso hardware.

  • Il Collo di Bottiglia: Se lo specialista del database era lento, l'intero ordine veniva ritardato.
  • Lo Spreco: Dovevi tenere tutti gli specialisti svegli e pronti 24/7, anche se alle 3 del mattino serviva solo lo specialista che "taglia".
  • L'Incubo dell'"Avvio a Freddo": Se il ristorante chiudeva per un'ora e riapriva, ogni specialista doveva svegliarsi, stiracchiarsi e preparare i propri attrezzi. Il cliente doveva aspettare che lo specialista più lento si svegliasse prima di ricevere qualsiasi cibo.

2. La Soluzione: Una "Rete di Consegne Intelligente"

Salesforce ha costruito una nuova architettura che funziona come un servizio di consegna intelligente e dinamico.

  • Il Prendiordini (Servizio di Previsione): Quando un cliente ordina, un dispatcher intelligente non invia l'ordine a una grande cucina. Invece, spezza l'ordine in parti e lo invia agli specialisti specifici più adatti al lavoro.
  • Scalabilità Indipendente: Se 100 persone ordinano "bistecca" (chiamate LLM), il sistema assume istantaneamente 100 chef per le bistecche. Se solo 5 persone ordinano "insalata" (chiamate di embedding), ne assume solo 5. Non si contendono lo spazio nella stessa cucina.
  • Serverless (Paghi in base all'uso): Gli specialisti non siedono in un edificio in attesa di ordini. Sono "lavoratori cloud" che si presentano solo quando arriva un ordine e se ne vanno quando hanno finito. Paghi solo per i minuti in cui lavorano effettivamente.

3. Risolvere il Problema del "Risveglio" (Avvii a Freddo a Cascata)

Il documento ha scoperto un problema insidioso: in un sistema composto, gli specialisti dipendono l'uno dall'altro. Lo Specialista A deve finire prima che lo Specialista B possa iniziare.

  • Il Vecchio Modo: Se il ristorante riapre, lo Specialista A si sveglia (30 secondi), poi lo Specialista B si sveglia (150 secondi), poi lo Specialista C si sveglia (20 secondi). Il cliente aspetta 180 secondi in totale.
  • Il Nuovo Trucco del "Preriscaldamento": Il sistema è abbastanza intelligente da conoscere la ricetta. Non appena viene chiamato lo Specialista A, il sistema simultaneamente sveglia gli Specialisti B e C in background.
  • Il Risultato: Invece di aspettare 180 secondi, il cliente aspetta circa 65 secondi. Il documento afferma che questo ha ridotto il tempo di "risveglio" del 65%.

4. I Risultati: Più Veloce, Più Economico e Più Fluido

Dopo aver gestito questo nuovo sistema per oltre un anno con clienti reali, ecco cosa è successo:

  • Velocità: La "latenza di coda" (il tempo di attesa nel caso peggiore per i clienti lenti) è scesa del 50%. Gli ordini che prima richiedevano 37 secondi ora ne richiedono circa 10–11.
  • Capacità: Il sistema può gestire 3,9 volte più ordini contemporaneamente rispetto alla vecchia cucina.
  • Costo: Poiché hanno smesso di pagare per i lavoratori inattivi, hanno risparmiato il 30–40% sui costi.
  • Affidabilità: Se uno specialista si ammala (fallisce), il sistema non chiude l'intero ristorante. Instrada semplicemente l'ordine aggirando quella persona (ad esempio: "Non possiamo controllare il database, quindi diamo una risposta generica"). Il ristorante rimane aperto il 95% del tempo, anche quando alcune parti si rompono.

5. Lezioni Chiave Apprese (I "Segreti dello Chef")

Gli autori hanno condiviso alcune grandi conclusioni per chiunque stia costruendo questi sistemi:

  1. Gli avvii a freddo si moltiplicano, non si sommano semplicemente. Se hai una catena di attività, i tempi di attesa si accumulano. Devi svegliare l'intera catena tutta insieme, non una alla volta.
  2. Osserva l'intera pipeline, non solo i singoli lavoratori. Un lavoratore potrebbe essere veloce da solo, ma se è bloccato in attesa di qualcun altro, l'intero ordine è lento. Devi vedere il "quadro generale" dell'ordine.
  3. Testa i pezzi individualmente. Poiché il sistema è modulare, puoi sostituire solo lo "chef dell'insalata" con uno nuovo senza licenziare lo "chef delle bistecche". Questo permette loro di migliorare i propri modelli AI in giorni invece che in settimane.
  4. Il degrado elegante è meglio della perfezione. Se una piccola parte del sistema fallisce, l'intero sistema non dovrebbe crashare. È meglio fornire una risposta leggermente meno dettagliata che non fornire alcuna risposta.

Riepilogo

Questo documento riguarda il passaggio da una configurazione AI rigida, costosa e basata su "una sola cucina" a una rete flessibile in stile "economia dei lavoretti". Trattare ogni strumento AI come un lavoratore separato e su richiesta, che può essere scalato su o giù istantaneamente, ha reso gli agenti AI di Salesforce più veloci, più economici e molto più affidabili per migliaia di utenti aziendali.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →