← Ultimi articoli
💬 NLP

Building Customer Support AI Agents at 100M-User Scale: An Evaluation-Driven Framework

Questo articolo presenta un framework unificato e guidato dalla valutazione sviluppato presso Nubank che integra l'ingegneria del contesto strutturato, l'iterazione con l'intervento umano e una rigorosa valutazione tramite LLM judge per implementare con successo agenti AI di assistenza clienti pronti per la produzione in cinque domini per oltre 100 milioni di utenti, ottenendo miglioramenti significativi nella soddisfazione e nei tassi di self-service pur dimostrando una forte correlazione tra le metriche offline e l'impatto online.

Autori originali: Aman Gupta, Kevin Rossell, Edesio Alcobaça, Jose Chrystian Lima Pacheco, Carolina Baptista de Lima, Shao Tang, Luiz Paulo Rabachini, Luis Moneda, Herbert Fei, Daniel Silva, Rohan Ramanath

Pubblicato 2026-06-09
📖 5 min di lettura🧠 Approfondimento

Autori originali: Aman Gupta, Kevin Rossell, Edesio Alcobaça, Jose Chrystian Lima Pacheco, Carolina Baptista de Lima, Shao Tang, Luiz Paulo Rabachini, Luis Moneda, Herbert Fei, Daniel Silva, Rohan Ramanath

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immagina di gestire una banca enorme con 100 milioni di clienti. Ogni giorno, milioni di persone chiamano o scrivono in chat per chiedere cose come: "Dove si trova la mia carta di credito?" o "Perché devo questa cifra?".

In passato, avresti avuto bisogno di un esercito di agenti umani per rispondere a queste domande. Ma ora, vuoi costruire un robot IA super intelligente che gestisca queste conversazioni. Il problema? Se il robot dà una risposta errata, un cliente si arrabbia, perde fiducia e se ne va. Non puoi semplicemente "indovinare" se il robot è bravo; devi esserne sicuro al 100% prima di lasciarlo parlare con persone reali.

Questo documento è un progetto di Nubank (una banca gigante) su come hanno costruito questi robot IA in modo sicuro e di successo. Ecco come ci sono riusciti, spiegato in modo semplice:

1. Il Problema: Costruire un Robot Senza un Crash Test

Di solito, quando le persone costruiscono l'IA, scrivono delle istruzioni, la testano un po' e sperano nel meglio. Gli autori dicono che questo è come costruire un'auto e guidarla giù da un dirupo per vedere se gli airbag funzionano. Nel supporto clienti, un incidente è troppo costoso.

Avevano bisogno di un modo per testare il robot migliaiz di volte in un "simulatore" prima di lasciarlo parlare con un singolo essere umano reale.

2. La Soluzione: La Fabbrica "Guidata dalla Valutazione"

Inveve di scrivere solo istruzioni, hanno costruito una linea di produzione con quattro stazioni principali. Immaginalo come la calibrazione di un'auto da corsa:

  • Stazione 1: Il Kit Modulare (Context Engineering)
    Inveve di scrivere un unico manuale di istruzioni gigante e disordinato per il robot, lo hanno suddiviso in blocchi Lego.

    • Le Regole: Come deve parlare il robot (educato, conciso).
    • Il Playbook: Guide passo dopo passo per problemi specifici (es. "Se la carta è persa, fai il passaggio A, poi il passaggio B").
    • Gli Strumenti: Un elenco di cose che il robot può effettivamente fare (come controllare un database o riemettere una carta).
    • La Memoria: Un blocco note dove il robot annota ciò che ha imparato durante la chat.
    • Perché è importante: Se il robot sbaglia il saluto, devi solo sostituire il "blocco Lego del Saluto". Non devi ricostruire l'intera auto.
  • Stazione 2: I Giudici Robot (LLM-as-a-Judge)
    Come fai a sapere se il robot sta facendo un buon lavoro? Non puoi chiedere al robot di dare un voto a se stesso. Quindi, hanno usato un'altra IA (un "Giudice") per valutare le risposte del primo robot.

    • L'imprevisto: A volte l'IA Giudice è influenzata da pregiudizi o pigra. Per risolvere questo, hanno usato una tecnica speciale chiamata GEPA. Immagina un coach che osserva l'IA Giudice mentre valuta un test, si rende conto che il Giudice è stato troppo severo e riscrive la griglia di valutazione per renderla più equa. Hanno fatto questo automaticamente finché la valutazione non è diventata super costante.
  • Stazione 3: La Rete di Sicurezza Umana (Inter-Rater Reliability)
    Prima di fidarsi dell'IA Giudice, hanno fatto in modo che persone reali valutassero le stesse risposte. Hanno controllato se gli umani concordavano tra loro. Se gli umani concordavano il 90% delle volte, sapevano che il test era equo. Poi, hanno fatto in modo che l'IA Giudice concordasse con gli umani tanto quanto loro.

  • Stazione 4: Il Test nel Mondo Reale (A/B Testing)
    Una volta che il robot ha superato i test nel simulatore, lo hanno lasciato parlare con un piccolo gruppo di clienti reali (come l'1% degli utenti). Hanno confrontato questo robot con il vecchio sistema. Se il nuovo robot rendeva i clienti più felici, lo hanno lasciato parlare con più persone.

3. I Risultati: Il Robot Vince

Hanno testato questo sistema su cinque diversi tipi di problemi:

  1. Consegna della Carta: "Dove si trova la mia carta?"
  2. Gestione del Debito: "Come faccio a pagare il mio prestito?"
  3. Limiti di Credito: "Posso avere un limite più alto?"
  4. Gestione della Carta: "Cambiare il mio PIN."
  5. Spiegazione del Prodotto: "Che cosa fa questa funzione?"

I Numeri Magici:

  • Felicità: Per il robot "Consegna della Carta", la felicità del cliente (misurata con un punteggio chiamato tNPS) è salita di 37 punti. Questo è un miglioramento enorme.
  • Self-Service: Più persone hanno risolto i propri problemi senza bisogno di un essere umano. Il "tasso di self-service" è aumentato di 29 punti.
  • Umano vs Robot: In quattro casi su cinque, il robot era quasi bravo quanto un esperto umano di alto livello (con uno scarto di pochi punti percentuali). L'unico ambito in cui ha faticato un po' è stato il "Gestione del Debito", che è molto complesso, il che ha senso perché si tratta di matematica difficile ed empatia.

4. La Grande Lezione: "Se puoi misurarlo, puoi correggerlo"

La lezione più importante del documento è questa: la qualità del tuo testing determina la velocità con cui puoi migliorare.

Poiché hanno costruito un sistema di test così rigoroso (il "simulatore"), potevano apportare modifiche alle istruzioni del robot e sapere immediatamente se miglioravano o peggioravano. Non dovevano aspettare settimane per vedere se i clienti erano felici. Potevano iterare (migliorare) il robot decine di volte nel simulatore, e quando finalmente lo lanciavano, era già un campione.

In breve: Non hanno solo costruito un'IA intelligente; hanno costruito un laboratorio di test intelligente per l'IA. E poiché il laboratorio era così buono, il robot che hanno mandato nel mondo era incredibilmente affidabile, capace di rendere felici le persone e pronto per 100 milioni di utenti.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →