← Nieuwste papers
💬 NLP

Building Customer Support AI Agents at 100M-User Scale: An Evaluation-Driven Framework

Dit artikel presenteert een verenigd, evaluatiegestuurd framework ontwikkeld bij Nubank dat gestructureerde context engineering, human-in-the-loop iteratie en rigoureuze LLM-judge evaluatie integreert om succesvol productie-klare klantenservice AI-agenten te implementeren over vijf domeinen voor meer dan 100 miljoen gebruikers, waarbij significante verbeteringen in tevredenheid en zelfbedieningspercentages worden bereikt terwijl een sterke correlatie tussen offline metrieken en online impact wordt aangetoond.

Oorspronkelijke auteurs: Aman Gupta, Kevin Rossell, Edesio Alcobaça, Jose Chrystian Lima Pacheco, Carolina Baptista de Lima, Shao Tang, Luiz Paulo Rabachini, Luis Moneda, Herbert Fei, Daniel Silva, Rohan Ramanath

Gepubliceerd 2026-06-09
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Aman Gupta, Kevin Rossell, Edesio Alcobaça, Jose Chrystian Lima Pacheco, Carolina Baptista de Lima, Shao Tang, Luiz Paulo Rabachini, Luis Moneda, Herbert Fei, Daniel Silva, Rohan Ramanath

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een enorme bank runt met 100 miljoen klanten. Elke dag bellen of chatten miljoenen mensen met vragen als: "Waar is mijn creditcard?" of "Waarom moet ik dit bedrag betalen?"

In het verleden had je een leger aan menselijke agenten nodig om deze vragen te beantwoorden. Maar nu wil je een super-slimme AI-robot bouwen om deze gesprekken af te handelen. Het probleem? Als de robot een fout antwoord geeft, wordt een klant boos, verliest hij vertrouwen en vertrekt hij. Je kunt niet zomaar "gokken" of de robot goed is; je moet 100% zeker zijn voordat je hem met echte mensen laat praten.

Dit artikel is een blauwdruk van Nubank (een gigantische bank) over hoe zij deze AI-robots veilig en succesvol hebben gebouwd. Hier is hoe ze het deden, simpel uitgelegd:

1. Het Probleel: Een Robot Bouwen Zonder een Crashtest

Normaal gesproken, wanneer mensen AI bouwen, schrijven ze instructies, testen het een beetje en hopen ze op het beste. De auteurs zeggen dat dit is alsof je een auto bouwt en van een klif afrijdt om te zien of de airbags werken. In de klantenservice is een crash te duur.

Ze hadden een manier nodig om de robot duizenden keren te testen in een "simulator" voordat ze zelfs maar met één echt mens lieten praten.

2. De Oplossing: De "Evaluatie-gestuurde" Fabriek

In plaats van alleen instructies te schrijven, bouwden ze een productielijn met vier stations. Denk aan het afstellen van een racewagen:

  • Station 1: De Modulaire Kit (Context Engineering)
    In plaats van één grote, rommelige instructiehandleiding voor de robot te schrijven, braken ze deze op in Lego-blokjes.

    • De Regels: Hoe de robot moet spreken (beleefd, bondig).
    • Het Playbook: Stap-voor-stap handleidingen voor specifieke problemen (bijv. "Als de kaart verloren is, doe dan stap A, en dan stap B").
    • De Tools: Een lijst met dingen die de robot daadwerkelijk kan doen (zoals een database controleren of een kaart opnieuw uitgeven).
    • Het Geheugen: Een kladblok waar de robot aantekeningen maakt van wat hij tijdens de chat heeft geleerd.
    • Waarom het belangrijk is: Als de robot de begroeting fout doet, vervang je alleen het "Begroetings-Lego blokje". Je hoeft niet de hele auto opnieuw te bouwen.
  • Station 2: De Robot-rechters (LLM-as-a-Judge)
    Hoe weet je of de robot zijn werk goed doet? Je kunt de robot niet zichzelf laten beoordelen. Daarom gebruikten ze een andere AI (de "Rechter") om de antwoorden van de eerste robot te beoordelen.

    • De Valkuil: Soms is de Rechter-AI bevooroordeeld of lui. Om dit op te lossen, gebruikten ze een speciale techniek genaamd GEPA. Stel je een coach voor die de Rechter-AI ziet een toets nakijken, beseft dat de Rechter te streng was, en het beoordelingsprotocol herschrijft om het eerlijker te maken. Ze deden dit automatisch totdat de beoordeling super consistent werd.
  • Station 3: Het Menselijke Veiligheidsnet (Inter-Rater Reliability)
    Voordat ze de AI-rechter vertrouwden, lieten ze echte mensen dezelfde antwoorden beoordelen. Ze controleerden of de mensen het met elkaar eens waren. Als de mensen in 90% van de gevallen het eens waren, wisten ze dat de test eerlijk was. Vervolgens zorgden ze ervoor dat de AI-rechter net zo goed met de mensen overeenkwam.

  • Station 4: De Test in de Echte Wereld (A/B-testen)
    Zodra de robot de tests in de simulator had doorstaan, lieten ze hem praten met een kleine groep echte klanten (zoals 1% van de gebruikers). Ze vergeleken deze robot met het oude systeem. Als de nieuwe robot klanten gelukkiger maakte, lieten ze hem met meer mensen praten.

3. De Resultaten: De Robot Wint

Ze testten dit systeem op vijf verschillende soorten problemen:

  1. Kaartlevering: "Waar is mijn kaart?"
  2. Schuldbeheer: "Hoe betaal ik mijn lening af?"
  3. Kredietlimieten: "Kan ik een hogere limiet krijgen?"
  4. Kaartbeheer: "Mijn pincode wijzigen."
  5. Productverklaring: "Wat doet deze functie?"

De Magische Cijfers:

  • Geluk: Voor de "Kaartlevering"-robot steeg het klantgeluk (gemeten via een score genaamd tNPS) met 37 punten. Dat is een enorme verbetering.
  • Zelfbediening: Meer mensen losten hun problemen op zonder een mens nodig te hebben. De "zelfbedieningsgraad" steeg met 29 punten.
  • Mens vs. Robot: In vier van de vijf gevallen was de robot bijna net zo goed als een top-expert mens (binnen enkele procentpunten). Het enige gebied waar de robot wat moeite mee had, was het zeer complexe "Schuldbeheer", wat logisch is omdat dat de moeilijkste wiskunde en empathie vereist.

4. De Belangrijkste Les: "Als je het kunt meten, kun je het oplossen"

De belangrijkste les uit het artikel is dit: De kwaliteit van je testen bepaalt hoe snel je kunt verbeteren.

Omdat ze zo'n rigoureus testingsysteem (de "simulator") hadden gebouwd, konden ze wijzigingen aanbrengen in de instructies van de robot en onmiddellijk weten of het beter of slechter werd. Ze hoefden niet weken te wachten om te zien of klanten gelukkig waren. Ze konden de robot tientallen keren verbeteren in de simulator, en toen ze hem eindelijk lanceerden, was hij al een kampioen.

Kortom: Ze bouwden niet alleen een slimme AI; ze bouwden een slim testlaboratorium voor de AI. En omdat het lab zo goed was, was de robot die ze de wereld in stuurden ongelooflijk betrouwbaar, maakte hij mensen gelukkig en was hij klaar voor 100 miljoen gebruikers.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →