Building Customer Support AI Agents at 100M-User Scale: An Evaluation-Driven Framework
Ce document présente un cadre unifié, piloté par l'évaluation, développé chez Nubank, qui intègre l'ingénierie de contexte structurée, l'itération avec intervention humaine et une évaluation rigoureuse par des juges LLM pour déployer avec succès des agents d'IA de support client prêts pour la production dans cinq domaines pour plus de 100 millions d'utilisateurs, atteignant des améliorations significatives du taux de satisfaction et d'auto-assistance tout en démontrant une forte corrélation entre les métriques hors ligne et l'impact en ligne.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous dirigez une banque massive possédant 100 millions de clients. Chaque jour, des millions de personnes appellent ou discutent par chat pour poser des questions telles que : « Où est ma carte de crédit ? » ou « Pourquoi dois-je cette somme ? ».
Par le passé, il vous aurait fallu une armée d'agents humains pour répondre à cela. Mais aujourd'hui, vous voulez construire un robot d'IA super intelligent pour gérer ces conversations. Le problème ? Si le robot donne une mauvaise réponse, un client se met en colère, perd confiance et s'en va. Vous ne pouvez pas simplement « deviner » si le robot est bon ; vous devez en être sûr à 100 % avant de le laisser parler à de vraies personnes.
Ce document est un plan directeur de Nubank (une banque géante) sur la façon dont ils ont construit ces robots d'IA de manière sûre et réussie. Voici comment ils ont fait, expliqué simplement :
1. Le Problème : Construire un robot sans test de collision
Habituellement, quand les gens construisent une IA, ils écrivent des instructions, la testent un peu, et espèrent que tout se passera bien. Les auteurs disent que c'est comme construire une voiture et la conduire dans le vide pour voir si les airbags fonctionnent. Dans le service client, un accident est trop coûteux.
Ils avaient besoin d'un moyen de tester le robot des milliers de fois dans un « simulateur » avant de le laisser parler à un seul véritable humain.
2. La Solution : L'usine « pilotée par l'évaluation »
Au lieu de simplement écrire des instructions, ils ont construit une ligne de production avec quatre stations. Voyez cela comme le réglage d'une voiture de course :
Station 1 : Le kit modulaire (Ingénierie du contexte)
Au lieu d'écrire un manuel d'instructions unique et désordonné pour le robot, ils l'ont décomposé en blocs de type Lego.- Les Règles : Comment le robot doit parler (poli, concis).
- Le Playbook : Des guides étape par étape pour des problèmes spécifiques (ex : « Si la carte est perdue, faites l'étape A, puis l'étape B »).
- Les Outils : Une liste de ce que le robot peut réellement faire (comme consulter une base de données ou réémettre une carte).
- La Mémoire : Un bloc-notes où le robot écrit ce qu'il a appris pendant la discussion.
- Pourquoi c'est important : Si le robot se trompe dans sa salutation, vous n'avez qu'à remplacer le « bloc Lego de la Salutation ». Vous n'avez pas besoin de reconstruire toute la voiture.
Station 2 : Les juges robots (LLM-as-a-Judge)
Comment savoir si le robot fait du bon travail ? Vous ne pouvez pas demander au robot de s'auto-évaluer. Ils ont donc utilisé une autre IA (un « Juge ») pour noter les réponses du premier robot.- Le Piège : Parfois, l'IA Juge est biaisée ou paresseuse. Pour corriger cela, ils ont utilisé une technique spéciale appelée GEPA. Imaginez un entraîneur qui regarde l'IA Juge noter un examen, réalise que le Juge a été trop sévère, et réécrit la grille de notation pour être plus juste. Ils ont fait cela automatiquement jusqu'à ce que la notation devienne super cohérente.
Station 3 : Le filet de sécurité humain (Fiabilité inter-évaluateurs)
Avant de faire confiance au Juge IA, des humains réels ont noté les mêmes réponses. Ils ont vérifié si les humains étaient d'accord entre eux. Si les humains étaient d'accord 90 % du temps, ils savaient que le test était équitable. Ensuite, ils se sont assurés que le Juge IA était aussi en accord avec les humains.Station 4 : Le test en conditions réelles (Tests A/B)
Une fois que le robot a passé les tests du simulateur, ils l'ont laissé parler à un petit groupe de vrais clients (comme 1 % des utilisateurs). Ils ont comparé ce robot à l'ancien système. Si le nouveau robot rendait les clients plus heureux, ils le laissaient parler à plus de personnes.
3. Les Résultats : Le robot gagne
Ils ont testé ce système sur cinq types de problèmes différents :
- Livraison de carte : « Où est ma carte ? »
- Gestion de la dette : « Comment puis-je rembourser mon prêt ? »
- Limites de crédit : « Puis-je obtenir une limite plus élevée ? »
- Gestion de la carte : « Changer mon code PIN. »
- Explication de produit : « Que fait cette fonctionnalité ? »
Les chiffres magiques :
- Bonheur : Pour le robot de « Livraison de carte », le bonheur des clients (mesuré par un score appelé tNPS) a bondi de 37 points. C'est une amélioration massive.
- Self-Service : Plus de personnes ont résolu leurs problèmes sans avoir besoin d'un humain. Le « taux de self-service » a augmenté de 29 points.
- Humain vs Robot : Dans quatre cas sur cinq, le robot était presque aussi bon qu'un expert humain de haut niveau (à quelques points de pourcentage près). Le seul domaine où il a un peu peiné est la « Gestion de la dette », très complexe, ce qui est logique car cela implique des calculs difficiles et de l'empathie.
4. La Grande Leçon : « Si vous pouvez le mesurer, vous pouvez le réparer »
La conclusion la plus importante de l'article est la suivante : la qualité de votre test détermine la vitesse à laquelle vous pouvez progresser.
Parce qu'ils ont construit un système de test si rigoureux (le « simulateur »), ils pouvaient modifier les instructions du robot et savoir immédiatement s'il s'était amélioré ou dégradé. Ils n'avaient pas besoin d'attendre des semaines pour voir si les clients étaient heureux. Ils pouvaient faire itérer (améliorer) le robot des dizaines de fois dans le simulateur, et lorsqu'ils l'ont enfin lancé, il était déjà un champion.
En bref : Ils n'ont pas seulement construit une IA intelligente ; ils ont construit un laboratoire de test intelligent pour l'IA. Et parce que le laboratoire était si performant, le robot qu'ils ont envoyé dans le monde était incroyablement fiable, apportait de la satisfaction et était prêt pour 100 millions d'utilisateurs.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.