Building Customer Support AI Agents at 100M-User Scale: An Evaluation-Driven Framework
Este artigo apresenta um framework unificado e orientado por avaliação desenvolvido no Nubank que integra engenharia de contexto estruturada, iteração com intervenção humana (human-in-the-loop) e avaliação rigorosa por juiz de LLM para implantar com sucesso agentes de IA de atendimento ao cliente prontos para produção em cinco domínios para mais de 100 milhões de usuários, alcançando melhorias significativas na satisfação e nas taxas de autoatendimento, ao mesmo tempo em que demonstra uma forte correlação entre métricas offline e impacto online.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine que você administra um banco gigantesco com 100 milhões de clientes. Todos os dias, milhões de pessoas ligam ou mandam mensagens perguntando coisas como: "Onde está o meu cartão de crédito?" ou "Por que eu devo esse valor?".
No passado, você precisaria de um exército de agentes humanos para responder a isso. Mas agora, você quer construir um robô de IA superinteligente para lidar com essas conversas. O problema? Se o robô der uma resposta errada, um cliente fica irritado, perde a confiança e vai embora. Você não pode simplesmente "adivinhar" se o robô é bom; você precisa ter 100% de certeza antes de deixá-lo falar com pessoas reais.
Este artigo é um roteiro da Nubank (um banco gigante) sobre como eles construíram esses robôs de IA de forma segura e bem-sucedida. Aqui está como eles fizeram isso, explicado de forma simples:
1. O Problema: Construindo um Robô Sem um Teste de Colisão
Normalmente, quando as pessoas constroem IA, elas escrevem instruções, testam um pouco e esperam pelo melhor. Os autores dizem que isso é como construir um carro e dirigí-lo para fora de um penhasco para ver se os airbags funcionam. No atendimento ao cliente, um acidente é caro demais.
Eles precisavam de uma maneira de testar o robô milhares de vezes em um "simulador" antes de deixá-lo falar com um único humano real.
2. A Solução: A Fábrica "Orientada pela Avaliação"
Em vez de apenas escrever instruções, eles construíram uma linha de produção com quatro estações principais. Pense nisso como ajustar um carro de corrida:
Estação 1: O Kit Modular (Engenharia de Contexto)
Em vez de escrever um manual de instruções gigante e bagunçado para o robô, eles o dividiram em blocos de Lego.- As Regras: Como o robô deve falar (educado, conciso).
- O Playbook: Guias passo a passo para problemas específicos (ex: "Se o cartão estiver perdido, faça o passo A, depois o passo B").
- As Ferramentas: Uma lista de coisas que o robô realmente pode fazer (como consultar um banco de dados ou reemitir um cartão).
- A Memória: Um bloco de notas onde o robô escreve o que aprendeu durante a conversa.
- Por que isso importa: Se o robô errar a saudação, você só troca o "bloco de Lego da Saudação". Você não precisa reconstruir o carro inteiro.
Estação 2: Os Juízes Robôs (LLM-as-a-Judge)
Como você sabe se o robô está fazendo um bom trabalho? Você não pode pedir para o próprio robô se avaliar. Então, eles usaram outra IA (um "Juiz") para dar notas às respostas do primeiro robô.- O Detalhe: Às vezes, a IA Juiz é tendenciosa ou preguiçosa. Para corrigir isso, eles usaram uma técnica especial chamada GEPA. Imagine um treinador que observa a IA Juiz dando nota a uma prova, percebe que o Juiz foi rigoroso demais e reescreve a regra de avaliação para ser mais justa. Eles fizeram isso automaticamente até que a avaliação se tornasse super consistente.
Estação 3: A Rede de Segurança Humana (Confiabilidade Inter-Avaliador)
Antes de confiar no Juiz de IA, eles fizeram humanos reais avaliarem as mesmas respostas. Eles verificaram se os humanos concordavam entre si. Se os humanos concordassem 90% das vezes, eles sabiam que o teste era justo. Então, garantiram que o Juiz de IA concordasse com os humanos tanto quanto eles.Estação 4: O Teste no Mundo Real (Teste A/B)
Assim que o robô passava nos testes do simulador, eles o deixavam conversar com um pequeno grupo de clientes reais (como 1% dos usuários). Eles comparavam este robô com o sistema antigo. Se o novo robô deixasse os clientes mais felizes, eles o deixavam falar com mais pessoas.
3. Os Resultados: O Robô Vence
Eles testaram este sistema em cinco tipos diferentes de problemas:
- Entrega de Cartão: "Onde está meu cartão?"
- Gestão de Dívidas: "Como eu pago meu empréstimo?"
- Limites de Crédito: "Posso conseguir um limite maior?"
- Gestão de Cartão: "Alterar meu PIN."
- Explicador de Produto: "O que este recurso faz?"
Os Números Mágicos:
- Felicidade: Para o robô de "Entrega de Cartão", a felicidade do cliente (medida por uma pontuação chamada tNPS) saltou 37 pontos. Isso é uma melhoria massiva.
- Autoatendimento: Mais pessoas resolveram seus problemas sem precisar de um humano. A "taxa de autoatendimento" subiu 29 pontos.
- Humano vs. Robô: Em quatro de cinco casos, o robô foi quase tão bom quanto um especialista humano de alto nível (dentro de alguns pontos percentuais). O único lugar onde ele teve um pouco de dificuldade foi na área de "Gestão de Dívidas", que é muito complexa, envolvendo matemática difícil e empatia, o que faz sentido.
4. A Grande Lição: "Se você consegue medir, você consegue consertar"
O aprendizado mais importante do artigo é este: A qualidade do seu teste determina a velocidade com que você pode melhorar.
Porque eles construíram um sistema de teste tão rigoroso (o "simulador"), eles podiam fazer mudanças nas instruções do robô e saber imediatamente se ele melhorou ou piorou. Eles não precisavam esperar semanas para ver se os clientes estavam felizes. Eles podiam iterar (melhorar) o robô dezenas de vezes no simulador e, quando finalmente o lançaram, ele já era um campeão.
Em resumo: Eles não construíram apenas uma IA inteligente; eles construíram um laboratório de testes inteligente para a IA. E porque o laboratório era tão bom, o robô que eles enviaram para o mundo era incrivelmente confiável, trazia felicidade e estava pronto para 100 milhões de usuários.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.