← Últimos artículos
💬 NLP

Building Customer Support AI Agents at 100M-User Scale: An Evaluation-Driven Framework

Este artículo presenta un marco unificado, impulsado por la evaluación, desarrollado en Nubank que integra ingeniería de contexto estructurada, iteración con intervención humana y una rigurosa evaluación mediante jueces de LLM para desplegar con éxito agentes de IA de atención al cliente listos para producción en cinco dominios para más de 100 millones de usuarios, logrando mejoras significativas en la satisfacción y las tasas de autoservicio al demostrar una fuerte correlación entre las métricas offline y el impacto online.

Autores originales: Aman Gupta, Kevin Rossell, Edesio Alcobaça, Jose Chrystian Lima Pacheco, Carolina Baptista de Lima, Shao Tang, Luiz Paulo Rabachini, Luis Moneda, Herbert Fei, Daniel Silva, Rohan Ramanath

Publicado 2026-06-09
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Aman Gupta, Kevin Rossell, Edesio Alcobaça, Jose Chrystian Lima Pacheco, Carolina Baptista de Lima, Shao Tang, Luiz Paulo Rabachini, Luis Moneda, Herbert Fei, Daniel Silva, Rohan Ramanath

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que diriges un banco masivo con 100 millones de clientes. Cada día, millones de personas llaman o chatean haciendo preguntas como: "¿Dónde está mi tarjeta de crédito?" o "¿Por qué debo tanto?".

En el pasado, necesitarías un ejército de agentes humanos para responder a esto. Pero ahora, quieres construir un robot de IA superinteligente para manejar estas conversaciones. El problema es que, si el robot da una respuesta incorrecta, un cliente se enoja, pierde la confianza y se va. No puedes simplemente "adivinar" si el robot es bueno; necesitas estar 100% seguro antes de dejarlo hablar con personas reales.

Este documento es un plano de Nubank (un banco gigante) sobre cómo construyeron estos robots de IA de forma segura y exitosa. Así es como lo hicieron, explicado de forma sencilla:

1. El Problema: Construir un Robot sin una Prueba de Choque

Normalmente, cuando la gente construye IA, escribe instrucciones, la prueba un poco y espera lo mejor. Los autores dicen que esto es como construir un coche y conducirlo hacia un acantilado para ver si los airbags funcionan. En el servicio de atención al cliente, un choque es demasiado costoso.

Necesitaban una forma de probar el robot miles de veces en un "simulador" antes de dejarlo hablar con un solo humano real.

2. La Solución: La Fábrica "Impulsada por la Evaluación"

En lugar de solo escribir instrucciones, construyeron una línea de producción con cuatro estaciones principales. Piensa en esto como tunear un coche de carreras:

  • Estación 1: El Kit Modular (Ingeniería de Contexto)
    En lugar de escribir un manual de instrucciones gigante y desordenado para el robot, lo dividieron en bloques de Lego.

    • Las Reglas: Cómo debe hablar el robot (educado, conciso).
    • El Playbook (Libro de Estrategia): Guías paso a paso para problemas específicos (por ejemplo, "Si la tarjeta se perdió, haz el paso A, luego el paso B").
    • Las Herramientas: Una lista de cosas que el robot realmente puede hacer (como consultar una base de datos o reemitir una tarjeta).
    • La Memoria: Un bloc de notas donde el robot anota lo que aprendió durante el chat.
    • Por qué importa: Si el robot se equivoca en el saludo, solo tienes que cambiar el "bloque de Lego del Saludo". No tienes que reconstruir todo el coche.
  • Estación 2: Los Jueces Robot (LLM-as-a-Judge)
    ¿Cómo sabes si el robot está haciendo un buen trabajo? No puedes pedirle al robot que se califique a sí mismo. Así que usaron otra IA (un "Juez") para calificar las respuestas del primer robot.

    • El inconveniente: A veces, la IA Juez es sesgada o perezosa. Para solucionar esto, usaron una técnica especial llamada GEPA. Imagina a un entrenador que observa al Juez de IA calificar un examen, se da cuenta de que el Juez fue demasiado estricto y reescribe la rúbrica de calificación para que sea más justa. Hicieron esto automáticamente hasta que la calificación se volvió súper consistente.
  • Estación 3: La Red de Seguridad Humana (Confiabilidad Inter-Evaluador)
    Antes de confiar en el Juez de IA, hicieron que humanos reales calificaran las mismas respuestas. Verificaron si los humanos estaban de acuerdo entre sí. Si los humanos estaban de acuerdo el 90% de las veces, sabían que la prueba era justa. Luego, se aseguraron de que el Juez de IA estuviera tan de acuerdo con los humanos como ellos.

  • Estación 4: La Prueba del Mundo Real (Pruebas A/B)
    Una vez que el robot pasó las pruebas del simulador, lo dejaron hablar con un pequeño grupo de clientes reales (como el 1% de los usuarios). Compararon este robot con el sistema anterior. Si el nuevo robot hacía más felices a los clientes, lo dejaron hablar con más personas.

3. Los Resultados: El Robot Gana

Probaron este sistema en cinco tipos diferentes de problemas:

  1. Entrega de Tarjeta: "¿Dónde está mi tarjeta?"
  2. Gestión de Deuda: "¿Cómo pago mi préstamo?"
  3. Límites de Crédito: "¿Puedo obtener un límite más alto?"
  4. Gestión de Tarjeta: "Cambiar mi PIN."
  5. Explicador de Producto: "¿Qué hace esta función?"

Los Números Mágicos:

  • Felicidad: Para el robot de "Entrega de Tarjeta", la felicidad del cliente (medida por una puntuación llamada tNPS) aumentó 37 puntos. Ese es un incremento masivo.
  • Autoservicio: Más personas resolvieron sus problemas sin necesidad de un humano. La "tasa de autoservicio" aumentó 29 puntos.
  • Humano vs. Robot: En cuatro de los cinco casos, el robot fue casi tan bueno como un experto humano de alto nivel (con una diferencia de pocos puntos porcentuales). El único lugar donde tuvo dificultades fue en el área de "Gestión de Deuda", que es muy compleja, lo cual tiene sentido porque es el problema de matemáticas y empatía más difícil.

4. La Gran Lección: "Si puedes medirlo, puedes arreglarlo"

La conclusión más importante del documento es esta: La calidad de tu prueba determina qué tan rápido puedes mejorar.

Debido a que construyeron un sistema de prueba tan riguroso (el "simulador"), podían hacer cambios en las instrucciones del robot y saber inmediatamente si mejoraba o empeoraba. No tenían que esperar semanas para ver si los clientes estaban felices. Podían iterar (mejorar) el robot docenas de veces en el simulador, y cuando finalmente lo lanzaron, ya era un campeón.

En resumen: No solo construyeron una IA inteligente; construyeron un laboratorio de pruebas inteligente para la IA. Y debido a que el laboratorio era tan bueno, el robot que enviaron al mundo era increíblemente confiable, generaba felicidad y estaba listo para 100 millones de usuarios.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →