← Últimos artículos
💻 computer science

VAmoS Bench: Voice Agent Simulation Bench

El artículo presenta VAmoS Bench, un nuevo marco de evaluación que mide el rendimiento de extremo a extremo de los agentes de voz en escenarios de atención al cliente financieros con estado, mediante la simulación de llamadas telefónicas realistas con elementos adversarios y calificando a los agentes según su capacidad para resolver tareas correctamente, actualizar bases de datos y mantener la seguridad sin intervención humana.

Autores originales: Joshua Meyer, Sahar Shayegan, Ritiz Tambi, Ali Khan, Sun Kim, Victor Shih, Mehdi Jamei, Andi Partovi

Publicado 2026-07-31
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Joshua Meyer, Sahar Shayegan, Ritiz Tambi, Ali Khan, Sun Kim, Victor Shih, Mehdi Jamei, Andi Partovi

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

La voz en la máquina: Una nueva forma de probar las llamadas telefónicas de IA

Imagine un mundo donde puede hablar con una computadora tal como habla con un amigo. Esto no es ciencia ficción; es el campo de crecimiento rápido de los agentes de voz. Estos son programas informáticos inteligentes que pueden escuchar su voz, entender lo que está diciendo y responderle hablando. Ya se están utilizando en bancos para ayudar con tarjetas de crédito perdidas y en clínicas para recordar citas a los pacientes. Pero construir uno es complicado. Es como construir un robot que necesita escucharlo, pensar en su pregunta, encontrar la respuesta correcta en una base de datos gigante y luego decirla, todo en un abrir y cerrar de ojos.

Durante mucho tiempo, los científicos probaron estos robots comprobando sus partes por separado. Preguntaban: "¿Qué tan bien escucha el robot?" (midiendo cuántas palabras entiende mal) o "¿Qué tan natural suena?" (midiendo si suena como un humano). Pero esto es como probar un coche comprobando solo el motor y los neumáticos, sin ver nunca si realmente puede conducir por la carretera sin chocar. La verdadera pregunta no es solo sobre las piezas, sino sobre todo el trabajo: ¿Realmente resolvió el robot el problema? En el mundo de los negocios, esto se llama "contención": ¿el ordenador gestionó la llamada por sí mismo o tuvo que rendirse y llamar a un humano? Este documento presenta una nueva forma de probar estos robots que observa el panorama completo, no solo las piezas.

La gran prueba: VAmoS Bench

Los autores de este documento, un equipo de Veris AI, se dieron cuenta de que las pruebas existentes estaban perdiendo la parte más importante de la historia. Crearon algo llamado VAmoS Bench (Banc de Simulación de Agentes de Voz). Piense en ello como un "examen de conducir" gigante y de alta tecnología para agentes de voz, pero en lugar de un coche, están probando a una cajera virtual llamada Riley.

El trabajo de Riley es gestionar problemas de tarjetas de crédito para un banco ficticio. Tiene que hacer cosas como congelar una tarjeta robada, cancelar una perdida o activar una nueva. Para probar a Riley, los investigadores no se limitaron a hacerle preguntas en una pantalla. Construyeron una simulación donde un "llamante" (un programa informático que finge ser un humano) llama realmente a Riley a través de una conexión de audio real. El llamante tiene un objetivo secreto, como "Quiero una tarjeta nueva pero no quiero demostrar quién soy" o "Perdí mi tarjeta y tengo prisa".

La prueba está configurada como un videojuego con 100 niveles diferentes (escenarios). Algunos niveles son fáciles, como un cliente normal que pregunta por el estado de una tarjeta. Otros son complicados, requiriendo que el agente realice varios pasos en el orden correcto. Y otros son "batallas de jefes" donde el llamante intenta engañar al agente, presionarla para que se salte pasos de seguridad o incluso intentar hackearla con palabras extrañas.

La magia de "Decir" frente a "Hacer"

La parte más genial de esta prueba es cómo califica a los agentes. En el pasado, una prueba podría simplemente escuchar la conversación y decir: "¡Buen trabajo! Parece que arreglaste la tarjeta". Pero VAmoS Bench es un detective. Observa dos cosas a la vez:

  1. Lo que el agente dijo (la transcripción).
  2. Lo que el agente realmente hizo (los cambios en la base de datos y las llamadas a herramientas).

Imagine a un estudiante haciendo un examen de matemáticas. Si escribe "La respuesta es 42" en el papel pero no hizo las matemáticas, saca un suspenso. Si hace las matemáticas correctamente pero escribe la respuesta incorrecta, también saca un suspenso. VAmoS Bench detecta a los agentes que están "fingiendo". Por ejemplo, un agente puede decir: "He congelado su tarjeta", pero si la comprobación del ordenador muestra que nunca envió el comando para congelar la tarjeta, la prueba lo marca como un fallo. Por el contrario, si un agente arregla la tarjeta pero accidentalmente le dice al llamante su contraseña secreta, la prueba lo marca como un fallo también, aunque la tarjeta esté arreglada.

Los resultados: ¿Quién pasó la prueba?

Los investigadores sometieron a 11 diferentes sistemas de agentes de voz a este desafío de 100 llamadas. Realizaron la prueba tres veces para cada sistema para asegurar que los resultados fueran reales. Esto fue lo que encontraron:

  • Los ganadores: Los sistemas construidos sobre Pipecat y LiveKit Agents fueron los mejores, gestionando con éxito aproximadamente el 71% y el 70,3% de las llamadas, respectivamente.
  • Los perdedores: El sistema llamado Nemotron fue el que más problemas tuvo, teniendo éxito solo en el 43% de las llamadas.
  • Las "batallas de jefes": La parte más difícil de la prueba para todos los agentes fueron los escenarios complejos. Aunque los agentes estaban bien en tareas sencillas, solo tuvieron éxito en el 52,2% de las llamadas complejas. Estas eran las llamadas que requerían múltiples pasos, como verificar a un usuario, encontrar una tarjeta específica, congelarla y luego pedir un reemplazo, todo mientras mantenían la fluidez de la conversación.
  • La parte truculenta: Los agentes fueron bastante buenos diciendo "No" a las personas que intentaban engañarlos (el grupo adversarial), teniendo éxito en el 73,4% de esas llamadas. Sin embargo, fueron terribles manteniendo los secretos cuando decían "No". Incluso cuando se negaban a ayudar a un llamante no verificado, a menudo decían accidentalmente al llamante qué información era incorrecta (como "Su dirección es incorrecta"), lo que le daba al malhechor la pista que necesitaba para intentarlo de nuevo.

Por qué esto importa (Y lo que no significa)

El documento muestra que, aunque muchos agentes de voz suenan genial, a menudo fallan en el trabajo real de resolver problemas, especialmente cuando las cosas se complican o cuando necesitan seguir un orden estricto de operaciones. El equipo descubrió que, en 27 ocasiones de entre los miles de intentos, un agente afirmó haber hecho algo (como congelar una tarjeta) pero los registros del ordenador mostraron que nunca lo hizo realmente.

Sin embargo, los autores tienen cuidado de no declarar un único "ganador" para todo el mundo. Señalan que estos resultados son específicos para este escenario bancario particular y estas 100 pruebas. Las diferencias entre los mejores ejecutores fueron pequeñas (menos del 1%), y debido a que la prueba fue una simulación, no sabemos exactamente cómo se desempeñarían con clientes humanos reales y complicados en un banco real.

En resumen, VAmoS Bench es una nueva y más estricta regla para medir los agentes de voz. Nos impide ser engañados por un robot que suena educado pero no hace nada, y resalta que el verdadero desafío no es solo hacer que el robot hable, sino asegurarse de que realmente haga lo correcto, en el orden correcto, sin revelar ningún secreto.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →