← Nieuwste papers
💻 computer science

VAmoS Bench: Voice Agent Simulation Bench

Het artikel introduceert VAmoS Bench, een nieuw evaluatiekader dat de end-to-end prestaties van voice-agents in stateful, financiële klantenservice-scenario's meet door realistische telefoongesprekken met adversariële elementen te simuleren en agents te beoordelen op basis van hun vermogen om taken correct af te ronden, databases bij te werken en de veiligheid te handhaven zonder menselijke tussenkomst.

Oorspronkelijke auteurs: Joshua Meyer, Sahar Shayegan, Ritiz Tambi, Ali Khan, Sun Kim, Victor Shih, Mehdi Jamei, Andi Partovi

Gepubliceerd 2026-07-31
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Joshua Meyer, Sahar Shayegan, Ritiz Tambi, Ali Khan, Sun Kim, Victor Shih, Mehdi Jamei, Andi Partovi

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

De Stem in de Machine: Een Nieuwe Manier om AI-Telefoongesprekken te Testen

Stel je een wereld voor waarin je met een computer kunt praten precies zoals je met een vriend praat. Dit is geen sciencefiction; het is het snelgroeiende vakgebied van voice agents (stemagenten). Dit zijn slimme computerprogramma's die je stem kunnen horen, begrijpen wat je zegt en tegen je terug kunnen praten. Ze worden al gebruikt bij banken om te helpen met verloren creditcards en in klinieken om patiënten te herinneren aan afspraken. Maar het bouwen van een van deze agenten is lastig. Het is alsoal het bouwen van een robot die je moet horen, over je vraag moet nadenken, het juiste antwoord in een enorme database moet vinden en het vervolgens tegen je moet uitspreken, alles in de oogwenk.

Lange tijd hebben wetenschappers deze robots getest door hun onderdelen afzonderlijk te controleren. Ze vroegen: "Hoe goed hoort de robot?" (het meten van hoeveel woorden het fout heeft) of "Hoe natuurlijk klinkt het?" (meten of het als een mens klinkt). Maar dit is alsof je een auto test door alleen de motor en de banden te controleren, zonder ooit te kijken of de auto daadwerkelijk over de weg kan rijden zonder te crashen. De echte vraag gaat niet alleen over de onderdelen; het gaat over de hele taak: Heeft de robot het probleem daadwerkelijk opgelost? In de zakenwereld wordt dit "containment" genoemd—heeft de computer het gesprek zelfstandig afgehandeld, of moest hij het overdragen aan een mens? Dit artikel introduceert een nieuwe manier om deze robots te testen die naar het hele plaatje kijdt, en niet alleen naar de losse stukjes.

De Grote Test: VAmoS Bench

De auteurs van dit artikel, een team van Veris AI, realiseerden zich dat bestaande tests het belangrijkste deel van het verhaal misten. Ze creëerden iets genaamd VAmoS Bench (Voice Agent Simulation Bench). Denk aan een gigantische, hoogtechnologische "rijproef" voor voice agents, maar in plaats van een auto testen ze een virtuele bankmedewerker genaamd Riley.

Riley's taak is om creditcardproblemen af te handelen voor een fictieve bank. Ze moet dingen doen zoals een gestolen kaart blokkeren, een verloren kaart annuleren of een nieuwe kaart activeren. Om Riley te testen, vroegen de onderzoekers haar niet alleen om vragen op een scherm te beantwoorden. Ze bouwden een simulatie waarbij een "beller" (een computerprogramma dat een mens simuleert) Riley daadwerkelijk belt via een echte audioverbinding. De beller heeft een geheim doel, zoals: "Ik wil een nieuwe kaart, maar ik wil mijn identiteit niet bewijzen," of "Ik ben mijn kaart verloren en ik heb haast."

De test is opgezet als een videogame met 100 verschillende niveaus (scenario's). Sommige niveaus zijn makkelijk, zoals een normale klant die naar de status van een kaart vraagt. Sommige zijn lastig en vereisen dat de agent meerdere stappen in de juiste volgorde uitvoert. En sommige zijn "baasgevechten" waarbij de beller probeert de agent te misleiden, haar onder druk te zetten om veiligheidsstappen over te slaan, of zelfs probeert haar te hacken met vreemde woorden.

De Magie van "Zeggen" versus "Doen"

Het coolste deel van deze test is hoe de agenten worden beoordeeld. In het verleden zou een test misschien alleen naar het gesprek luisteren en zeggen: "Goed gedaan! Je klonk alsof je de kaart hebt geregeld." Maar VAmoS Bench is een detective. Het kijkt naar twee dingen tegelijk:

  1. Wat de agent zei (het transcript).
  2. Wat de agent daadwerkelijk deed (de wijzigingen in de database en de tool-aanroepen).

Stel je een student voor die een wiskundetoets maakt. Als ze op het papier schrijven "Het antwoord is 42" maar de wiskunde er niet echt voor hebben gedaan, krijgen ze een onvoldoel. Als ze de wiskunde wel correct uitvoeren maar het verkeerde antwoord opschrijven, krijgen ze ook een onvoldoel. VAmoS Bench vangt agenten die "doen alsof". Bijvoorbeeld, een agent kan zeggen: "Ik heb uw kaart geblokkeerd," maar als de computercontrole laat zien dat de opdracht om de kaart te blokkeren nooit is verzonden, markeert de test dit als een falen. Omgekeerd, als een agent de kaart weliswaar blokkeert maar per ongeluk het geheime wachtwoord van de beller doorgeeft, markeert de test dit ook als een falen, ook al is de kaart wel geblokkeerd.

De Resultaten: Wie is geslaagd voor de test?

De onderzoekers lieten 11 verschillende voice agent-systemen door deze gauntlet van 100 gesprekken gaan. Ze voerden de test drie keer uit voor elk systeem om er zeker van te zijn dat de resultaten echt waren. Dit is wat ze vonden:

  • De Winnaars: De systemen gebouwd op Pipecat en LiveKit Agents presteerden het best en handhaafden respectievelijk ongeveer 71% en 70,3% van de gesprekken succesvol.
  • De Verliezers: Het systeem genaamd Nemotron had de meeste moeite en slaagde slechts in 43% van de gesprekken.
  • De "Baasgevechten": Het moeilijkste deel van de test voor elke enkele agent waren de complexe scenario's. Hoewel de agenten oké waren bij eenvoudige taken, slaagden ze slechts in 52,2% van de complexe gesprekken. Dit waren de gesprekken die meerdere stappen vereisten, zoals het controleren van een gebruiker, het vinden van een specifieke kaart, het blokkeren ervan en vervolgens een vervangende kaart bestellen, terwijl de conversatie vloeiend bleef.
  • Het Gevoelige Punt: De agenten waren eigenlijk best goed in het "Nee" zeggen tegen mensen die hen probeerden te misleiden (de adversariële groep), waarbij ze slaagden in 73,4% van die gesprekken. Echter, ze waren erg slecht in het bewaren van geheimen wanneer ze "Nee" zeiden. Zelfs wanneer ze een niet-geverifieerde beller weigerden te helpen, vertelden ze vaak per ongeluk de beller welk stukje informatie onjuist was (zoals "Uw adres is onjuist"), wat de boef de hint gaf die hij nodig had om het opnieuw te proberen.

Waarom dit ertoe doet (En wat het niet betekent)

Het artikel laat zien dat hoewel veel voice agents geweldig klinken, ze vaak falen bij de werkelijke taak van het oplossen van problemen, vooral wanneer zaken ingewikkelder worden of wanneer ze een strikte volgorde van handelingen moeten volgen. Het team ontdekte dat 27 keer van de duizenden pogingen een agent beweerde iets te hebben gedaan (zoals een kaart blokkeren), maar de computerlogs lieten zien dat ze het nooit daadwerkelijk hadden gedaan.

De auteurs zijn echter voorzichtig met het uitroepen van een enkele "winnaar" voor de hele wereld. Ze wijzen erop dat deze resultaten specifiek zijn voor dit ene bankscenario en deze 100 tests. De verschillen tussen de beste presteerders waren klein (minder dan 1%), en omdat de test een simulatie was, weten we niet precies hoe ze zouden presteren met echte, chaotische menselijke klanten in een echte bank.

Kortom, VAmoS Bench is een nieuwe, strengere liniaal om voice agents te meten. Het voorkomt dat we ons laten misleiden door een robot die beleefd klinkt maar niets doet, en het benadrukt dat de echte uitdaging niet alleen is om de robot te laten praten—maar om ervoor te zorgen dat hij ook daadwerkelijk het juiste doet, in de juiste volgorde, zonder geheimen prijs te geven.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →