← Nieuwste papers
💬 NLP

SAGE: A Top-Down Bottom-Up Knowledge-Grounded User Simulator for Multi-turn AGent Evaluation

Dit paper introduceert SAGE, een nieuw kader voor het simuleren van gebruikers dat bedrijfskennis integreert via een top-down en bottom-up aanpak om realistischere multi-turn interacties te genereren en tot 33% meer fouten in agenten te detecteren.

Oorspronkelijke auteurs: Ryan Shea, Yunan Lu, Liang Qiu, Zhou Yu

Gepubliceerd 2026-03-12
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Ryan Shea, Yunan Lu, Liang Qiu, Zhou Yu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een nieuw, slimme klantenservice-robot bouwt voor een grote winkelketen. Voordat je deze robot aan de echte wereld presenteert, wil je weten: Werkt hij goed? Begrijpt hij wat klanten willen? En maakt hij rare fouten?

In het verleden moest je daarvoor echte mensen inhuren om met de robot te praten. Dat is duur, tijdrovend en lastig te organiseren. Daarom proberen onderzoekers vaak een virtuele klant (een simulatie) te maken die met de robot praat in plaats van echte mensen.

Het probleem met de oude methoden is dat deze virtuele klanten vaak te algemeen zijn. Ze gedragen zich als een "gemiddelde mens" zonder specifieke wensen of kennis. Het is alsof je een robot test met iemand die net uit een andere wereld komt en niets over jouw producten weet. De robot lijkt dan misschien slim, maar in de echte wereld faalt hij.

Hier komt SAGE (de titel van dit onderzoek) om de hoek kijken. SAGE is een slimme manier om deze virtuele klanten te maken, en het werkt als een combinatie van twee krachten: Top-Down en Bottom-Up.

De Twee Krachten van SAGE

Stel je SAGE voor als een regisseur die een acteur voorbereidt op een rol in een film.

1. Top-Down: De "Personage" (Wie is de klant?)

Dit is het Top-Down deel. De regisseur kijkt naar de grote lijnen van het bedrijf.

  • De Analogie: Stel je voor dat je een acteur vraagt om een rijke zakenman te spelen die een dure robot wil kopen. De regisseur geeft de acteur een dossier: "Je bent een 40-jarige directeur van een restaurant, je bent druk, je hebt een groot budget, en je bent op zoek naar robots die helpen met het serveren van drankjes."
  • In de praktijk: SAGE gebruikt zakelijke logica (zoals "Ideale Klant Profielen") om te bepalen wie de virtuele klant is. Is het een student met een klein budget? Of een grote fabriek met een groot budget? Dit zorgt ervoor dat de virtuele klant een persoonlijkheid en doelen heeft die echt passen bij het bedrijf.

2. Bottom-Up: De "Rekwisieten" (Wat weet de klant?)

Dit is het Bottom-Up deel. De regisseur geeft de acteur niet alleen een rol, maar ook de feiten over de filmwereld.

  • De Analogie: Voordat de acteur de set op gaat, krijgt hij de handleiding van de robot, de prijslijst en de veelgestelde vragen (FAQ's). Hij leert precies wat de robot kan en wat niet. Als de acteur dan vraagt: "Kan deze robot ook buiten werken?", doet hij dat omdat hij de handleiding heeft gelezen, niet omdat hij het raadt.
  • In de praktijk: SAGE laadt alle informatie van het bedrijf (productcatalogi, handleidingen, voorraadlijsten) in het hoofd van de virtuele klant. Hierdoor stelt de virtuele klant vragen die echt relevant zijn, gebaseerd op wat er daadwerkelijk in de winkel of op de website staat.

Waarom is dit zo goed?

Als je deze twee krachten combineert, krijg je een virtuele klant die niet alleen een persoon is, maar ook kennis heeft.

  • Echte fouten opsporen: Omdat de virtuele klant precies weet wat er in de handleiding staat, kan hij de robot op de proef stellen. Als de robot zegt: "Ja, deze robot werkt ook buiten," terwijl de handleiding (die de virtuele klant kent) zegt: "Nee, alleen binnen," dan weet SAGE direct: Fout gevonden!
  • Meer variatie: Omdat er duizenden verschillende "personages" en "kennisstukken" kunnen worden gecombineerd, kan SAGE duizenden verschillende gesprekken genereren. Het is alsof je 1000 verschillende klanten tegelijkertijd test in plaats van 10.

Het Resultaat

De onderzoekers hebben getoond dat SAGE veel beter werkt dan eerdere methoden:

  1. Realistischer: De gesprekken klinken als echte mensen, niet als robots die een script aflezen.
  2. Slimmer: SAGE vindt tot 33% meer fouten in de software dan andere methoden. Het is als een super-scherpe testpersoon die precies weet waar de zwakke plekken zitten.
  3. Efficiënter: Bedrijven hoeven geen dure mensen meer in te huren om hun robots te testen; SAGE doet het werk sneller en goedkoper.

Kortom: SAGE is als een super-acteur die niet alleen een rol speelt (Top-Down), maar ook de hele script en de regie-instructies uit zijn hoofd kent (Bottom-Up). Hierdoor kan hij de robot (de AI) op een manier testen die zo realistisch is dat hij bijna niet te onderscheiden is van een echte mens, waardoor bedrijven hun producten veel sneller en beter kunnen verbeteren.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →