← Nieuwste papers
🤖 AI

Iterating Toward Better Search: A Two-Agent Simulation Framework for Evaluating Agentic Search Architectures in E-Commerce

Dit artikel introduceert een modulair twee-agenten simulatieframework voor het evalueren van e-commerce zoekarchitecturen, waarbij via 2.011 conversaties wordt aangetoond dat rolling-window geheugen beter presteert dan intentie-extractiemethoden, systematische foutanalyse de foutpercentages significant vermindert, en verschillende LLM-backbones of judges leiden tot uiteenlopende prestatie- en evaluatieresultaten.

Oorspronkelijke auteurs: Jetlir Duraj, Jayanth Yetukuri, Shuang Zhou, Dhruv Varma, Rui Kong, Ishita Khan, Qunzhi Zhou

Gepubliceerd 2026-06-12
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Jetlir Duraj, Jayanth Yetukuri, Shuang Zhou, Dhruv Varma, Rui Kong, Ishita Khan, Qunzhi Zhou

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je de manager bent van een enorme, high-tech warenhuist. Je wilt een nieuwe, super slimme digitale winkelassistent bouwen die met klanten kan chatten, begrijpt wat ze willen en hen helpt het perfecte product te vinden. Maar voordat je deze assistent inhuurt en voor echte klanten plaatst, moet je hem testen.

Het probleem is: testen op echte mensen is traag, duur en riskant. Als de assistent slecht is, raken echte klanten gefrustreerd. Als je probeert de assistent te testen door een computer zowel de klant als de assistent te laten spelen, is de test nep: de "klant" weet precies wat de "assistent" gaat zeggen, waardoor het gesprek robotachtig en onnatuurlijk aanvoelt.

Dit artikel presenteert een oplossing: Een Two-Agent Simulatie Lab.

Beschouw dit lab als een realistische "vluchtsimulator" voor winkelassistenten. Het gebruikt twee aparte AI-personages die niet weten wat de ander denkt:

  1. De Koper-Agent: Een digitale klant met een specifieke persoonlijkheid (bijv. "een ongeduldige techneut" of "een geduldige koopjesjager"). Deze agent heeft een missie (zoals "het vinden van een specifieke horlogeband") en een niveau van geduld. De agent reageert alleen op wat de assistent de klant daadwerkelijk laat zien.
  2. De Responder-Agent: De winkelassistent die je aan het testen bent. Deze praat met een echte, live zoekmachine (zoals de werkelijke database van eBay) om producten te vinden en vragen te beantwoorden.

Omdat de "Koper" en de "Responder" gescheiden zijn, kun je de "Responder" vervangen (probeer een nieuw ontwerp) terwijl je de "Koper" exact hetzelfde houdt. Dit laat je zien of je nieuwe ontwerp daadwerkelijk beter is, zonder de ruis van veranderende klanten.

De onderzoekers voerden 2.011 gesprekken uit met 14 verschillende typen "Kopers" om vier hoofdzaken te testen. Dit is wat ze vonden, eenvoudig uitgelegd:

1. Minder is Meer (De Geheugenles)

Ze vergeleken twee manieren waarop de assistent het gesprek kon onthouden:

  • De "Samenvatter" (Sys-A): Na elke zin stopt de assistent om een slimme AI te vragen: "Wat probeert de klant echt te zeggen?" en schrijft een samenvatting.
  • De "Scroll-Terug" (Sys-B): De assistent houdt gewoon een rollende lijst bij van de laatste paar zinnen die de klant zei, zoals een chatgeschiedenis waar je doorheen kunt scrollen.

Het Resultaat: De "Scroll-Terug"-methode won. Het was 35% sneller en deed het eigenlijk beter.
De Analogie: Stel je een ober voor die na elke bestelling even stopt om een formeel rapport te schrijven over wat je misschien wilt, in plaats van gewoon je bestelling aan te nemen. De ober die gewoon luistert en de laatste paar dingen onthoudt die je zei, was sneller en maakte minder fouten. De "Samenvatter" begreep de betekenis soms verkeerd en gooide belangrijke details weg.

2. De "Fix-It" Snelheidstest

Na het draaien van de tests keek het team naar de gesprekken waar de assistent faalde. Ze ontdekten een specifiek patroon: de assistent had moeite met zeer veeleisende, ongeduldige klanten die exacte matches wilden.

  • De Fix: Ze maakten drie kleine, gerichte wijzigingen in de code van de assistent om deze specifieke fouten op te lossen.
  • Het Resultaat: In slechts twee dagen verminderden ze het aantal "bijna-fouten" met 62%.
    De Analogie: Het is alsoك een monteur die merkt dat een auto alleen sputtert als de motor koud is. In plaats van de hele motor te herbouwen, draaiden ze alleen één specifieke bout aan. De auto liep daarna perfect.

3. Het Brein Maakt het Verschil (De Model-Les)

Ze hielden het "Scroll-Terug"-ontwerp hetzelfde, maar vervingen het "brein" (het onderliggende AI-model) dat de assistent aanstuurt.

  • Brein A: Een topmodel genaamd Gemini.
  • Brein B: Een iets ander topmodel genaamd Llama.
    Het Resultaat: Hoewel het ontwerp identiek was, was de assistent met het Gemini-brein consequent beter in het behulpzaam zijn en het begrijpen van de klant. Het Llama-brein was 13% sneller, maar gaf meer generieke, robotachtige antwoorden (zoals een brochure) in plaats van specifieke, nuttige adviezen (zoals een deskundige winkelmedewerker).
    De Les: Je kunt een perfect chassis van een auto hebben, maar als je een zwakke motor erin zet, zal de auto niet goed presteren.

4. Het "Rechter"-Probleem (De Meest Verrassende Bevinding)

Om de winkelassistenten te beoordelen, gebruikten de onderzoekers twee andere super slimme AI's als "Rechters" (één van Google en één van Anthropic). Beide rechters kregen exact hetzelfde gesprek voorgelegd om te beoordelen.
Het Resultaat: De rechters waren het in 30% van de gesprekken oneens, soms met een enorme marge.

  • Rechter A (Gemini) hield van assistenten die beleefd waren, dingen goed uitlegden en een prettige gespreksflow hadden.
  • Rechter B (Claude) gaf alleen hoge scores als de klant ook daadwerkelijk iets kocht of een item aan de winkelwagen toevoegde.
    De Analogie: Stel je twee filmcritici voor die naar dezelfde film kijken. De een geeft 5 sterren omdat het acteerwerk prachtig was en het verhaal emotioneel was. De ander geeft 1 ster omdat de film het publiek niet aan het lachen kreeg. Beiden zijn "gelijk" op basis van hun eigen regels, maar ze beoordelen andere dingen.
    De Conclusie: Kiezen welke AI je gebruikt om je systeem te beoordelen, is net zo belangrijk als het systeem zelf. Als je een behulpzame chat wilt, kies dan één rechter; als je verkopen wilt, kies dan een andere.

Samenvatting

Dit artikel bouwde een realistische "vluchtsimulator" voor shopping bots. Ze leerden dat:

  1. Simpel geheugen (gewoon de chat onthouden) beter werkt dan complexe samenvattingen maken.
  2. Je slechte prestaties heel snel kunt verbeteren als je nauwkeurig kijkt naar waar het misgaat.
  3. Het "brein" (het AI-model) net zo belangrijk is als het ontwerp.
  4. Wie je vraagt om je werk te beoordelen, verandert de resultaten. Als je een behulpzame chat wilt, kies je de ene rechter; als je verkopen wilt, kies je de andere.

Het doel van dit onderzoek is niet om een specifiek product te verkopen, maar om bedrijven een betrouwbare, goedkope en snelle manier te geven om hun winkelassistenten te testen voordat ze ooit een echt mens spreken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →