Benchmarking In-context Experiential Learning Through Repeated Product Recommendations
Dit artikel introduceert BELA, een benchmark voor ervaringsgericht leren in scenario's van herhaalde productaanbevelingen met behulp van echte producten en synthetische klantpersona's, wat onthult dat hoewel huidige op LLM gebaseerde agenten kunnen adapteren binnen individuele interacties, zij moeite hebben om hun strategieën over meerdere episodes te verbeteren door het afleiden van gedeelde latente structuren.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een detective bent die een mysterie probeert op te lossen, maar de aanwijzingen zijn verborgen in een gesprek. In de wereld van kunstmatige intelligentie is er een groot verschil tussen het oplossen van één enkele puzzel en het leren hoe je puzzels over tijd heen beter kunt oplossen. De meeste AI-tests van vandaag zijn als het geven van een enkele wiskundige opgave aan een student waarbij alle getallen al zijn uitgeschreven; het doel is alleen om nú het juiste antwoord te krijgen. Maar het echte leven is rommeliger. Het is meer als een detective die met een getuige praat, een paar vragen stelt, een antwoord krijgt, en vervolgens die ervaring moet gebruiken om het volgende interview met de volgende getuige effectiever te voeren. Dit artikel duikt in een specifieke hoek van AI-onderzoek genaamd "ervaringsgericht leren" (experiential learning). Het stelt een eenvoudige maar lastige vraag: Kan een AI slimmer worden in het achterhalen van wat mensen willen, simpelweg door herhaaldelijk met hen te praten? De onderzoekers testen of deze digitale agenten kunnen leren van hun eerdere gesprekken om in de toekomst betere detectives te worden, in plaats van alleen goed te zijn in het oplossen van één geïsoleerde zaak.
De auteurs van dit artikel, een team van de Columbia Business School en Sun Yat-sen University, besloten dit idee te testen met een scenario dat we allemaal kennen: winkelen voor producten. Ze bouwden een enorme, virtuele speeltuin genaamd BELA (Benchmark for Experiential Learning and Active Exploration). Denk aan BELA als een enorme, oneindige winkelstraat waar de AI de rol van een verkoper speelt. In deze winkelstraat moet de AI met duizenden verschillende "klanten" praten (die eigenlijk computersimulaties zijn van mensen met specifieke smaken) om te ontdekken welk product zij moeten kopen. De twist is dat de AI niet slechts één kans krijgt. De AI praat met een klant, doet een aanbeveling, krijgt feedback, en gaat vervolgens door naar een nieuwe klant. De grote test is of de AI zich herinnert wat hij heeft geleerd van de eerste klant en die kennis gebruikt om de tweede, derde en tiende klant betere vragen te stellen.
Om deze test eerlijk en grootschalig te maken, hebben de onderzoekers niet zomaar een paar nepmensen bedacht. Ze creëerden een systeem met 71.000 echte producten van Amazon en 2.000 verschillende productgroepen (zoals een groep haargels of een groep rijstgerechten). Ze koppelden deze vervolgens aan 1 miljoen verschillende klantpersoonlijkheden (gesimuleerd door andere AI's) die zeer specifieke, consistente voorkeuren en afkeurigheden hebben. Dit creëert een verbijsterende 2 miljard mogelijke combinaties van "klant + productgroep". Het is alsof je een bibliotheek hebt van elke mogelijke winkelervaring die je je kunt voorstellen, waardoor de onderzoekers kunnen zien of de AI patronen in de menigte kan herkennen.
De onderzoekers voerden hun experimenten uit met de slimste AI-modellen van dit moment, waaronder reuzen zoals GPT-5.4, Gemini-3.1 en Claude-Opus. Ze observeerden hoe deze modellen probeerden producten te verkopen over een reeks van 10 winkelbezoeken (episoden). Ze wilden twee dingen weten: Ten eerste, kon de AI leren tijdens een enkel gesprek (de juiste vervolgvragen stellen)? Ten tweede, kon de AI leren over gesprekken heen (beter worden in de baan naarmate hij meer ervaring opdoet)?
Hier is het verrassende resultaat: De AI-modellen waren eigenlijk best goed in het eerste deel. Wanneer ze met een enkele klant praatten, konden ze leren van het gesprek en tijdens de chat betere vragen stellen. Echter, ze faalden volledig bij het tweede deel. Nadat ze met negen verschillende klanten hadden gepraat, was de AI niet beter geworden in het raden van wat de tiende klant wilde dan bij de eerste klant. Het was als een verkoper die heel goed is in het uitzoeken wat één persoon leuk vindt, maar telkens wanneer er een nieuwe persoon binnenloopt, weer vanaf nul begint en alles vergeet wat hij van de vorige negen mensen heeft geleerd.
Het artikel suggereert dat deze huidige "frontier"-modellen een cruciale vaardigheid missen: ze kunnen niet terugkijken op hun eerdere ervaringen en zeggen: "Oh, ik zie een patroon; ik zou de volgende keer dit soort vragen moeten stellen." In plaats daarvan lijken ze elke nieuwe klant als een volledig nieuw mysterie te behandelen, zelfs als ze vijf minuten geleden net iemand met een zeer vergelijkbare smaak hebben ontmoet. De onderzoekers ontdekten ook dat de AI niet beter werd in het inschatten van hoe zelfverzekerd hij moest zijn; de AI bleef hetzelfde aantal vragen stellen, zelfs toen hij had moeten leren om minder vragen te stellen.
Om te bewijzen dat de taak niet simpelweg te moeilijk was, creëerden de onderzoekers een "ideaal pad". Ze begeleidden de AI handmatig door de best mogelijke vragen en lieten zien dat als de AI zijn eerdere ervaringen correct had gebruikt, hij de aanbevelingen drastisch had kunnen verbeteren en minder vragen had kunnen stellen. Dit bewees dat de informatie aanwezig was om van te leren, maar dat de huidige modellen het simpelweg niet oppikten.
Kortom, dit artikel suggereert dat hoewel onze huidige AI erg goed wordt in het voeren van een enkel, slim gesprek, het nog niet heeft begrepen hoe het een "lerende machine" kan zijn die slimmer wordt gedurende haar gehele carrière. Het is een beetje als een student die een toets kan halen als hij de avond ervoor heeft gestudeerd, maar alles vergeet zodra de bel gaat, en niet in staat is om te gebruiken wat hij op maandag heeft geleerd om hem op dinsdag te helpen. De auteurs concluderen dat voor AI om echt de rommelige, veranderlijke echte wereld te kunnen hanteren, het de vaardigheid moet ontwikkelen om te leren van ervaringen over meerdere episoden heen—een vaardigheid waar de meest geavanceerde modellen van vandaag nog steeds moeite mee hebben.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.