Can LLM Agents Price Competitively? A Dynamic Multi-Attribute Auction Benchmark for Agentic Commerce
Dit artikel introduceert Bazaar, een dynamische benchmark voor veilingen met meerdere attributen, die aantoont dat hoewel grensverleggende LLM-agenten kunnen handelen in gesimuleerde agentische commercie, ze momenteel minder dan een derde van de optimale winst realiseren en aanzienlijke afruilverschijnselen vertonen tussen klantverwerving, winstgevendheid en aanpassingsvermogen aan marktschokken.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je een wereld voor waarin je winkelassistent niet alleen een behulpzame bibliothecaris is die de beste deals voor je vindt, maar een piepkleine, superintelligente ondernemer die zijn eigen winkel runt. Dit is de grens van "agentic commerce", waar Kunstmatige Intelligentie (AI) niet alleen chat; het onderhandelt, prijzen vaststelt en concurreert met andere AI-winkels in realtime markten. Om te begrijpen hoe deze digitale kooplieden werken, moeten we een paar kernideeën begrijpen. Denk eerst aan veilingen, niet als schreeuwpartijen om antiek, maar als een spel waarbij verkopers een mix van functies aanbieden (zoals een telefoon met een groot scherm maar een trage batterij) en een prijskaartje. De koper kiest het aanbod dat hen de meeste "geluk" (waarde) oplevert voor het geld. Ten tweede zijn dynamische markten als een dansvloer waar de muziek plotseling verandert; klanten kunnen vandaag van een bepaalde functie houden en er morgen een hekel aan hebben, en concurrenten passen voortdurend hun passen aan. De grote vraag die wetenschappers stellen is: Kan een AI-agent leren dansen op deze veranderende muziek, ontdekken wat de klant stiekem wil, en de perfecte prijs bepalen om winst te maken zonder ze weg te jagen?
Dit artikel, getiteld "Can LLM Agents Price Competitively?", introduceert een nieuw videospel voor AI genaamd Bazaar. De onderzoekers bouwden een digitale marktplaats waar één AI-koopman (de "focale" agent) het opneemt tegen drie andere AI-bots en 24 verborgen klanten. De twist? De klanten hebben geheime voorkeuren, en halverwege het spel veranderen de regels: sommige klanten wisselen plotseling waar ze van houden (zoals besluiten dat ze nu liever een rode auto willen dan een blauwe). De AI moet deze verschuiving opmerken, van gedachten veranderen en blijven geld verdienen.
De resultaten zijn een mix van verrassende overwinningen en grappige mislukkingen. De onderzoekers ontdekten dat het winnen van de meeste veilingen niet betekent dat je het meeste geld verdient. Sterker nog, de AI die de meeste spellen won (Gemini 3.1 Pro) was niet degene met de diepste zakken. De echte kampioen qua winst was een andere AI (Opus 4.6), die minder spellen won maar veel beter was in "marge-discipline" — wat betekent dat het precies wist hoeveel extra het kon vragen zonder de verkoop te verliezen. Het is als het verschil tussen een straatverkoper die 100 goedkope hotdogs verkoopt en een paar dollar verdient, versus iemand die 50 gourmetburgers verkoopt tegen een hoge prijs en een fortuin verdient.
De studie onthulde ook een nieuwsgierig persoonlijkheidskenmerk bij deze AI's. Sommige modellen waren "snelle leerlingen" aan het begin, die snel naar de top klommen, maar toen de marktregels veranderden, waren ze koppig en traag in aanpassing. Ze bleven hetzelfde oude product proberen te verkopen, ervan overtuigd dat ze gelijk hadden, zelfs nadat ze herhaaldelijk hadden verloren. Anderen, zoals Gemini, waren wat langzamer bij de start, maar flexibel genoeg om te beseffen dat de wereld veranderd was en hun strategie snel aan te passen.
Zelfs de slimste AI in de test was echter niet perfect. De beste agent veroverde slechts ongeveer één derde van de winst die hij had kunnen maken als hij alle geheimen van de klanten vanaf het begin had gekend. Dit suggereert dat hoewel deze AI-agenten beter worden in het doen van zaken, ze nog een lange weg te gaan hebben voordat ze de chaotische, verschuivende wereld van de echte handel echt onder de knie hebben. Het artikel merkt ook op dat simpelweg "harder nadenken" (meer computerkracht gebruiken) sommige AI's hielp om hun fouten te herstellen, waardoor ze veranderden van verliezers die te laag boden in winnaars die gewoon een beetje geld lieten liggen, maar het maakte hen niet perfect. Uiteindelijk laat de studie zien dat in het hoogstaande spel van AI-prijsstelling, weten wat je moet verkopen slechts de helft van de strijd is; weten hoeveel je moet vragen is de echte toptruc.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.