← Nieuwste papers
🤖 AI

RetailBench: Benchmarking long horizon reasoning and coherent decision making of LLM agents in realistic retail environments

Het artikel introduceert RetailBench, een op data gebaseerde simulatiebenchmark voor het evalueren van LLM-agenten in realistische, langdurige retailmanagementscenario's, waarbij wordt onthuld dat hoewel huidige modellen veelbelovend zijn, ze worstelen met het handhaven van coherente besluitvorming en aanzienlijk onderpresteren vergeleken met een oracle-beleid vanwege problemen zoals onvolledige bewijsverzameling en inconsistente langetermijnstrategieën.

Oorspronkelijke auteurs: Linghua Zhang, Jun Wang, Jingtong Wu, Zhisong Zhang

Gepubliceerd 2026-06-16
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Linghua Zhang, Jun Wang, Jingtong Wu, Zhisong Zhang

Oorspronkelijk artikel vrijgegeven aan het publieke domein onder CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer slimme, erudiete robot inhuurt om een kleine supermarkt te runnen. Je geeft het de laptop, een lijst met hulpmiddelen om prijzen en voorraad te controleren, en een budget van $ 30.000. Je doel is dat deze robot de winkel zes maanden lang (180 dagen) draaiende houdt zonder failliet te gaan, de schappen gevuld houdt en winst maakt.

Dit rapport, RetailBench, is een rapportcijfer voor hoe goed zeven verschillende "slimme robotbreinen" (Large Language Models of LLM's) deze specifieke baan hebben uitgevoerd.

Hier is de uitsplitsing van wat ze vonden, met behulp van eenvoudige analogieën:

1. De Test: Een eindeloze dag in de supermarkt

De meeste tests voor AI zijn tegenwoordig als korte quizzen: "Schrijf een gedicht," "Los dit wiskundeprobleem op," of "Boek een vlucht." Dit zijn korte taken met een duidelijk begin en einde.

RetailBench is anders. Het is alsof je de AI in een marathon zet, niet in een sprint.

  • De Omgeving: Een gesimuleerde supermarkt met één winkelvestiging.
  • De Uitdaging: De AI moet veel dingen tegelijkertijd regelen: prijzen instellen, meer melk bestellen voordat het op is, de beste leverancier kiezen, omgaan met boze klantbeoordelingen, huurb rekeningen afhandelen en reageren op nieuwsgebeurtenissen (zoals een storm die de verkoop kan schaden).
  • De Addertjes onder het gras: De AI kan niet alles zien. Het is als een winkelmanager die moet gokken wat er in de achterkamer gebeurt of wat klanten volgende week zullen willen. De AI moet om informatie vragen (door "hulpmiddelen" te gebruiken) voordat het een beslissing neemt.

2. De Resultaten: De robots raakten de weg kwijt

De onderzoekers lieten deze AI-agenten de winkel draaien voor maximaal 180 dagen. Dit is wat er gebeurde:

  • De meesten gaven vroeg op: Veel van de AI-agenten kwamen geld tekort of maakten zoveel fouten dat de winkel na slechts enkele weken sloot (sommigen na slechts 58 dagen).
  • De overlevers waren niet perfect: Twee van de slimste AI's slaagden erin om de volledige 180 dagen te overleven. Hoewel ze de winkel open hielden, waren ze echter verschrikkelijk in het daadwerkelijk runnen ervan.
  • De "Oracle" (De perfecte manager): De onderzoekers hebben ook een "spiekbriefje"-manager gemaakt (een Oracle policy). Deze manager kende de toekomst, zag alle verborgen statistieken en volgde perfecte regels.
    • De Kloof: De beste AI-agent maakte ongeveer $ 24.000 winst. De "spiekbriefje"-manager maakte $ 131.000. De AI was weliswaar aan het overleven, maar het was slechts een mager bestaan vergeleken met een perfecte strategie.

3. Waarom faalden de robots?

Het paper analyseerde de "denkprocessen" van de robots en vond drie hoofdoorzaken waarom ze moeite hadden:

A. Ze lazen niet het hele menu (Onvolledig bewijs)
Voordat je 100 dozen frisdrank bestelt, controleert een goede manager de voorraad, kijkt naar de vorige verkopen, checkt het weer en leest de klantbeoordelingen.

  • De AI-fout: De robots namen vaak grote beslissingen (zoals het bestellen van voorraad of het wijzigen van prijzen) zonder alle noodzakelijke feiten te controleren. Ze handelden op basis van een "onderbuikgevoel" of onvolledige gegevens, wat leidde tot slechte keuzes.

B. Ze keken alleen naar het prijskaartje (Oppervlakkige besluitvorming)
Stel je voor dat je appels koopt. De ene leverancier verkoopt ze voor $ 1,00 maar ze zijn rot. Een andere verkoopt ze voor $ 1,50 maar ze zijn perfect.

  • De AI-fout: De robots waren geobsedeerd door de lage prijs. Ze bleven steeds de $ 1,00 leverancier kiezen. Ze realiseerden zich niet dat goedkope appels leiden tot boze klanten, retouren en slechte beoordelingen, wat uiteindelijk de reputatie en de winst van de winkel vernietigt. Ze zagen de prijs, maar misten de kwaliteit.

C. Ze hadden een korte concentratieboog (Gebrek aan een lange-termijn beleid/Long-Horizon Policy)
Een winkel runnen gaat over consistentie. Als je vandaag te veel melk bestelt, kan het over een week over datum zijn. Als je niet genoeg bestelt, mis je verkopen morgen.

  • De AI-fout: De robots waren goed in het nemen van een beslissing voor vandaag, maar ze vergaten morgen. Ze hielden geen consistent plan aan. Ze losten vandaag een probleem op, maar vergaten dat vervolgens drie dagen later wanneer de gevolgen merkbaar werden. Ze konden de verbanden niet leggen tussen een actie ondernomen op Dag 1 en een probleem dat optrad op Dag 10.

4. De Conclusie

Het paper concludeert dat hoewel AI erg goed wordt in korte, specifieke taken, het nog steeds niet klaar is om zelfstandig een complexe, langdurige onderneming te runnen.

  • Huidige status: AI kan een winkel een tijdje "in leven" houden, maar het kan er geen bloeiend bedrijf van maken.
  • Het probleem: De AI mist het vermogen om alle juiste aanwijzingen te verzamelen, diep na te denken over de lange-termijngevolgen van een goedkope deal, en een consistent plan vast te houden over maanden heen.

Kortom: Als je vandaag een winkel aan een AI zou overhandigen, zou de winkel misschien niet onmiddellijk failliet gaan, maar het zou waarschijnlijk een rommelige, onrendabele bende worden vergeleken met een mens (of een perfect computerprogramma) die begrijpt wat de lange termijn is.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →