FreshRetailNet-LT: A Stockout-Annotated Censored Demand Dataset for Latent Demand Recovery and Forecasting in Fresh Retail
Dit artikel introduceert FreshRetailNet-50K, de eerste grootschalige benchmark-dataset met 50.000 uurlijkse winkel-product tijdreeksen met precieze voorraadtekort-annotaties, wat onderzoekers in staat stelt om de latente vraag te reconstrueren en de voorspellingsnauwkeurigheid voor bederfelijke retailproducten aanzienlijk te verbeteren door systematische biases veroorzaakt door gecensureerde verkoopgegevens te corrigeren.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een drukke limonadekraam runt. Je wilt precies weten hoeveel bekers mensen willen kopen, zodat je de perfecte hoeveelheid limonade kunt maken. Als je te veel maakt, wordt het zuur (verspilling); als je te weinig maakt, mis je omzet.
Het probleem is: je verkoopverslag is een leugenaar.
Het Probleem: De "Lege Beker"-illusie
In de wereld van verse producten (zoals aardbeien, vis of melk) raken winkels vaak door hun voorraad heen. Stel dat je 100 klanten hebt die aardbeien willen, maar je hebt er slechts 50. Je bent om 11:00 uur uitverkocht.
Je verkoopverslag voor de rest van de dag zegt dan: "0 verkopen."
Maar dat is niet waar! De vraag was er nog steeds; je was alleen door je voorraad heen. Dit wordt gecensureerde data genoemd. Het is alsof een camera stopt met opnemen op het moment dat de batterij leeg is. Als je probeert te leren van deze kapotte camera, denk je: "Oh, na 11:00 uur wil niemand meer aardbeien kopen," en bestel je de volgende dag zelfs nog minder. Dit creëert een vicieuze cirkel waarbij je constant door je voorraad heen raakt en geld laat liggen.
De Oplossing: FreshRetailNet-LT
De auteurs van dit artikel hebben een nieuwe, enorme dataset genaxt genaamd FreshRetailNet-LT om deze kapotte camera te reparen. Denk aan dit als een "supergedetailleerd dagboek" voor de verkoop van verse producten.
Dit is wat het bijzonder maakt, uitgelegd met eenvoudige analogieën:
1. De High-Definition Video vs. De Dagelijkse Samenvatting
De meeste oude datasets zijn als een dagelijkse samenvatting: "Vandaag 50 appels verkocht." Ze vertellen je niet wanneer je door je voorraad heen was.
Deze nieuwe dataset is als een high-definition video die elke uur wordt opgenomen. Het laat je precies zien wanneer het schap leeg ging. Het legt 20.000 verschillende productverhalen vast van meer dan 1.000 winkels in 18 steden, verspreid over twee jaar. Omdat het alles per uur bijhoudt, kan het herkennen dat je om 11:00 uur door je aardbeien heen was, zelfs als je om 14:00 uur niets meer verkocht.
2. Het "Waarheidslabel"
Normaal gesproken moeten computers raden of een winkel door zijn voorraad heen is. Deze dataset komt met geverifieerde "stockout labels" (voorraadtekort-labels). Het is alsoalt een leraar die een gouden ster plaatst bij elk moment dat het schap daadwerkelijk leeg was. Hierdoor kunnen onderzoekers computers het verschil leren tussen "niemand wilde het" (echte nul-vraag) en "we waren door de voorraad heen" (gecensureerde vraag).
3. De Contextuele Aanwijzingen
De dataset telt niet alleen de verkopen; het legt ook het "weerbericht" van de verkoop vast. Het bevat:
- Promoties: Hadden we een 50% kortingsactie? (Dit zorgt meestal voor een enorme piek in de vraag).
- Weer: Regent het? (Mensen kopen misschien meer verse groenten om thuis te koken).
- Feestdagen: Is het Chinees Nieuwjaar? (Mensen kopen andere dingen).
Hoe ze het hebben getest: De Tweestaps-oplossing
De onderzoekers gebruikten deze nieuwe dataset om een tweestapsmethode te testen om de "leugende verkoopgegevens" te repareren:
- Stap 1: Het Detectiewerk (Reconstructie)
Eerst gebruikten ze de "gouden ster"-labels om de ontbrekende verkopen te reconstrueren. Als het schap om 11:00 uur leeg was, schat het model in hoeveel mensen er wel aardbeien hadden gekocht als het schap niet leeg was geweest. Het is alsof je de ontbrekende beelden van een film invult. - Stap 2: De Kristallen Bol (Voorspelling)
Daarna gebruikten ze deze "gereconstrueerde waarheid" om een computer te leren de toekomstige vraag te voorspellen.
De Resultaten: Een Helderder Beeld
Toen ze deze methode testten, waren de resultaten indrukwekkend:
- Minder Gissen: De computer stopte met het onderschatten van de vraag. Voorheen zat de computer er ongeveer 6,7% naast (hij dacht dat mensen minder wilden dan ze eigenlijk wilden). Na het gebruik van deze nieuwe methode daalde de fout naar bijna nul.
- Betere Nauwkeurigheid: De algehele voorspellingsnauwkeurigheid verbeterde met 1,63%. In de wereld van de verkoop van miljoenen dollars aan verse producten, bespaart dat kleine percentage een enorme hoeveelheid geld en vermindert het verspilling.
Waarom het Belangrijk Is
Dit artikel gaat niet alleen over wiskunde; het gaat over het repareren van een kapot systeem. Door een dataset te bieden die toegeeft "we waren door de voorraad heen" en precies vertelt wanneer, helpt het winkels om de cirkel van het door de voorraad heen raken van verse producten te doorbreken. Het stelt hen in staat om de juiste hoeveelheid bederfelijke goederen te bestellen, zodat de aardbeien er ook echt zijn wanneer jij naar de winkel gaat.
De auteurs hebben dit "supergedetailleerde dagboek" en hun code beschikbaar gesteld voor iedereen om te gebruiken, in de hoop zowel wetenschappers als winkeliers te helpen het puzzel van de vraag naar verse producten op te lossen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.