Towards Reliable Zero-Shot Crowd Forecasting: Evaluating Time Series Foundation Models for Special Event Pedestrian Forecasting
Dit artikel evalueert de effectiviteit van voorgetrainde tijdreeks-fundamentele modellen voor zero-shot probabilistische menvoorspelling tijdens zeldzame speciale evenementen, waarbij wordt aangetoond dat zij in staat zijn om betrouwbare punt-schattingen en onzekerheidskwantificering te bieden zonder uitgebreide lokale hertraining.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je het weer probeert te voorspellen voor een picknick die slechts één keer in de vijf jaar plaatsvindt. Je kunt niet gewoon naar het weer van vorig jaar kijken, want dat vond vorig jaar niet plaats. Je kunt ook niet wachten tot de dag zelf om de patronen te leren kennen. Dit is de lastige wereld van "zero-shot" voorspellen: slimme gissingen doen over de toekomst wanneer je bijna geen historische data hebt om te bestuderen. Normaal gesproken moeten computers bergen historische data "eten" om te leren hoe ze dingen zoals verkeer of menigtes kunnen voorspellen. Maar wat als je een superintelligent computerbrein zou kunnen gebruiken dat de "encyclopedie" van tijd en patronen van miljoenen andere plaatsen al heeft gelezen, en je het simpelweg vraagt: "Hé, wat gaat er hier gebeuren?" Dit is de belofte van "foundation models". Ze zijn als universele studenten die hun huiswerk al hebben gedaan over een miljard verschillende onderwerpen, zodat ze een nieuwe klas binnen kunnen lopen en direct kunnen beginnen met lesgeven zonder een tekstboek nodig te hebben.
Stel je nu een massaal maritiem festival in Amsterdam voor, het SAIL-evenement, dat 2,5 miljoen mensen trekt. De stad moet precies weten waar de menigten zich in de komende 30 minuten zullen bevinden om extra poorten te openen, meer politie te sturen of een pad vrij te maken voor een ambulance. Maar omdat dit evenement zeldzaam is, heeft de stad geen jaren aan data om een aangepaste robot voor te trainen. Ze hebben een voorspelling nodig die niet alleen een enkele gok is (zoals "het zullen 500 mensen zijn"), maar een reeks mogelijkheden met een veiligheidsnet (zoals "het zal tussen de 400 en 600 zijn, maar wees voorzichtig, het kan pieken naar 800"). Dit artikel is een echte praktijktest om te zien of deze vooraf getrainde "universele studenten" daadwerkelijk de chaos van een enorme, eenmalige evenementenmenigte kunnen aan kunnen zonder vast te lopen of gevaarlijk advies te geven.
De onderzoekers organiseerden een race tussen twee van de slimste tijdreizende AI-modellen die beschikbaar zijn: TimesFM en Chronos-2. Ze hadden deze modellen niet getraind op Amsterdamse data; in plaats daarvan lieten ze ze rechtstreeks in het midden van het SAIL2025-festival droppen om te zien hoe ze presteerden in een "zero-shot" setting. Denk eraan als een chef-kok die nog nooit in een specifieke keuken heeft gekookt, een nieuw, vreemd recept overhandigt en kijkt of hij een heerlijke maaltijd kan maken zonder eerst de ingrediënten te proeven.
De resultaten waren verrassend duidelijk. Het Chronos-2 model bleek de ster van de show te zijn. Het slaagde erin om doorstromingen van menigten te voorspellen met een betrouwbaar "veiligheidsvenster" van ongeveer 30 tot 45 minuten vooruit. In de wereld van menigtebeheer is het hebben van 30 minuten voorsprong als het hebben van een superkracht; het geeft managers genoeg tijd om mensen daadwerkelijk te verplaatsen of nooduitgangen te openen voordat een opstopping een ramp wordt. Chronos-2 was bijzonder goed in het "rollen" van zijn voorspellingen naar voren, wat betekent dat het, terwijl er elke 90 seconden nieuwe data binnenkwam, zijn voorspelling vloeiend bijwerkte zonder in de war te raken.
De paper vond echter ook enkele interessante eigenaardigheden. Hoewel Chronos-2 de algemene kampioen was, deed TimesFM het eigenlijk beter tijdens de rustige uren met weinig mensen (zoals laat in de nacht) en in gebieden waar de aantallen mensen zeer klein en constant waren. Het is alsof TimesFM een kalme, gestage bibliothecaris is die uitblinkt in het voorspellen van rustige bibliotheekuren, terwijl Chronos-2 een energieke sportcoach is die uitblinkt wanneer het spel chaotisch en snel opeens wordt.
Een van de meest cruciale zaken die de paper ontdekte, is hoe deze modellen omgaan met "ontbrekende data". Stel je voor dat een camera een uur lang niet werkt, waardoor er een leeg gat ontstaat in de telling van de menigte. De onderzoekers ontdekten dat Chronos-2 reageerde op deze ontbrekende informatie door zijn "veiligheidsnet" te verbreden. In plaats van zelfverzekerd een specifiek aantal te raden, zei het: "Ik weet het niet precies, dus de reeks mogelijkheden is nu enorm." Dit is een feature, geen bug! In situaties met hoge veiligheidsrisico's is het veel beter voor een model om te zeggen "Ik weet het niet zeker, wees voorzichtig" dan om zelfverzekerd een fout antwoord te geven. TimesFM breedde het net daarentegen niet zo sterk uit, wat risicovoller kan zijn als de ontbrekende data een plotselinge toename van mensen verborg.
De studie keek ook naar de "kosten" van het gebruik van deze modellen. Alles werd gedraaid op een standaard laptop zonder fancy grafische kaarten. Het goede nieuws? Beide modellen waren ongelooflijk snel en deden er minder dan een halve seconde over om een uur in de toekomst te voorspellen. Dit betekent dat ze gemakkelijk op gewone computers van de stad kunnen draaien om menigten in realtime te beheren. Ook het geheugen dat ze gebruikten was beheersbaar, hoewel Chronos-2 iets meer kracht nodig had om "wakker te worden" en te beginnen met denken.
Uiteindelijk suggereert de paper dat voor het beheren van zeldzame, massale evenementen zoals het SAIL-festival, Chronos-2 de meer betrouwbare keuze is, vooral wanneer je plotselinge veranderingen en ontbrekende data moet afhandelen. Het suggereert dat we niet altijd een nieuwe, aangepaste robot hoeven te bouwen voor elk evenement; soms moeten we gewoon de juiste vooraf getrainde expert vinden die kan instappen en de klus kan klaren. De onderzoekers hebben ook een nieuwe set "rapportcijfers" geïntroduceerd voor deze modellen, waarbij de focus niet alleen ligt op hoe dicht de gok bij de werkelijkheid lag, maar ook op hoe stabiel de voorspelling in de loop van de tijd was en hoe eerlijk het model was over zijn eigen onzekerheid. Dit is een grote zaak, want in menigtebeheer is weten wanneer je het niet weet even belangrijk als het weten van het antwoord.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.