← Derniers articles
🤖 machine learning

Towards Reliable Zero-Shot Crowd Forecasting: Evaluating Time Series Foundation Models for Special Event Pedestrian Forecasting

Cet article évalue l'efficacité des modèles de fondation de séries temporelles préentraînés pour la prévision probabiliste de foule en mode zero-shot lors d'événements spéciaux peu fréquents, démontrant leur capacité à fournir des estimations ponctuelles fiables et une quantification de l'incertitude sans réentraînement local intensif.

Auteurs originaux : Ziteng Li, Yanan Xin, Tina Comes, Serge Hoogendoorn

Publié 2026-07-21
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Ziteng Li, Yanan Xin, Tina Comes, Serge Hoogendoorn

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayiez de prédire la météo pour un pique-nique qui n'a lieu qu'une fois tous les cinq ans. Vous ne pouvez pas simplement regarder la météo de l'année dernière car, eh bien, il n'y a pas eu de pique-nique l'année dernière. Vous ne pouvez pas non plus attendre le jour J pour commencer à apprendre les schémas. C'est le monde complexe de la prévision « zero-shot » : faire des suppositions intelligentes sur l'avenir alors que vous avez presque aucune donnée passée pour étudier. Habituellement, les ordinateurs ont besoin de dévorer des montagnes de données historiques pour apprendre à prédire des choses comme le trafic ou les foules. Mais et si vous pouviez utiliser un cerveau informatique super intelligent qui a déjà lu l'« encyclopédie » du temps et des motifs de millions d'autres endroits, et simplement lui demander : « Hé, que va-t-il se passer ici ? » C'est la promesse des « modèles de fondation ». Ils sont comme des étudiants universels qui ont déjà fait leurs devoirs sur un milliard de sujets différents, de sorte qu'ils peuvent entrer dans une nouvelle salle de classe et commencer à enseigner immédiatement sans avoir besoin d'un manuel.

Maintenant, imaginez un festival maritime massif à Amsterdam, l'événement SAIL, qui attire 2,5 millions de personnes. La ville doit savoir exactement où se trouveront les foules dans les 30 prochaines minutes pour ouvrir des portes supplémentaires, envoyer plus de police ou dégager un passage pour une ambulance. Mais parce que cet événement est rare, la ville ne dispose pas d'années de données pour entraîner un robot personnalisé. Elle a besoin d'une prévision qui n'est pas seulement une supposition unique (comme « il y aura 500 personnes »), mais une gamme de possibilités avec un filet de sécurité (comme « ce sera entre 400 et 600, mais attention, cela pourrait grimper à 800 »). Ce document est un test en conditions réelles pour voir si ces « étudiants universels » pré-entraînés peuvent réellement gérer le chaos d'un événement de foule massif et unique sans planter ou donner des conseils dangereux.

Les chercheurs ont organisé une course entre deux des modèles de voyage dans le temps les plus intelligents disponibles : TimesFM et Chronos-2. Ils n'ont pas entraîné ces modèles sur les données d'Amsterdam ; au contraire, ils les ont jetés directement au milieu du festival SAIL2025 pour voir comment ils se comportaient dans un contexte « zero-shot ». Considérez cela comme le fait de donner à un chef qui n'a jamais cuisiné dans une cuisine spécifique une nouvelle recette étrange et de voir s'il peut préparer un repas délicieux sans goûter les ingrédients au préalable.

Les résultats ont été étonnamment clairs. Le modèle Chronos-2 s'est avéré être la star de la présentation. Il a réussi à prédire les flux de foule avec une « fenêtre de sécurité » fiable d'environ 30 à 45 minutes à l'avance. Dans le monde du contrôle des foules, avoir une avance de 30 minutes, c'est comme avoir un super-pouvoir ; cela donne aux gestionnaires le temps de déplacer les gens ou d'ouvrir les sorties de secours avant qu'un goulot d'étranglement ne devienne un désastre. Chronos-2 était particulièrement doué pour « faire rouler » ses prévisions vers l'avant, ce qui signifie qu'à mesure que de nouvelles données arrivaient toutes les 90 secondes, il mettait à jour ses prévisions de manière fluide sans s'embrouiller.

Cependant, l'article a également révélé des particularités intéressantes. Bien que Chronos-2 soit le champion général, TimesFM a en fait mieux réussi pendant les heures calmes et de faible affluence (comme tard dans la nuit) et dans les zones où les nombres de foule étaient très faibles et stables. C'est comme si TimesFM était un bibliothécaire calme et régulier, excellent pour prédire les heures de calme dans une bibliothèque, tandis que Chronos-2 est un entraîneur de sport énergique qui excelle lorsque le jeu devient chaotique et rapide.

L'une des choses les plus critiques que l'article a découvertes est la façon dont ces modèles gèrent les « données manquantes ». Imaginez si une caméra cessait de fonctionner pendant une heure, laissant un vide dans le comptage de la foule. Les chercheurs ont constaté que Chronos-2 réagissait à cette information manquante en élargissant son « filet de sécurité ». Au lieu de deviner avec assurance un nombre précis, il disait : « Je ne sais pas exactement, donc la gamme de possibilités est maintenant énorme. » C'est une fonctionnalité, pas un bug ! Dans des situations critiques pour la sécurité, il vaut mieux qu'un modèle dise « je ne suis pas sûr, soyez prudent » plutôt qu'il ne donne une réponse fausse avec assurance. TimesFM, quant à lui, n'élargissait pas autant son filet, ce qui pourrait être plus risqué si les données manquantes cachaient une soudaine augmentation.

L'étude a également examiné le « coût » de l'utilisation de ces modèles. Ils ont tout exécuté sur un ordinateur portable standard sans cartes graphiques sophistiquées. La bonne nouvelle ? Les deux modèles étaient incroyablement rapides, prenant moins d'une demi-seconde pour prédire une heure dans le futur. Cela signifie qu'ils pourraient facilement fonctionner sur des ordinateurs municipaux ordinaires pour gérer les foules en temps réel. La mémoire qu'ils utilisaient était également gérable, bien que Chronos-2 ait besoin d'un peu plus de puissance pour « se réveiller » et commencer à réfléchir.

En fin de compte, l'article suggère que pour gérer des événements rares et massifs comme le festival SAIL, Chronos-2 est le choix le plus fiable, surtout lorsque vous devez gérer des changements soudains et des données manquantes. Il suggère que nous n'avons pas toujours besoin de construire un nouveau robot personnalisé pour chaque événement ; parfois, nous avons juste besoin de trouver le bon expert pré-entraîné capable de sauter dans l'arène et de faire le travail. Les chercheurs ont également introduit un nouvel ensemble de « bulletins de notes » pour ces modèles, se concentrant non seulement sur la proximité de la supposition, mais aussi sur la stabilité de la prédiction au fil du temps et sur l'honnêteté du modèle concernant son incertitude. C'est un événement majeur car, dans la gestion des foules, savoir quand on ne sait pas est tout aussi important que de connaître la réponse.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →