← Derniers articles
⚡ electrical engineering

Recurring Public Transit Schedules: Stable Identification from GTFS and Similarity Analysis

Cet article introduit une méthode pour identifier et formaliser les horaires de transport public récurrents sous forme de « DayTypes » à partir des données GTFS en utilisant des clés de motifs de parcours H3 et des mesures de similitude, permettant ainsi une synchronisation plus efficace des horaires, de la planification des véhicules et de l'affectation de la demande en distinguant les décalages temporels mineurs des changements de service significatifs.

Auteurs originaux : Evgeny Makarov, Georgy Taubkin

Publié 2026-06-16
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Evgeny Makarov, Georgy Taubkin

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez les horaires de transports publics comme une bibliothèque massive et chaotique de fiches horaires de bus et de trains. Si vous regardez un calendrier, vous pourriez penser que chaque jour possède un horaire unique. Mais en réalité, la plupart des jours sont des copies les uns des autres. Les lundis ressemblent aux autres lundis ; les samedis ressemblent aux autres samedis. Les jours fériés, cependant, sont les « éditions spéciales » qui brisent le modèle.

Le problème est que le format numérique standard utilisé pour partager ces horaires (appelé GTFS) ne les organise pas de cette manière. Il répertorie chaque trajet pour chaque jour comme s'ils étaient tous uniques, ce qui empêche les ordinateurs de voir les modèles répétitifs. C'est comme avoir un livre de recettes où la « Soupe du lundi » et la « Soupe du mardi » sont répertoriées comme deux recettes complètement différentes, même si elles sont identiques, simplement parce que les numéros de page sont différents.

Ce document présente une méthode pour nettoyer cette bibliothèque et regrouper ces horaires en « familles » logiques.

L'idée centrale : les « DayTypes »

Les auteurs appellent ces familles des DayTypes. Considérez un DayType comme un « modèle » ou un « moule ».

  • Le Modèle : Au lieu de regarder 365 jours différents, le système trouve que 52 d'entre eux sont des « Modèles de Lundi », 52 sont des « Modèles de Samedi », et peut-être 5 sont des « Modèles du Jour de l'An ».
  • L'Objectif : En regroupant les jours de cette manière, les planificateurs peuvent cesser de traiter chaque jour comme un puzzle unique. Ils peuvent voir la vue d'ensemble : « Oh, une agence utilise un moule de 'Jour de semaine', un moule de 'Week-end' et un moule de 'Jour férié'. »

Le problème des « Noms » vs la « Réalité »

Le document souligne un problème délicat dans la façon dont les données de transport sont actuellement stockées. Elles reposent sur des identifiants administratifs (comme shape_id ou stop_id) qui sont comme des numéros de catalogue internes de bibliothèque.

  • L'Analogie : Imaginez une ligne de bus qui va d'un point A à un point B. Un jour, l'agence de transport change le numéro de catalogue interne de cette ligne de « Route-123 » à « Route-456 », même si le bus s'arrête exactement aux mêmes endroits dans le même ordre.
  • L'Ancienne Méthode : Un ordinateur penserait que la « Route-123 » et la « Route-456 » sont deux bus complètement différents. Il penserait que l'horaire a changé, même si l'expérience du passager est restée la même.
  • La Nouvelle Méthode (Clés H3) : Les auteurs utilisent une astuce ingénieuse appelée indexation H3. Au lieu de se fier aux numéros de catalogue internes, ils regardent la carte physique réelle. Ils transforment chaque arrêt de bus en une petite tuile numérique unique sur une carte (comme un pixel). Si le bus s'arrête sur les mêmes tuiles dans le même ordre, le système sait qu'il s'agit de la même route, quel que soit le nom donné par l'agence en interne. Cela rend le système « immunisé » contre les changements de noms administratifs.

Le test de « Tolérance » : Est-ce un changement ou juste un décalage ?

Une fois que le système a regroupé les jours, il doit les comparer. Les auteurs ont créé une « règle » en trois étapes pour mesurer à quel point deux horaires sont différents :

  1. La Règle Exacte (L'Audit) : Elle vérifie si les horaires sont identiques à la seconde près. Si un bus part à 8:00:00 le lundi et à 8:00:01 le mardi, cette règle dit : « Ce sont des différences ! » Cela est utile pour détecter les erreurs de données ou les micro-ajustements intentionnels.
  2. La Règle Flexible (Tolérante au temps) : C'est la règle de « tous les jours ». Elle demande : « Si nous acceptons un petit retard (disons, 3 minutes), ces horaires sont-ils fondamentalement les mêmes ? » Si le bus part à 8h00 le lundi et à 8h02 le mardi, cette règle dit : « C'est assez proche ! C'est le même horaire, juste légèrement décalé. »
  3. La Règle Structurelle : Elle vérifie si la structure est différente. Si le lundi compte 10 bus et le mardi seulement 2, ou si le mardi saute un arrêt complet, la règle dit : « Ce sont des horaires totalement différents », même si les quelques bus qui circulent sont proches dans le temps.

Ce qu'ils ont découvert

Les auteurs ont testé ce système sur des données réelles du Japon et du Canada.

  • Les Résultats : Ils ont réussi à éliminer l'encombrement et à trouver les modèles cachés. Par exemple, dans une ville canadienne, ils ont trouvé un cycle propre de seulement trois DayTypes : les Jours de semaine, les Samedis et les Dimanches. Dans une ville japonaise, ils ont trouvé un DayType de « Nouvel An » qui était complètement différent de tout le reste.
  • La Surprise : Ils ont découvert qu'au Canada, de nombreux horaires qui semblaient « complètement différents » sur papier (parce que les heures ne correspondaient pas exactement) étaient en fait le même horaire avec de petits décalages temporels. Cependant, au Japon, certains horaires qui semblaient différents étaient véritablement structurellement différents (itinéraires ou arrêts différents), et non de simples décalages horaires.

Pourquoi cela importe

Ce document n'invente pas une nouvelle façon de faire circuler les bus ou de prédire le trafic. À la place, il construit une meilleure couche de traduction.

  • Il prend des données brutes et désordonnées et les transforme en « DayTypes » propres et reconnaissables.
  • Il permet aux ordinateurs de ne plus être confus par les changements de noms ou les minuscules différences de temps.
  • Il donne aux planificateurs une liste compacte et claire de « modèles d'horaires » avec lesquels travailler, ce qui facilite la comparaison entre différentes villes, la vérification des erreurs ou la planification future.

En résumé, ce document fournit une méthode intelligente et stable pour organiser le chaos des horaires de transports publics, transformant une montagne de données quotidiennes en un ensemble gérable de modèles répétitifs.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →