← Derniers articles
🤖 machine learning

HERMES: Heterogeneous Edge-Relational Multi-Head Embedded SSM Attention for Traffic Conflict Prediction at Signalized Intersections

Ce document propose HERMES, un réseau de neurones graphiques relationnels à bord hétérogène avec une attention multi-têtes informée par les modèles d'espace d'état (SSM) qui modélise les véhicules et les piétons comme des nœuds et leurs interactions comme des arêtes spécifiques à chaque relation afin de parvenir à une prédiction de conflit de trafic transférable et de pointe aux intersections signalisées en capturant efficacement les topologies d'interaction hétérogènes et la dynamique temporelle sensible à la sécurité.

Auteurs originaux : Md Monzurul Islam, Subasish Das

Publié 2026-07-24
📖 8 min de lecture🧠 Analyse approfondie

Auteurs originaux : Md Monzurul Islam, Subasish Das

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous regardiez une intersection urbaine animée depuis une fenêtre en hauteur. Les voitures filent, tournent et s'arrêtent, tandis que les piétons se faufilent dans les passages pour piétons. Pour un ordinateur, ce n'est pas seulement un chaos désordonné ; c'est un immense puzzle en mouvement où chaque pièce (une voiture ou un piéton) change constamment d'avis et réagit à ses voisins. Pendant des décennies, les experts de la sécurité routière ont tenté de prédire quand ces pièces pourraient s'entrechoquer. Ils avaient l'habitude d'attendre que le crash survienne réellement pour ensuite étudier les débris, mais c'est comme attendre qu'une maison brûle pour apprendre les règles de sécurité incendie. Au lieu de cela, ils ont commencé à observer les « quasi-collisions » (near-misses) — ces moments de pure adrénaline où une voiture pile brusquement à quelques centimètres d'un piéton. On appelle cela des « mesures de sécurité de substitution » (surrogate safety measures). Voyez-les comme la version du monde de la circulation d'un détecteur de « l'avoir échappé belle ».

Cependant, la plupart des anciens programmes informatiques examinaient ces quasi-collisions une paire à la fois, comme vérifier si la Voiture A est trop proche de la Voiture B, puis vérifier si la Voiture C est trop proche du Piéton D, ignorant le fait que l'arrêt soudain de la Voiture A pourrait faire dévier la Voiture B, ce qui effraierait ensuite le Piéton D. C'était comme essayer de comprendre une danse complexe en ne regardant que deux danseurs à la fois. Ce document présente une nouvelle façon plus intelligente d'observer toute la piste de danse à la fois. Il traite l'intersection non pas comme une liste de paires séparées, mais comme une toile vivante et respirante de connexions où chaque mouvement se répercute dans la foule. L'objectif est simple mais vital : construire un système capable de repérer une situation dangereuse avant qu'elle ne tourne au drame, sans déclencher une « fausse alerte » chaque fois que quelqu'un ralentit simplement pour un feu rouge.

Le nouveau « Détective du Trafic » : HERMES

Voici HERMES, un nom sophistiqué pour un nouveau type de cerveau informatique conçu pour prédire les conflits de trafic aux intersections signalisées. Les chercheurs, Md Monzurul Islam et Subasish Das de l'Université d'État du Texas, ont construit ce système pour résoudre le problème de la « platitude » des modèles plus anciens. Imaginez essayer de décrire une symphonie en listant séparément le volume de chaque instrument ; vous manqueriez l'harmonie et le chaos. Les anciens modèles faisaient exactement cela avec le trafic, aplatissant la scène en une liste ennuyeuse de chiffres. HERMES, en revanche, voit l'intersection comme un graphe hétérogène.

En langage clair, un « graphe » est ici simplement une carte de connexions. HERMES dessine une carte où les voitures et les piétons sont les points (nœuds) et leurs interactions sont les lignes (arêtes) qui les relient. Mais ce n'est pas n'importe quelle carte ; c'est une carte hétérogène, ce qui signifie qu'elle sait faire la différence entre une voiture qui communique avec une autre voiture, une voiture qui communique avec une personne, et une personne qui communique avec une autre personne. Elle traite ces relations différemment, tout comme vous traiteriez une conversation avec votre meilleur ami différemment d'une discussion avec un étranger.

Ce qui rend HERMES vraiment spécial, c'est la façon dont il utilise les « mesures de sécurité de substitution » (SSM). Ce sont des indices basés sur la physique comme le Temps avant collision (combien de secondes avant un crash si personne ne bouge) et le DRAC (à quel point quelqu'un doit freiner pour éviter un accident). Au lieu de simplement ajouter ces chiffres à la fin d'une liste, HERMES les intègre directement dans les connexions entre les points. C'est comme donner un super-pouvoir à l'ordinateur : il ne voit pas seulement que deux voitures sont proches ; il voit qu'elles sont proches et qu'elles se dirigent rapidement l'une vers l'autre, et il sait que cette combinaison spécifique est dangereuse.

Comment ça marche : La magie de la toile

HERMES fonctionne par couches, comme si l'on épluchait un oignon ou empilait des blocs de construction.

  1. La couche de graphe : Il observe un instantané de l'intersection et construit un réseau de connexions. Il prête une attention particulière aux « arêtes » (les lignes entre les points) qui présentent des demandes de freinage élevées (DRAC élevé). Si une voiture doit piler, HERMES met immédiatement en évidence cette connexion.
  2. La couche d'attention : C'est la partie « multi-têtes ». Imaginez que HERMES possède plusieurs paires de lunettes, chacune observant la scène à travers un objectif différent. Une paire pourrait se concentrer sur la vitesse, une autre sur la direction, et une autre sur la proximité de chacun. Il combine toutes ces vues pour décider quelles interactions sont les plus critiques.
  3. La couche temporelle : Le trafic ne se produit pas dans une seule photo figée ; c'est un film. HERMES observe une séquence de ces graphes au fil du temps (spécifiquement, 8 images consécutives). Il utilise un système de mémoire (appelé LSTM) pour se souvenir de l'évolution de la situation. Les voitures se sont-elles rapprochées ? Le piéton est-il sorti sur la route ? En observant l'histoire se dérouler, il peut prédire la fin avant qu'elle n'arrive.

Les résultats : Un score presque parfait

Les chercheurs ont testé HERMES en utilisant plus de 109 000 séquences de données de trafic provenant d'une intersection très fréquentée à San Marcos, au Texas. Ils l'ont comparé à toute une équipe d'autres « détectives », incluant des modèles statistiques classiques (comme XGBoost) et des modèles modernes d'apprentissage profond (comme les Transformers).

Les résultats ont été impressionnants. HERMES n'a pas seulement gagné ; il a dominé.

  • Précision : Il a obtenu un score appelé AUC-ROC de 0,9898. Dans le monde des modèles de prédiction, un score de 1,0 est parfait, et 0,5 revient à deviner avec une pièce de monnaie. HERMES était incroyablement proche de la perfection.
  • Le test de la « fausse alerte » : C'est la partie la plus importante pour une utilisation réelle. Si un système de sécurité hurle « ACCIDENT ! » chaque fois qu'une voiture ralentit, personne ne l'écoutera. Les chercheurs ont testé la capacité des modèles à détecter les vrais dangers tout en maintenant les fausses alertes très basses (spécifiquement, seulement 5 % des situations sûres ont été signalées à tort).
    • Le meilleur modèle précédent (un Transformer) a capturé environ 81 % des conflits réels à ce faible taux de fausses alertes.
    • HERMES a capturé 95,7 % des conflits.
    • Cela signifie que HERMES a trouvé presque toutes les situations dangereuses tout en provoquant très peu de fausses alertes.

Ils ont également testé si HERMES pouvait fonctionner dans une autre ville. Ils ont pris le modèle entraîné au Texas et l'ont déposé dans une intersection à Coldwater, dans le Michigan, sans le réentraîner sur les nouvelles données. C'est ce qu'on appelle le « transfert zero-shot ». Même sans avoir vu la nouvelle ville, HERMES a conservé des performances remarquables, capturant 91,45 % des conflits avec un taux de fausse alerte de 5 %. Lorsqu'ils lui ont donné juste un petit peu de données de la nouvelle ville (seulement 20 % des segments d'entraînement), ses performances ont bondi encore plus haut, capturant près de 98,7 % des conflés.

Ce qu'il n'est pas (et ce qu'il invalide)

Il est important de savoir ce que HERMES ne fait pas. L'article argumente explicitement contre l'idée que l'on puisse simplement observer une paire d'usagers de la route (comme une voiture et un piéton) de manière isolée pour comprendre le risque. L'étude démontre qu'observer les interactions individuellement ou aplatir la scène en une simple liste de chiffres fait manquer le réseau complexe de causes et d'effets qui mène aux accidents.

Le document invalide également l'idée qu'il faut une quantité massive de nouvelles données de chaque nouvel emplacement pour faire fonctionner le système. Bien que l'ajout d'un peu de données locales aide, le système est suffisamment robuste pour bien fonctionner sur un nouveau site simplement en apprenant d'un autre site similaire.

L'essentiel

Cet article suggère que l'avenir de la sécurité routière ne dépend pas seulement de meilleures caméras ou d'ordinateurs plus rapides ; il dépend d'une meilleure compréhension. En traitant le trafic comme un réseau connecté de relations plutôt que comme une liste d'événements isolés, HERMES peut voir le danger arriver beaucoup plus tôt et avec plus de précision que jamais auparavant. C'est une étape puissante vers un monde où les intersections sont plus sûres, non pas parce que nous attendons les accidents, mais parce que nous pouvons repérer les quasi-collisions et corriger le problème avant que quelqu'un ne soit blessé. Les auteurs concluent que cette approche fournit une base solide pour construire des moniteurs de sécurité routière assez intelligents pour faire la distinction entre un moment stressant et un véritable accident.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →