UniTraffic-Agent: Unified Traffic Video Reasoning for AI City Challenge 2026 Track 3 with Two Out-of-Domain Evaluations
Ce document présente UniTraffic-Agent, un cadre unifié employant un flux de travail observer-raisonner-agir-vérifier pour relever les défis du raisonnement sur les vidéos de trafic dans l'AI City Challenge 2026, atteignant des performances de premier plan à travers le raisonnement sur les anomalies de trafic et deux évaluations hors domaine pour les événements de type œil-de-poisson et l'intention des piétons.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous soyez un détective tentant de résoudre un mystère, mais au lieu d'une scène de crime, votre preuve est une vidéo chaotique et mouvementée d'une rue citadine animée. C'est le monde de la compréhension de vidéos de trafic, un domaine où les ordinateurs tentent de donner un sens à ce qui se passe sur nos routes. Pendant longtemps, les ordinateurs étaient excellents pour repérer un objet unique, comme une voiture rouge ou un panneau stop, dans une photo fixe. Mais la vraie vie n'est pas une photo ; c'est un film. Pour comprendre un accident de la route ou une collision évitée de justesse, un ordinateur doit faire plus que simplement « voir » ; il doit regarder, réfléchir et relier les points au fil du temps. Il doit déterminer qui a fait quoi, pourquoi il l'a fait, et quand cela s'est produit. C'est délicat car les vidéos de trafic sont désordonnées : la caméra peut avoir un objectif grand angle déformant, l'action peut se produire en une fraction de seconde, et un même clip peut devoir répondre à de nombreuses questions différentes. L'objectif de cette recherche est de construire un système informatique qui agit comme un détective surdoué et patient qui ne manque jamais un détail, peu importe la configuration de la caméra.
Entrez dans l'ère de UniTraffic-Agent, un nouveau détective numérique créé par une équipe de chercheurs pour relever le défi du « Raisonnement sur les Anomalies de Trafic ». Considérez cet agent comme un enquêteur hautement organisé qui ne se contente pas de jeter un coup d'œil à une vidéo pour deviner. Au lieu de cela, il suit une routine stric히 en quatre étapes : Observer, Raisonner, Agir et Vérifier.
D'abord, dans la phase d'Observation, l'agent est intelligent dans sa façon de regarder la vidéo. Au lieu d'essayer de traiter chaque image (ce qui reviendrait à lire chaque mot d'un livre alors que vous n'avez besoin que du résumé de l'intrigue), il choisit les moments les plus importants. Si une question porte sur quelque chose qui se passe à un moment précis, l'agent zoome sur les secondes précédant et suivant ce moment, tout en saisissant quelques images du début et de la fin pour garder une vue d'ensemble. C'est comme un détective qui sait exactement quelles secondes d'une bande de vidéosurveillance rembobiner pour attraper l'indice crucial.
Ensuite vient le Raisonnement. C'est ici que l'agent excelle. Souvent, un seul clip vidéo comporte de nombreuses questions attachées, telles que « Qui a brûlé le feu ? », « Quel était le temps ? » ou « Combien de temps la voiture a-t-elle attendu ? ». Les anciens systèmes pourraient essayer de répondre à chaque question une par une, ce qui peut mener à des contradictions — comme dire que la voiture était rouge dans une réponse et bleue dans une autre. UniTraffic-Agent fait quelque chose de différent : il regarde l'ensemble du clip une seule fois, construit un récit unique et partagé sur ce qui s'est passé, puis utilise ce même récit pour répondre à toutes les questions à la fois. Cela garantit que l'histoire du détective est cohérente du début à la fin.
Puis la phase d'Action entre en jeu. Différentes tâches nécessitent différents formats. Une tâche peut nécessiter un simple « Oui » ou « Non », tandis qu'une autre nécessite un fichier JSON détaillé avec 13 champs différents décrivant une infraction au code de la route. L'agent utilise des « adaptateurs » spéciaux — pensez à des traducteurs ou des changeurs de forme — pour prendre son récit partagé et le remodeler selon le format exact requis pour chaque tâche spécifique.
Enfin, l'étape de Vérification agit comme un inspecteur de contrôle qualité. Il revérifie les réponses, s'assure que les noms et les heures correspondent, et si quelque chose semble étrange, il retourne aux images vidéo mises en cache pour essayer à nouveau. Ce mécanisme de « tentative de réessai » aide l'agent à corriger ses propres erreurs sans avoir besoin d'aide humaine.
Les chercheurs ont testé cet agent sur trois types de vidéos de trafic très différents : des images de surveillance standard, des vidéos avec un objectif grand angle déformant et des vidéos de caméras embarquées (dashcams). Les résultats sont impressionnants. Sur la tâche de l'objectif grand angle, l'agent s'est classé 2ème de tous les concurrents, et sur la tâche d'intention des piétons, il s'est classé 4ème. Même sur la tâche principale, la plus difficile, il s'est classé 16ème. L'équipe a constaté que, bien que l'agent soit excellent pour repérer les acteurs et le flux général des événements, il peinait parfois avec les descriptions très longues et détaillées ou pour interpréter la géométrie déformée des objectifs grand angle. Cependant, l'étude suggère qu'en combinant une observation intelligente avec un processus de raisonnement unifié, nous pouvons construire une IA de trafic beaucoup plus fiable et cohérente qu'auparavant. Le code de ce « détective » est désormais ouvert pour que d'autres puissent apprendre et l'améliorer.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.