← Derniers articles
⚡ electrical engineering

An Open-Source Two-Stage Computer Vision Pipeline for Fine-Grained Vehicle Classification using Vision Transformers

Ce document présente un pipeline de vision par ordinateur en deux étapes et en open-source combinant RT-DETR et les Vision Transformers pour classifier avec précision six types de carrosseries de véhicules à grain fin pertinents pour la sécurité des cyclistes, doté d'un mécanisme d'abstention basé sur la confiance qui maintient une grande robustesse à travers différents sites d'enregistrement tout en empêenchant les mauvaises classifications silencieuses.

Auteurs originaux : Gandhimathi Padmanaban, Fred Feng

Publié 2026-06-04
📖 7 min de lecture🧠 Analyse approfondie

Auteurs originaux : Gandhimathi Padmanaban, Fred Feng

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayez de trier une pile de courrier massive. Certaines lettres sont clairement marquées « Journal », d'autres « Magazine » et d'autres « Publicité ». Mais vous avez aussi des milliers d'enveloppes qui pourraient être n'importe quoi : une carte d'anniversaire, une facture, un prospectus ou une lettre d'avocat. Si vous vous contentez de deviner, vous risquez de faire des erreurs.

Ce document présente un nouveau « trieur robotique » en open-source, conçu pour observer des séquences vidéo de rues et trier les véhicules en catégories très spécifiques, et non pas seulement dans les grandes catégories habituelles.

Voici comment le système fonctionne, décomposé en étapes simples :

1. Le Problème : Pourquoi avons-nous besoin d'un meilleur trieur ?

Actuellement, la plupart des caméras de trafic et des études de sécurité ne font que distinguer la différence entre une « voiture », un « camion » ou un « bus ». Mais pour la sécurité des cyclistes, cela ne suffit pas.

  • L'analogie : Imaginez un cycliste percuté. Si une petite berline le percute, c'est grave. Mais si un SUV imposant ou un énorme camion commercial le percute, les blessures sont souvent bien plus graves car l'avant du véhicule est plus haut et percute le cycliste différemment.
  • La lacune : Nous avons besoin de savoir exactement quel type de véhicule passe à côté d'un cycliste (par exemple, est-ce un monospace ou une grande camionnette ? Est-ce un pick-up ou un camion de transport ?). Les outils existants ne peuvent pas faire la distinction entre ces types spécifiques dans des vidéos réelles et désordonnées.

2. La Solution : Une équipe de détectives en deux étapes

Les auteurs ont construit un système en deux étapes, comme une équipe de deux détectives travaillant ensemble.

Détective n°1 : L'éclaireur rapide (RT-DETR)

  • Son travail : Ce détective scanne la vidéo rapidement. Il n'a pas besoin de connaître le modèle exact de la voiture ; il doit juste dire : « Hé, il y a un véhicule là ! » et dessiner un cadre autour de lui.
  • Sa spécialité : Il est très doué pour repérer n'importe quoi qui ressemble à une voiture, un camion, un bus ou une moto. Il utilise un cerveau pré-entraîné, donc il n'a pas eu besoin d'apprendre à repérer les voitures en partant de zéro.
  • Le filtre : S'il voit un bus ou une moto, il s'arrête là. S'il voit une « voiture » ou un « camion », il transmet le travail au Détective n°2.

Détective n°2 : L'expert en classification (Vision Transformer)

  • Son travail : Ce détective prend le « recadrage » spécifique (l'image à l'intérieur du cadre) provenant du Détective n°1 et l'examine de très près.
  • Sa spécialité : C'est l'expert de la classification fine. Il trie le véhicule en une de six catégories spécifiques :
    1. Voiture particulière
    2. SUV
    3. Pick-up
    4. Monospace
    5. Grande camionnette (Van)
    6. Camion de transport
  • Le bouton « Je ne sais pas » : C'est la partie la plus importante. Si l'image est floue, que l'angle est étrange ou que le véhicule est partiellement caché, ce détective peut se sentir incertain. Au lieu de deviner et potentiellement commettre une erreur, il a une règle : « Si je suis sûr à moins de 60 %, je dirai "Inconnu". »
    • Pourquoi cela compte : Dans la recherche sur la sécurité, il vaut mieux dire « Je ne sais pas » que de dire avec assurance « C'est un pick-up » alors qu'il s'agit d'un monospace. Cela évide les « erreurs silencieuses ».

3. L'Entraînement : Comment ils ont appris au robot

Apprendre à un robot à faire la différence entre une « Grande camionnette » et un « Camion de transport » est difficile car il y a très peu de photos de ces camions spécifiques dans les jeux de données standards.

  • Le mélange : Les chercheurs ont construit une bibliothèque d'entraînement personnalisée en mélangeant trois éléments :
    1. Photos de studio : Des photos de haute qualité de voitures issues d'un jeu de données célèbre (Stanford Cars).
    2. Web Scraping : Ils ont rassemblé des images de camionnettes et de camions provenant d'Internet.
    3. Extraits de rues réelles : Ils ont pris de véritables clips vidéo d'Ann Arbor, dans le Michigan, et ont découpé les véhicules pour montrer au robot ce que sont les conditions de rue réelles et désordonnées (floues, de côté, partiellement cachées).
  • Le déséquilibre : Le robot a vu beaucoup plus d'images de voitures et de SUV ordinaires que de gros camions. Pour corriger cela, le processus d'entraînement a été ajusté pour prêter une attention particulière aux images rares de camions afin que le robot ne les ignore pas.

4. Les Résultats : À quel point cela a-t-il fonctionné ?

L'équipe a testé ce robot sur deux ensembles de vidéos différents.

Test 1 : Le « terrain connu » (In-Distribution)

  • La configuration : Ils ont testé le système sur des vidéos provenant de la même rue où ils ont pris les clips d'entraînement (Ann Arbor).
  • Le score : Il a obtenu 94 % de réussite.
  • Les détails : Il était incroyable pour repérer les SUV (97 % de précision). Il était également très bon pour les voitures particulières et les pick-ups. La seule fois où il a eu des difficultés, c'est quand le véhicule était difficile à voir, et il a correctement utilisé son bouton « Je ne sais pas » au lieu de deviner de travers.

Test 2 : Le « match à l'extérieur » (Out-of-Distribution)

  • La configuration : Ils ont testé le système sur une vidéo provenant d'un lieu complètement différent, prise par un vélo de recherche spécial avec des caméras et un éclairage différents. Ils n'ont pas réentraîné le robot pour ce nouvel emplacement.
  • Le score : Il a obtenu 89 % de réussite.
  • Les détails : C'est un résultat très solide pour un système qui n'a pas été réentraîné pour un nouvel endroit.
    • Les SUV et les Pick-ups sont restés très précis.
    • Les Monospaces sont devenus un peu plus délicats. La précision a chuté, mais principalement parce que le robot est devenu plus prudent. Il a commencé à dire « Inconnu » plus souvent (25 % du temps) car les monospaces paraissaient différents dans cette nouvelle vidéo. Il n'a pas commencé à deviner n'importe quoi ; il a simplement admis son incertitude.

5. Pourquoi cela est important

  • C'est en Open Source : Les auteurs ont publié tout le code, le cerveau du robot entraîné et les données gratuitement. N'importe qui peut les télécharger et les utiliser pour analyser ses propres vidéos de rues.
  • La sécurité avant tout : En distinguant une petite voiture d'un gros camion, les urbanistes et les chercheurs en sécurité peuvent enfin comprendre exactement quels types de véhicules mettent les cyclistes en danger.
  • Pas de travail manuel : Avant cela, les humains devaient regarder des heures de vidéo pour compter ces véhicules. Maintenant, cet outil peut le faire automatiquement.

En bref, ce document présente un outil intelligent et gratuit qui agit comme un filtre en deux étapes. D'abord, il trouve les voitures. Ensuite, il les trie soigneusement en types spécifiques. S'il n'est pas sûr, il l'admet, garantissant que les données de sécurité ne sont pas corrompues par de mauvaises suppositions. Il fonctionne bien même sur de nouvelles rues sans avoir besoin d'être réentraîné.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →