← Derniers articles
💻 computer science

A Comparative Study of Faster R-CNN, Mask R-CNN, and YOLOv8 for Object Detection and Instance Segmentation, with a Custom-Class Transfer-Learning Case Study

Cet article propose une analyse comparative théorique et qualitative de Faster R-CNN, Mask R-CNN et YOLOv8 pour la détection d'objets et la segmentation d'instances, démontrant, à travers une étude de cas personnalisée sur des véhicules militaires, que les détecteurs à étape unique légers peuvent s'adapter efficacement à de nouvelles classes via l'apprentissage par transfert tout en surpassant les modèles à deux étapes entraînés uniquement sur des jeux de données généraux, le tout dans le contexte des architectures de détection en temps réel en pleine évolution.

Auteurs originaux : Muhammad Usman Aslam

Publié 2026-09-21✓ Author reviewed ⓘ
📖 7 min de lecture🧠 Analyse approfondie

Auteurs originaux : Muhammad Usman Aslam

Article original sous licence CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ✨ Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Dans le monde de la vision par ordinateur, les machines apprennent à voir le monde non pas seulement comme une collection de couleurs et de formes, mais comme une scène remplie d'objets distincts. Ce domaine, connu sous le nom de détection d'objets, est la technologie qui permet à une voiture autonome de reconnaître un piéton, à une caméra de sécurité de repérer un intrus ou à un scanner médical d'identifier une tumeur. Pour qu'une machine puisse faire cela, elle doit accomplir deux tâches difficiles simultanément : elle doit trouver où un objet est situé dans une image, et elle doit décider exactement ce qu'est cet objet. Pendant des années, les chercheurs ont débattu de la meilleure façon d'apprendre à un ordinateur à faire cela. Certaines approches agissent comme un inspecteur méticuleux, scannant une image lentement et méthodiquement pour s'assurer que chaque détail est correct, tandis que d'autres agissent comme un coup d'œil rapide, traitant l'ensemble de la scène en une seule passe pour donner la priorité à la vitesse. La question centrale pour les ingénieurs est de savoir comment équilibrer ce compromis entre être parfaitement précis et être assez rapide pour fonctionner en temps réel.

Une étude récente de Muhammad Usman Aslam, de l'Université de l'Ouest de la Floride, explore cet équilibre en testant trois systèmes informatiques différents conçus pour voir le monde. La recherche compare deux méthodes établies qui fonctionnent par étapes, dont l'une peut également tracer des contours précis autour des objets, contre une méthode plus récente et plus rapide qui traite les images d'un seul coup. L'étude ne se contente pas de comparer ces systèmes sur des images de test standards ; elle s'attaque à un problème pratique que les tests standards ignorent souvent : que se passe-t-il lorsqu'une machine rencontre un objet qu'elle n'a jamais appris à reconnaître ? Pour répondre à cela, le chercheur a entraîné un système moderne et rapide pour identifier des véhicules blindés militaires, une catégorie d'objets qui n'existe pas dans la bibliothèque standard d'images utilisée pour entraîner la plupart des modèles de vision par ordinateur.

L'investigation a commencé par l'examen de la structure de ces trois systèmes, connus sous les noms de Faster R-CNN, Mask R-CNN et YOLOv8. Les deux premiers systèmes fonctionnent selon un processus en deux étapes. D'abord, ils scannent une image pour trouver des régions qui pourraient contenir un objet, puis ils analysent ces régions spécifiques pour décider de ce qu'est l'objet et où se trouvent ses contours. Mask R-CNN ajoute une troisième étape, lui permettant de tracer un contour au pixel près autour de chaque objet, le séparant de l'arrière-plan et des autres objets qui se chevauchent. Ces méthodes sont connues pour leur grande précision mais nécessitent plus de puissance de calcul et de temps. Le troisième système, YOLOv8, adopte une approche différente. Il regarde l'image entière en une seule passe, prédisant l'emplacement et le type de chaque objet en même temps. Cette conception est faite pour la vitesse, ce qui la rend idéale pour les applications en temps réel comme la vidéosurveillance, bien qu'elle ait historiquement été considérée comme légèrement moins précise sur des objets très petits ou encombrés.

Pour tester ces systèmes dans le monde réel, le chercheur a utilisé un ensemble standard d'images contenant des articles courants comme des personnes, des voitures et des animaux pour voir comment les systèmes pré-entraînés performaient. Lorsque le système Faster R-CNN a été confronté à des images de scarabées, il les a correctement identifiés mais a également produit des suppositions supplémentaires, avec un indice de confiance plus faible, pour des « insectes » aux mêmes endroits, montrant que le système éprouve parfois des difficultés lorsque différentes catégories d'objets se chevauchent ou se ressemblent beaucoup. Lorsqu'on lui a montré la photo d'un oiseau, le système a hésité entre l'appeler un « oiseau », un « animal » ou un type spécifique d'oiseau, révélant que son vocabulaire est limité aux 80 catégories spécifiques pour lesquelles il a été initialement enseigné. Le système Mask R-CNN a performé de manière impressionnante sur les images standards, réussissant à séparer des zèbres et des personnes se chevauchant dans une foule avec des contours précis, mais il a nécessité beaucoup plus de ressources informatiques pour le faire.

La partie la plus significative de l'étude, cependant, était la tentative d'apprendre à ces systèmes à voir quelque chose qu'ils n'avaient jamais vu auparavant : des chars. Les modèles de vision par ordinateur standards sont des systèmes à « vocabulaire fermé », ce qui signifie qu'ils ne peuvent reconnaître que la liste spécifique d'objets pour lesquels ils ont été entraînés. Lorsque le chercheur a montré aux modèles standard Faster R-CNN et Mask R-CNN des images de véhicules blindés militaires, les machines n'ont pas réussi à les identifier comme des chars. Au lieu de cela, elles ont forcé les images dans les catégories les plus proches qu'elles connaissaient, étiquetant les chars comme des « camions » ou des « voitures ». Ce n'était pas un échec de la capacité de la machine à voir la forme du véhicule, mais une limitation de son vocabulaire ; elle n'avait tout simplement pas le mot « char » dans son dictionnaire.

Pour résoudre cela, le chercheur s'est tourné vers le système YOLOv8 et a utilisé une technique appelée apprentissage par transfert (transfer learning). Au lieu de partir de zéro, le système a reçu un petit ensemble de données personnalisées de seulement vingt images de chars, qui avaient été manuellement étiquetées par un humain. Le système a ensuite été affiné sur ce petit ensemble d'images. Le résultat fut frappant. Le système YOLOv8, qui avait été adapté à cette nouvelle classe, a identifié avec succès des chars dans des expositions de musées et des photographies en extérieur avec un haut niveau de confiance. Il a même reconnu un véhicule blindé en mouvement dans un champ, malgré le flou et la distance, prouvant qu'un détecteur léger et rapide peut être rapidement adapté à un nouveau travail spécifique avec très peu de données.

L'étude conclut que si les anciens systèmes à deux étapes restent excellents pour les tâches polyvalentes où une haute précision est nécessaire pour des objets connus, ils sont rigides lorsqu'il s'agit de nouvelles catégories. Ils ne peuvent pas reconnaître ce qu'on ne leur a pas explicitement enseigné. En revanche, le système YOLOv8 à une seule étape a démontré une flexibilité qui est très précieuse pour les applications pratiques. Il a montré qu'avec un petit effort humain pour étiqueter quelques nouvelles images, un détecteur rapide peut être étendu pour reconnaître des types d'objets entièrement nouveaux. Cela suggère que pour de nombreux problèmes du monde réel, où l'objectif est de détecter des articles spécifiques et personnalisés plutôt que de simples catégories générales, la vitesse et l'adaptabilité de l'approche plus récente à une seule étape peuvent être plus utiles que la précision brute des anciennes méthodes plus lentes. La recherche note également que le domaine évolue rapidement, de nouveaux modèles émergeant pour viser à combiner la vitesse des systèmes à une seule étape avec la précision des anciens, mais la leçon fondamentale reste claire : le meilleur outil dépend de si vous avez besoin d'une machine qui connaît tout sur le monde, ou d'une qui peut rapidement apprendre à voir quelque chose de nouveau.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →