← Derniers articles
💻 computer science

People Analytics Framework

Cet article présente un cadre complet d'analyse du personnel (People Analytics Framework) qui intègre la reconnaissance faciale et la réidentification de personnes pour identifier, localiser et suivre avec précision les individus dans des environnements fermés tels que les campus, atteignant une précision de vérification faciale de plus de 98,7 % et un taux de correspondance de réidentification de 97,6 % même lorsque les visages ne sont pas visibles.

Auteurs originaux : Marwa El-nashar, Mohamed Rohaim, Khairy Assar, Aly M. El-semary

Publié 2026-07-31
📖 1 min de lecture☕ Lecture pause café

Auteurs originaux : Marwa El-nashar, Mohamed Rohaim, Khairy Assar, Aly M. El-semary

Article original sous licence CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Résumé Technique : Cadre d'Analyse des Personnes (People Analytics Framework - PAF)

Énoncé du Problème
Les systèmes de surveillance automatisés sont confrontés à des défis importants pour identifier les individus lorsque les traits du visage sont masqués, occultés ou absents du champ de la caméra (par exemple, lorsqu'une personne tourne le dos). Les systèmes existants peinent souvent face aux images à basse résolution, à la turbulence atmosphérique et aux variations de luminosité courantes dans la surveillance à longue distance ou en intérieur. De plus, la littérature actuelle indique une lacune dans la gestion des images où le visage n'est pas visible, nécessissant une solution robuste capable d'identifier les individus sur la seule base de leur apparence. L'objectif principal de cette recherche est de développer un cadre complet d'analyse des personnes (PAF) capable de détecter, de suivre et de vérifier des individus dans des environnements fermés (tels que les universités, les hôpitaux et les écoles), indépendamment de la visibilité de leur visage.

Méthodologie
Le PAF proposé est un pipeline de deep learning de bout en bout conçu pour traiter les flux vidéo provenant de plusieurs caméras. Le système fonctionne à travers quatre phases intégrées :

  1. Module de Détection et de Suivi (Detection and Tracking Module - DTM) :

    • Les images vidéo sont capturées à 30 fps et redimensionnées à 1000x600.
    • Le système utilise des algorithmes de détection et de suivi d'objets pour extraire les individus.
    • Un processus de « nettoyage » filtre les images extraites, supprimant les images avec un ratio personne-image inférieur à 2:1 ou les images contenant plusieurs personnes.
    • Les images extraites sont organisées dans des dossiers basés sur les identifiants de suivi (tracker IDs), créant ainsi une base de données de trajectoires de personnes.
    • Sélection du Modèle : Les auteurs ont comparé des combinaisons de YOLOv5 et YOLOv8 avec DeepSort et ByteTrack. YOLOv5 combiné avec ByteTrack a été sélectionné comme la configuration optimale, offrant un équilibre entre une haute précision de détection (160 boîtes détectées) et un temps de traitement acceptable (2m 52.7s).
  2. Module de Détection et de Reconnaissance Faciale (Face Detection and Recognition Module - FDRM) :

    • Détection Faciale : Divers détecteurs (Haar Cascade, SSD, MTCNN, RetinaFace) ont été évalués. MTCNN a été choisi comme détecteur principal en raison de son équilibre entre précision et efficacité computationnelle, particulièrement pour gérer les images à basse résolution là où d'autres modèles échouaient ou produisaient trop de faux positifs.
    • Clustering et Vérification Faciale : Le système utilise des modèles de deep learning (VGG16, FaceNet, DeepID, SFace, ArcFace) pour extraire des vecteurs de caractéristiques.
    • Fonctions de Perte (Loss Functions) : Le cadre utilise la Triplet Loss et la Cluster Loss pour regrouper les visages similaires et séparer les visages dissemblables. Pour la vérification, la fonction de perte ArcFace est utilisée pour augmenter la variation inter-classe et réduire la variation intra-classe.
    • Sélection du Modèle : Parmi les modèles de reconnaissance, SFace a démontré la plus grande efficacité et précision (taux de réussite de 99,80 % avec la distance euclidienne et 0,47 s en moyenne), suivi d'ArcFace et VGG-Face.
  3. Module de Ré-identification de Personne (Person Re-Identification Module - PRM) :

    • Ce module traite les scénarios où les visages ne sont pas visibles en analysant l'apparence corporelle complète (vêtements, forme du corps, démarche).
    • Il utilise des approches d'apprentissage métrique profond (Deep Metric Learning - DML), spécifiquement l'apprentissage de caractéristiques à échelle omni (Omni-Scale Feature Learning - OsNet).
    • Sélection du Modèle : OsNet avec Triplet Loss a été sélectionné, atteignant une précision Rank-1 de 99,97 % et une précision moyenne moyenne (mAP) de 99,92 % sur le jeu de données de test.
  4. Intégration du Système :

    • Les modules sont intégrés dans un pipeline unifié. Lorsqu'un utilisateur interroge une personne spécifique (via une image ou un nom), le système recherche dans la base de données.
    • Si le visage est visible, la vérification faciale est utilisée. Si le visage n'est pas visible, la ré-identification de personne est employée.
    • Le système fusionne les données de différentes caméras et de différents moments temporels en utilisant les identifiants de suivi pour fournir une trajectoire complète de l'individu.

Contributions Clés

  • Cadre Hybride : L'article propose un cadre unifié qui combine de manière fluide la reconnaissance basée sur le visage et la ré-identification de personne (ReID) basée sur l'apparence, garantissant l'identification même lorsque les traits du visage sont occultés.
  • Pipeline Opérationnel : Un pipeline complet et testé est établi pour la surveillance en zone fermée, allant de la capture vidéo brute à l'enregistrement dans la base de données et la réponse à la requête de l'utilisateur.
  • Sélection Empirique de Modèles : L'étude fournit une analyse comparative de modèles de pointe (variantes de YOLO, DeepSort/ByteTrack, MTCNN, ArcFace, SFace, OsNet) spécifiquement pour ce contexte de surveillance, identifiant les combinaisons les plus efficaces pour la précision et la vitesse.
  • Architecture de Base de Données : La création d'une base de données structurée qui lie les identifiants de personnes, les horodatages, les emplacements des caméras et les données de trajectoire pour répondre aux requêtes « qui, où et quand ».

Résultats
Le système a été testé à l'aide de données collectées dans l'environnement du campus des auteurs impliquant quatre caméras.

  • Précision Globale : Le système intégré a atteint un taux de réussite global de 98,7 %.
  • Vérification Faciale : Le système a atteint un taux de réussite de 97,6 % pour la vérification faciale.
  • Performance de la ReID : Le modèle de ReID sélectionné (OsNet avec Triplet Loss) a démontré une grande efficacité, avec une précision Rank-1 de 99,97 % et une mAP de 99,92 %.
  • Gestion de l'Occlusion : Le cadre a réussi à identifier des individus dont les visages n'étaient pas visibles dans les images, en s'appuyant sur le module de ReID avec une précision de correspondance allant jusqu'à 97,6 %.

Signification et Revendications
L'article affirme que le PAF répond avec succès aux limites des systèmes de surveillance actuels qui échouent lorsque les visages ne sont pas visibles. En intégrant la détection, le suivi, la reconnaissance faciale et la ReID dans un cadre opérationnel unique, le système fournit une solution robuste pour la surveillance des zones fermées comme les campus et les hôpitaux. Les auteurs soulignent que le système fonctionne de manière indépendante pour effectuer la surveillance et l'alerte.

Les auteurs reconnaissent modestement que la collecte et l'étiquetage des données restent des défis importants, particulièrement concernant les variations de distance de la caméra, de résolution et d'angle. Ils notent que bien que le système actuel soit performant sur leur jeu de données spécifique, les travaux futurs pourraient impliquer l'adaptation de domaine non supervisée ou l'apprentissage semi-supervisé pour améliorer la généralisation à des environnements non vus avec un étiquetage manuel minimal. L'article ne prétend pas à une applicabilité universelle à tous les scénarios extérieurs ou à longue distance, mais se concentre sur son efficacité au sein d'environnements réseaux privés contrôlés.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →