← Últimos artículos
💻 computer science

People Analytics Framework

Este artículo presenta un Marco de Analítica de Personas integral que integra el reconocimiento facial y la reidentificación de personas para identificar, localizar y rastrear con precisión a individuos en entornos cerrados como campus, logrando más del 98,7% de precisión en la verificación facial y un 97,6% de coincidencia en la reidentificación incluso cuando los rostros no son visibles.

Autores originales: Marwa El-nashar, Mohamed Rohaim, Khairy Assar, Aly M. El-semary

Publicado 2026-07-31
📖 1 min de lectura☕ Lectura para el café

Autores originales: Marwa El-nashar, Mohamed Rohaim, Khairy Assar, Aly M. El-semary

Artículo original bajo licencia CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Resumen Técnico: Marco de Trabajo de Analítica de Personas (PAF)

Declaración del Problema
Los sistemas de vigilancia automatizados enfrentan desafíos significativos para identificar individuos cuando los rasgos faciales están ocultos, ocluidos o ausentes del cuadro de la cámara (por ejemplo, cuando una persona está de espaldas). Los sistemas existentes suelen tener dificultades con imágenes de baja resolución, turbulencia atmosférica y condiciones de iluminación variables comunes en la vigilancia de largo alcance o en interiores. Además, la literatura actual indica una brecha en el manejo de imágenes donde el rostro no es visible, lo que requiere una solución robusta que pueda identificar individuos basándose únicamente en su apariencia. El objetivo principal de esta investigación es desarrollar un Marco de Trabajo de Analítica de Personas (PAF, por sus siglas en inglés) integral capaz de detectar, rastrear y verificar individuos en entornos cerrados (como universidades, hospitales y escuelas) independientemente de si sus rostros son visibles.

Metodología
El PAF propuesto es un pipeline de aprendizaje profundo de extremo a extremo diseñado para procesar transmisiones de video desde múltiples cámaras. El sistema opera a través de cuatro fases integradas:

  1. Módulo de Detección y Seguimiento (DTM):

    • Los fotogramas de video se capturan a 30 fps y se redimensionan a 1000x600.
    • El sistema emplea algoritmos de detección y seguimiento de objetos para extraer personas individuales.
    • Un proceso de "limpieza" filtra las imágenes extraídas, eliminando fotogramas con una relación persona-imagen menor a 2:1 o fotogramas que contienen múltiples personas.
    • Las imágenes extraídas se organizan en carpetas basadas en los IDs de seguimiento, creando una base de datos de trayectorias de personas.
    • Selección de Modelo: Los autores compararon combinaciones de YOLOv5 y YOLOv8 con DeepSort y ByteTrack. YOLOv5 combinado con ByteTrack fue seleccionado como la configuración óptima, ofreciendo un equilibrio entre una alta precisión de detección (160 cajas detectadas) y un tiempo de procesamiento aceptable (2m 52.7s).
  2. Módulo de Detección y Reconocimiento Facial (FDRM):

    • Detección Facial: Se evaluaron varios detectores (Haar Cascade, SSD, MTCNN, RetinaFace). MTCNN fue elegido como el detector primario debido a su equilibrio entre precisión y eficiencia computacional, particularmente al manejar imágenes de baja resolución donde otros modelos fallaron o produjeron excesivos falsos positivos.
    • Agrupamiento y Verificación Facial: El sistema utiliza modelos de aprendizaje profundo (VGG16, FaceNet, DeepID, SFace, ArcFace) para extraer vectores de características.
    • Funciones de Pérdida: El marco emplea Triplet Loss y Cluster Loss para agrupar rostros similares y separar los disímiles. Para la verificación, se utiliza la función de pérdida ArcFace para aumentar la variación interclase y reducir la variación intraclase.
    • Selección de Modelo: Entre los modelos de reconocimiento, SFace demostró la mayor eficiencia y precisión (tasa de éxito del 99.80% con distancia euclidiana y 0.47s de tiempo promedio), seguido de ArcFace y VGG-Face.
  3. Módulo de Re-Identificación de Personas (PRM):

    • Este módulo aborda escenarios donde los rostros no son visibles mediante el análisis de la apariencia corporal completa (vestimenta, forma del cuerpo, marcha).
    • Utiliza enfoques de Aprendizaje de Métricas Profundas (DML), específicamente el Aprendizaje de Características de Escala Omnidireccional (OsNet).
    • Selección de Modelo: Se seleccionó OsNet con Triplet Loss, logrando una precisión de Rank-1 de 99.97% y una precisión media promedio (mAP) de 99.92% en el conjunto de datos de prueba.
  4. Integración del Sistema:

    • Los módulos se integran en un pipeline unificado. Cuando un usuario consulta a una persona específica (mediante una imagen o nombre), el sistema busca en la base de datos.
    • Si el rostro es visible, se utiliza la Verificación Facial. Si el rostro no es visible, se emplea la Re-Identificación de Personas.
    • El sistema fusiona datos de diferentes cámaras y marcos de tiempo utilizando IDs de seguimiento para proporcionar una trayectoria completa del individuo.

Contribuciones Clave

  • Marco Híbrido: El artículo propone un marco unificado que combina de manera fluida el reconocimiento basado en el rostro con la Re-Identificación de Personas (ReID) basada en la apariencia, asegurando la identificación incluso cuando los rasgos faciales están ocluidos.
  • Pipeline Operativo: Se establece un pipeline completo y probado para la vigilancia en áreas cerradas, que va desde la captura de video bruto hasta el registro en la base de datos y la respuesta a la consulta del usuario.
  • Selección Empírica de Modelos: El estudio proporciona un análisis comparativo de modelos de vanguardia (variantes de YOLO, DeepSort/ByteTrack, MTCNN, ArcFace, SFace, OsNet) específicamente para este contexto de vigilancia, identificando las combinaciones más efectivas para la precisión y la velocidad.
  • Arquitectura de Base de Datos: La creación de una base de datos estructurada que vincula IDs de personas, marcas de tiempo, ubicaciones de cámaras y datos de trayectoria para responder a consultas de "quién, dónde y cuándo".

Resultados
El sistema fue probado utilizando datos recolectados del entorno del campus de los autores involucrando cuatro cámaras.

  • Precisión General: El sistema integrado logró una tasa de éxito general del 98.7%.
  • Verificación Facial: El sistema alcanzó una tasa de éxito del 97.6% en la verificación facial.
  • Desempeño de ReID: El modelo de ReID seleccionado (OsNet con Triplet Loss) demostró una alta eficacia, con una precisión de Rank-1 de 99.97% y un mAP de 99.92%.
  • Manejo de Oclusión: El marco identificó con éxito a individuos cuyos rostros no eran visibles en los fotogramas, dependiendo del módulo de ReID con una precisión de coincidencia de hasta el 97.6%.

Significancia y Reivindicaciones
El artículo afirma que el PAF aborda con éxito las limitaciones de los sistemas de vigilancia actuales que fallan cuando los rostros no son visibles. Al integrar la detección, el seguimiento, el reconocimiento facial y la ReID en un único marco operativo, el sistema proporciona una solución robusta para el monitoreo de áreas cerradas como campus y hospitales. Los autores enfatizan que el sistema opera de forma independiente para realizar el monitoreo y las alertas.

Los autores reconocen modestamente que la recolección y el etiquetado de datos siguen siendo desafíos significativos, particularmente respecto a las variaciones en la distancia de la cámara, la resolución y los ángulos. Señalan que, si bien el sistema actual funciona bien en su conjunto de datos específico, el trabajo futuro podría involucrar el aprendizaje de adaptación de dominio no supervisado o aprendizaje semisupervisado para mejorar la generalización a entornos no vistos. El artículo no pretende una aplicabilidad universal a todos los escenarios exteriores o de largo alcance, sino que se enfoca en su efectividad dentro de entornos de red privados y controlados.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →