← Últimos artículos
💻 computer science

UAV-Based Drifting Victim Detection in Flash Floods Using Region-Based Convolutional Neural Networks

Este estudio propone un sistema de aprendizaje profundo basado en UAV que utiliza un algoritmo Mask R-CNN ajustado para detectar víctimas a la deriva en inundaciones repentinas y estimar sus trayectorias utilizando metadatos de GPS, logrando más del 90% de confianza en la detección para mejorar las operaciones de Búsqueda y Rescate.

Autores originales: Prima Kristalina, Aries Pratiarso, A. Fauzi Makarim, Munawar Munawar

Publicado 2026-09-01
📖 1 min de lectura☕ Lectura para el café

Autores originales: Prima Kristalina, Aries Pratiarso, A. Fauzi Makarim, Munawar Munawar

Artículo original bajo licencia CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Resumen Técnico: Detección de Víctimas a la Deriva Mediante UAV en Inundaciones Repentinas Utilizando Redes Convolucionales Basadas en Regiones

Planteamiento del Problema
Las inundaciones repentinas representan un desafío crítico para las operaciones de Búsqueda y Rescate (SAR) debido a su aparición rápida, flujos de alta velocidad y la dificultad que enfrentan los equipos terrestres para acceder a las zonas afectadas, particularmente cuando la infraestructura está dañada. Los levantamientos terrestres convencionales suelen ser demasiado lentos o peligrosos, mientras que las imágenes satelitales sufren de limitaciones en resolución, tiempo de revisión y cobertura de nubes. Aunque los Vehículos Aéreos No Tripulados (UAV) ofrecen vigilancia aérea de alta resolución y flexibilidad, el enorme volumen de datos visuales generados hace que la inspección manual sea impracticable para una respuesta de emergencia rápida. Además, la detección de víctimas a la deriva en entornos fluviales dinámicos es compleja; los objetivos suelen ser pequeños, están parcialmente obstruidos y son visualmente similares a los escombros flotantes, lo que requiere algo más que simples cuadros delimitadores rectangulares para delinear con precisión los límites espaciales y las formas.

Metodología
El estudio propone un sistema basado en aprendizaje profundo que utiliza datos de video adquiridos por UAV para detectar y segmentar objetos a la deriva (posibles víctimas) utilizando el algoritmo Mask R-CNN. La metodología sigue un flujo de trabajo de cuatro etapas:

  1. Recolección de Datos: Se creó un conjunto de datos personalizado utilizando dos fuentes:

    • Datos Primarios: 26 archivos de video capturados mediante un dron DJI Mavic Air 2S en el área de Turismo Marino Telocor (Río Porong, Indonesia) a diversas altitudes. Estos se extrajeron en 589 fotogramas de imagen.
    • Datos Secundarios: 463 imágenes obtenidas de redes sociales.
    • El conjunto de datos total se dividió en conjuntos de entrenamiento, validación y prueba. Para el conjunto de datos primario (589 imágenes), se utilizaron 515 para entrenamiento, 48 para validación y 25 para prueba. Para el conjunto de datos secundario (463 imágenes), la división fue de 278 para entrenamiento, 93 para validación y 92 para prueba. Las anotaciones se realizaron utilizando etiquetas como "Severo", "Moderado" y "Leve" para denotar el estado de la inundación.
  2. Procesamiento de Datos: Las imágenes originales se sometieron a un riguroso proceso de preprocesamiento que incluyó:

    • Control de Calidad: Eliminación de imágenes corruptas, de baja resolución, duplicadas o irrelevantes.
    • Anotación: Etiquetado de objetos con cuadros delimitadores.
    • Redimensionamiento: Estandarización de las dimensiones de entrada (por ejemplo, 224×224 o 256×256 píxeles) para la CNN.
    • Normalización: Escalamiento de los valores de los píxeles de 0–255 a un rango de 0–1 mediante la Normalización Min-Max.
    • Aumento de Datos (Augmentation): Incremento del volumen del conjunto de datos mediante la inversión horizontal, rotación, escalado, recorte y ajustes de brillo, contraste, desenfoque y ruido Gaussiano.
  3. Desarrollo del Modelo: El núcleo del sistema es un modelo Mask R-CNN ajustado (fine-tuned). La arquitectura incluye:

    • Backbone: Una CNN para la extracción de características.
    • Red de Pirámide de Características (FPN): Para generar mapas de características multiescala (P1P1P6P6) capaces de detectar objetos en diversas escalas.
    • Red de Propuesta de Regiones (RPN): Para identificar regiones de interés candidatas (RoI).
    • RoIAlign: Para extraer representaciones de características de dimensión fija de las regiones propuestas.
    • Cabezal de Predicción: Para realizar la clasificación, regresión de cuadro delimitador y segmentación de instancias a nivel de píxel.
      El estudio compara un Mask R-CNN estándar (entrenado con el conjunto de datos original) contra una versión ajustada entrenada con el conjunto de datos personalizado y aumentado.
  4. Evaluación: El rendimiento se evaluó mediante Precisión Media (AP), Recuperación Media (AR), confianza de detección y tiempo de inferencia. Las métricas se evaluaron tanto para la detección de cuadros delimitadores como para la segmentación de instancias a través de diferentes umbrales de Intersección sobre Unión (IoU).

Contribuciones Clave
El artículo describe tres contribuciones principales:

  1. Conjunto de Datos Personalizado: El desarrollo de un conjunto de datos de imágenes locales basadas en UAV que representan condiciones de víctimas a la deriva en entornos fluviales afectados por inundaciones, abordando la falta de datos de entrenamiento específicos del dominio.
  2. Marco de Detección Ajustado: La adaptación y el ajuste fino del modelo Mask R-CNN específicamente para imágenes aéreas de inundaciones. Esto aprovecha la segmentación de instancias para proporcionar una delimitación a nivel de píxel de los objetivos, ofreciendo información espacial superior en comparación con los enfoques estándar que solo utilizan cuadros delimitadores.
  3. Herramienta de Evaluación Visual Rápida: Una demostración del potencial del sistema para apoyar las operaciones de SAR al proporcionar información espacial oportuna sobre la ubicación de las víctimas y las direcciones de movimiento en entornos donde el acceso terrestre está restringido.

Resultos
Los resultados experimentales indican que el ajuste fino del modelo Mask R-CNN en el conjunto de datos personalizado superó significativamente al modelo convencional:

  • Confianza de Detección: El modelo ajustado logró una confianza de detección promedio superior al 90%, en comparación con el modelo estándar que se estabilizó entre el 85–89%.
  • Precisión Media (AP):
    • Cuadro Delimitador: El AP en IoU 0.5 aumentó del 54.6% (estándar) al 94.94% (ajustado).
    • Segmentación: El AP en IoU 0.5 aumentó del 52.8% (estándar) al 96.94% (ajustado).
  • Recuperación Media (AR): Se observaron mejoras significativas en la recuperación, particularmente para la segmentación en IoU 0.5, que subió del 52.8% al 92.9% con el modelo ajustado.
  • Eficiencia: El modelo ajustado redujo el tiempo de inferencia promedio de 0.5 segundos a 0.3 segundos por imagen.
  • Métricas Generales: El estudio reporta un aumento en la precisión de detección del 87% al 92%, un F1-score de 0.88 y una precisión media (mAP) de 0.82.

Significancia y Reivindicaciones
Los autores afirman que el enfoque propuesto proporciona una detección de objetos confiable e información espacial para estimar las trayectorias de deriva en entornos fluviales dinámicos. Al utilizar la segmentación de instancias, el sistema puede distinguir entre víctimas y escombros visualmente similares de manera más efectiva que los métodos que dependen únicamente de cuadros delimitadores. El estudio posiciona esta tecnología como una herramienta viable para el reconocimiento aéreo rápido, capaz de apoyar la toma de decisiones durante las respuestas de emergencia en condiciones de inundaciones repentinas caracterizadas por alta velocidad del agua y terrenos complejos. Los autores mantienen un alcance modesto, señalando que, si bien el sistema es efectivo, persisten algunos errores de detección en escenas de baja iluminación y durante movimientos rápidos de la cámara, y que el trabajo futuro debería centrarse en validar el rendimiento en diversos escenarios de SAR del mundo real.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →