XAI and Statistical Analysis for Reliable Intrusion Detection in the UAVIDS-2025 Dataset: From Tree to Hybrid and Tabular DNN Ensembles
Autores originales: Iakovos-Christos Zarkadis, Christos Douligeris
Autores originales: Iakovos-Christos Zarkadis, Christos Douligeris
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Resumen Técnico: XAI y Análisis Estadístico para la Detección Confiable de Intrusiones en el Conjunto de Datos UAVIDS-2025
Enunciado del Problema
El artículo aborda el desafío de detectar intrusiones en redes de Vehículos Aéreos No Tripulados (UAV), específicamente en el contexto del emergente conjunto de datos UAVIDS-2025. Si bien la Inteligencia Artificial Explicable (XAI) y la Interpretabilidad Mecanística han ganado relevancia en sistemas críticos, persiste la necesidad de comprender los procesos de toma de decisiones de modelos complejos de Aprendizaje Automático (ML) al enfrentarse a vectores de ataque específicos. Una dificultad principal identificada en el conjunto de datos UAVIDS-2025 es la "Intersección de Soporte de Densidad", donde ciertos tipos de ataques —específicamente los ataques de Agujero Negro (Blackhole) y Túnel (Wormhole)— exhiben una superposición significativa en sus distribuciones de características. Esta superposición crea ambigüedad que conduce a clasificaciones erróneas, incluso en modelos de alto rendimiento, lo que hace necesaria un enfoque riguroso que combine clasificación avanzada, XAI y pruebas estadísticas no paramétricas para distinguir entre ataques enmascarados.
Metodología
1. Preprocesamiento de Datos e Ingeniería de Características
El estudio utiliza el conjunto de datos UAVIDS-2025, que contiene aproximadamente 120.000 observaciones con 22 características y una variable objetivo que comprende cuatro tipos de ataques (Síbil, Agujero Negro, Túnel, Inundación) y tráfico normal. La tubería de preprocesamiento incluyó:
- Limpieza: Eliminación de valores duplicados, la característica redundante "Protocolo" (exclusivamente UDP) y el índice no informativo "FlowID".
- Codificación: Codificación de etiquetas para la variable objetivo; codificación ficticia (dummy) para los puertos de origen/destino; y codificación por frecuencia para las direcciones IP.
- Transformación: Aplicación de transformaciones de potencia y recíprocas para la ingeniería de características.
- Escalado: La detección de valores atípicos mediante el Rango Intercuartílico (IQR) y Diagramas de Caja (Box-Plots) llevó a la selección del Escalador Robusto (Robust Scaler).
- Selección de Características: La Eliminación Recursiva de Características (RFE) con un Random Forest identificó características con una contribución >2.5%. Para prevenir problemas de multicolinealidad en el análisis SHAP, se eliminaron las características con correlaciones de Pearson/Kendall >0.7, resultando en un conjunto final de ocho características seleccionadas: LostPackets, RxBytes, RxByteRate/s, MeanDelay/s, MeanJitter/s, PacketDropRate, AverageHopCount y DstPort654.
2. Entrenamiento y Evaluación del Modelo
Los autores evaluaron un amplio espectro de algoritmos utilizando validación cruzada estratificada de 10 pliegues con ajuste de hiperparámetros mediante búsqueda en cuadrícula (grid-search) y calibración de probabilidades. Las familias de modelos incluyeron:
- Ensembles de Árboles: XGBoost, LightGBM, Random Forest, Extra-Trees, Gradient Boosting, HB-Gradient Boosting, AdaBoost y Bagging.
- Redes Neuronales Profundas (DNN): MLP, RealMLP y versiones de ensemble (Ensemble-RealMLP, Ensemble-NN-Torch, Ensemble-NNFastAiTab).
- Apilamiento Híbrido: Modelos que combinan estimadores lineales, de árboles y bayesianos (por ejemplo, Stacking-1 y Stacking-2).
- Líneas Base: Regresión Logística y SVM.
El rendimiento se evaluó utilizando F1-score, Precisión, Recall y Roc-Auc.
3. Explicabilidad y Análisis Estadístico
- Análisis SHAP: El modelo de mejor rendimiento (XGBoost) fue sometido a un análisis de explicaciones aditivas de Shapley (SHAP) para determinar las importancias globales y locales de las características. Esto incluyó examinar cómo características específicas impulsan las predicciones para observaciones individuales frente a las tendencias generales de clase.
- Análisis de Distribución: Se utilizaron diagramas de violín (Violin plots) y Estimaciones de Densidad Kernel (KDE) para visualizar las formas de los datos, la asimetría y las distribuciones multimodales.
- Prueba de Permutación Westfall-Young: Para validar estadísticamente la hipótesis de "Intersección de Soporte de Densidad" entre los ataques de Agujero Negro y Túnel, los autores aplicaron una prueba no paramétrica Westfall-Young con B=1000 permutaciones.
- Hipótesis: H0:Pi,V=Pi,W (las distribuciones son iguales) vs. H1:Pi,V=Pi,W.
- Estadístico: La prueba utilizó la Distancia Jensen-Shannon (JSD) como métrica, calculando el Estadístico Máximo a través de las características para controlar la Tasa de Error Familiar (FWER) y evitar problemas de corrección de Bonferroni.
Resultados Clave
Rendimiento de Clasificación
- Ensembles de Árboles: Todos los modelos basados en árboles alcanzaron puntuaciones de prueba superiores al 92%. XGBoost surgió como el mejor rendimiento con una Precisión de prueba de 95.17%, un Recall de 95.04%, un F1-score de 95.04% y un Roc-Auc de 96.85%.
- Aprendizaje Profundo: RealMLP y sus variantes de ensemble mostraron un rendimiento sólido (por ejemplo, F1 de prueba de RealMLP del 94.28%), aunque generalmente quedaron ligeramente por detrás de XGBoost.
- Líneas Base: La Regresión Logística tuvo dificultades significativas (
49% F1), mientras que SVM logró un rendimiento casi aceptable (73% F1). - Perspectivas de la Matriz de Confusión: XGBoost demostró una alta precisión pero exhibió patrones específicos de confusión: ocasionalmente clasificó erróneamente ataques de Túnel como tráfico Normal y confundió los ataques de Agujero Negro y Túnel entre sí.
Hallazgos de Explicabilidad
- Importancia Global: Características como PacketDropRate, RxByteRate/s, RxBytes y DstPort654 fueron las más impactantes para las decisiones del modelo en la mayoría de las clases.
- Clasificaciones Erróneas Locales: El análisis de instancias específicas mal clasificadas (por ejemplo, un ataque de Túnel predicho como Agujero Negro) reveló que características como MeanDelay/s, AverageHopCount y MeanJitter/s a menudo tenían valores altos para ambas clases, creando ambigüedad. El modelo dependía en gran medida de PacketDropRate para diferenciar; cuando este valor estaba cerca de la mediana, el modelo se volvía indeciso.
- Formas de Distribución: Los diagramas de violín y las KDE revelaron que los ataques de Agujero Negro y Túnel comparten similitudes extremas en la forma en características como MeanDelay/s y AverageHopCount, caracterizadas por colas derechas largas y centros de masa similares.
Validación Estadística
La prueba de permutación Westfall-Young confirmó que para la mayoría de las características (por ejemplo, LostPackets, RxBytes, PacketDropRate), las distribuciones de los ataques de Agujero Negro y Túnel son estadísticamente diferentes (p<0.001). Sin embargo, la prueba también destacó que, a pesar de las diferencias estadísticas en la forma, existe una Intersección de Soporte de Densidad significativa (superposición) en regiones específicas (por ejemplo, [0.25, 1.4] para PacketDropRate). Esta superposición, donde un ataque imita la densidad del otro, es la causa raíz de las predicciones falsas del modelo, y no un fallo del proceso de entrenamiento.
Significado y Afirmaciones
El artículo afirma proporcionar modelos robustos, confiables y explicables para la detección de intrusiones en UAV mediante la integración de ensembles de árboles de última generación con un análisis estadístico riguroso. Sus contribuciones principales son:
- Rigor Metodológico: Demostrar que modelos de alto rendimiento (como XGBoost) aún pueden fallar debido a características inherentes de los datos (Intersección de Soporte de Densidad) y no a un mal preprocesamiento o selección de modelos.
- Análisis de la Causa Raíz: Utilizar SHAP y la prueba Westfall-Young para identificar que la confusión entre los ataques de Agujero Negro y Túnel se origina en densidades de características superpuestas, específicamente en variables como PacketDropRate y MeanJitter/s.
- Marco de Explicabilidad: Establecer un flujo de trabajo que va más allá de las métricas simples de precisión para visualizar y validar estadísticamente por qué ocurren las clasificaciones erróneas, ofreciendo perspectivas sobre la "naturaleza enmascarada" de estos ataques.
Los autores concluyen que, aunque XGBoost logra un rendimiento excepcional, el desafío de la Intersección de Soporte de Densidad sigue siendo una limitación fundamental en el conjunto de datos UAVIDS-2025 que requiere una interpretación cuidadosa de la confianza del modelo. Se sugiere que el trabajo futuro incluya validación entre conjuntos de datos, el uso de Deep-CNNs para características espaciales y RNNs para entrenamiento en línea.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.
Recibe los mejores artículos de computer science cada semana.
Utilizado por investigadores de Stanford, Cambridge y la Academia Francesa de Ciencias.
Revisa tu bandeja de entrada para confirmar tu suscripción.
Algo salió mal. ¿Intentar de nuevo?
Sin spam, cancela cuando quieras.