XAI and Statistical Analysis for Reliable Intrusion Detection in the UAVIDS-2025 Dataset: From Tree to Hybrid and Tabular DNN Ensembles
Autores originais: Iakovos-Christos Zarkadis, Christos Douligeris
Autores originais: Iakovos-Christos Zarkadis, Christos Douligeris
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Resumo Técnico: XAI e Análise Estatística para Detecção Confiável de Intrusão no Conjunto de Dados UAVIDS-2025
Declaração do Problema
O artigo aborda o desafio de detectar intrusões em redes de Veículos Aéreos Não Tripulados (UAV), especificamente no contexto do conjunto de dados emergente UAVIDS-2025. Embora a Inteligência Artificial Explicável (XAI) e a Interpretabilidade Mecanística tenham ganhado tração em sistemas críticos, permanece a necessidade de compreender os processos de tomada de decisão de modelos complexos de Aprendizado de Máquina (ML) quando confrontados com vetores de ataque específicos. Uma dificuldade primária identificada no conjunto de dados UAVIDS-2025 é a "Interseção de Suporte de Densidade", onde certos tipos de ataque — especificamente ataques Blackhole e Wormhole — exibem sobreposição significativa em suas distribuições de características. Essa sobreposição cria ambiguidade que leva a classificações errôneas, mesmo em modelos de alto desempenho, tornando necessária uma abordagem rigorosa que combine classificação avançada, XAI e testes estatísticos não paramétricos para distinguir entre ataques mascarados.
Metodologia
1. Pré-processamento de Dados e Engenharia de Características
O estudo utiliza o conjunto de dados UAVIDS-2025, contendo aproximadamente 120.000 observações com 22 características e uma variável alvo composta por quatro tipos de ataque (Sybil, Blackhole, Wormhole, Flooding) e tráfego normal. O pipeline de pré-processamento incluiu:
- Limpeza: Remoção de valores duplicados, da característica redundante "Protocol" (exclusivamente UDP) e do índice não informativo "FlowID".
- Codificação: Codificação de rótulos para o alvo; codificação fictícia (dummy) para portas de origem/destino; e codificação por frequência para endereços IP.
- Transformação: Aplicação de transformações de potência e recíproca para engenharia de características.
- Escala: Detecção de outliers via IQR e Box-Plots levou à seleção do Robust Scaler.
- Seleção de Características: Eliminação Recursiva de Características (RFE) com uma Floresta Aleatória identificou características com contribuição >2,5%. Para prevenir problemas de multicolinearidade na análise SHAP, características com correlações Pearson/Kendall >0,7 foram removidas, resultando em um conjunto final de oito características selecionadas: LostPackets, RxBytes, RxByteRate/s, MeanDelay/s, MeanJitter/s, PacketDropRate, AverageHopCount e DstPort654.
2. Treinamento e Avaliação do Modelo
Os autores avaliaram um amplo espectro de algoritmos usando validação cruzada estratificada de 10 dobras com ajuste de hiperparâmetros por busca em grade e calibração de probabilidade. As famílias de modelos incluíram:
- Ensembles de Árvores: XGBoost, LightGBM, Random Forest, Extra-Trees, Gradient Boosting, HB-Gradient Boosting, AdaBoost e Bagging.
- Redes Neurais Profundas (DNN): MLP, RealMLP e versões de ensemble (Ensemble-RealMLP, Ensemble-NN-Torch, Ensemble-NNFastAiTab).
- Stacking Híbrido: Modelos combinando estimadores lineares, baseados em árvores e bayesianos (por exemplo, Stacking-1 e Stacking-2).
- Baselines: Regressão Logística e SVM.
O desempenho foi avaliado usando F1-score, Precisão, Revocação (Recall) e Roc-Auc.
3. Explicabilidade e Análise Estatística
- Análise SHAP: O modelo de melhor desempenho (XGBoost) passou por uma análise de Explicações Aditivas de Shapley (SHAP) para determinar importâncias globais e locais de características. Isso incluiu examinar como características específicas impulsionam previsões para observações individuais versus tendências gerais de classe.
- Análise de Distribuição: Gráficos de violino e Estimativas de Densidade de Kernel (KDE) foram usados para visualizar formas de dados, assimetria e distribuições multimodais.
- Teste de Permutação Westfall-Young: Para validar estatisticamente a hipótese de "Interseção de Suporte de Densidade" entre ataques Blackhole e Wormhole, os autores aplicaram um teste não paramétrico Westfall-Young com B=1000 permutações.
- Hipótese: H0:Pi,V=Pi,W (distribuições são iguais) vs. H1:Pi,V=Pi,W.
- Estatística: O teste utilizou a Distância Jensen-Shannon (JSD) como métrica, calculando a Estatística Máxima através das características para controlar a Taxa de Erro Familiar (FWER) e evitar problemas de correção de Bonferroni.
Principais Resultados
Desempenho de Classificação
- Ensembles de Árvores: Todos os modelos baseados em árvores alcançaram pontuações de teste superiores a 92%. O XGBoost emergiu como o melhor desempenho com uma Precisão de teste de 95,17%, Revocação de 95,04%, F1-score de 95,04% e Roc-Auc de 96,85%.
- Aprendizado Profundo: RealMLP e suas variantes de ensemble mostraram desempenho forte (por exemplo, F1 de teste RealMLP de 94,28%), embora geralmente tenham ficado ligeiramente atrás do XGBoost.
- Baselines: A Regressão Logística lutou significativamente (
49% F1), enquanto o SVM alcançou desempenho quase aceitável (73% F1). - Insights da Matriz de Confusão: O XGBoost demonstrou alta precisão, mas exibiu padrões específicos de confusão: ocasionalmente classificou erroneamente ataques Wormhole como tráfego Normal e confundiu ataques Blackhole e Wormhole entre si.
Achados de Explicabilidade
- Importância Global: Características como PacketDropRate, RxByteRate/s, RxBytes e DstPort654 foram as mais impactantes para as decisões do modelo na maioria das classes.
- Classificações Errôneas Locais: A análise de instâncias específicas classificadas erroneamente (por exemplo, um ataque Wormhole previsto como Blackhole) revelou que características como MeanDelay/s, AverageHopCount e MeanJitter/s frequentemente mantinham valores altos para ambas as classes, criando ambiguidade. O modelo dependeu fortemente de PacketDropRate para diferenciar; quando esse valor estava próximo da mediana, o modelo tornou-se hesitante.
- Formas de Distribuição: Gráficos de violino e KDEs revelaram que ataques Blackhole e Wormhole compartilham semelhanças extremas de forma em características como MeanDelay/s e AverageHopCount, caracterizadas por caudas direitas longas e centros de massa semelhantes.
Validação Estatística
O teste de permutação Westfall-Young confirmou que, para a maioria das características (por exemplo, LostPackets, RxBytes, PacketDropRate), as distribuições de ataques Blackhole e Wormhole são estatisticamente diferentes (p<0,001). No entanto, o teste também destacou que, apesar das diferenças estatísticas na forma, há uma Interseção de Suporte de Densidade significativa (sobreposição) em regiões específicas (por exemplo, [0,25, 1,4] para PacketDropRate). Essa sobreposição, onde um ataque imita a densidade do outro, é a causa raiz das previsões falsas do modelo, e não uma falha do processo de treinamento.
Significado e Alegações
O artigo afirma fornecer modelos robustos, confiáveis e explicáveis para detecção de intrusão em UAV, integrando ensembles de árvores de última geração com análise estatística rigorosa. Suas principais contribuições são:
- Rigor Metodológico: Demonstrar que modelos de alto desempenho (como XGBoost) ainda podem falhar devido a características inerentes dos dados (Interseção de Suporte de Densidade) e não a pré-processamento ou seleção de modelos pobres.
- Análise de Causa Raiz: Usar SHAP e o teste Westfall-Young para apontar que a confusão entre ataques Blackhole e Wormhole decorre de densidades de características sobrepostas, especificamente em variáveis como PacketDropRate e MeanJitter/s.
- Framework de Explicabilidade: Estabelecer um fluxo de trabalho que vai além de métricas simples de precisão para visualizar e validar estatisticamente por que ocorrem classificações errôneas, oferecendo insights sobre a "natureza mascarada" desses ataques.
Os autores concluem que, embora o XGBoost alcance desempenho excepcional, o desafio da Interseção de Suporte de Densidade permanece uma limitação fundamental no conjunto de dados UAVIDS-2025 que requer interpretação cuidadosa da confiança do modelo. Sugere-se trabalho futuro para incluir validação entre conjuntos de dados, o uso de Deep-CNNs para características espaciais e RNNs para treinamento online.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.
Receba os melhores artigos de computer science toda semana.
Confiado por pesquisadores de Stanford, Cambridge e da Academia Francesa de Ciências.
Verifique sua caixa de entrada para confirmar sua inscrição.
Algo deu errado. Tentar novamente?
Sem spam, cancele quando quiser.