XAI and Statistical Analysis for Reliable Intrusion Detection in the UAVIDS-2025 Dataset: From Tree to Hybrid and Tabular DNN Ensembles
Autori originali: Iakovos-Christos Zarkadis, Christos Douligeris
Autori originali: Iakovos-Christos Zarkadis, Christos Douligeris
Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo
Riepilogo Tecnico: XAI e Analisi Statistica per il Rilevamento Affidabile delle Intrusioni nel Dataset UAVIDS-2025
Enunciato del Problema
Il documento affronta la sfida del rilevamento delle intrusioni nelle reti di Veicoli Aerei Non Pilotati (UAV), specificamente nel contesto del nascente dataset UAVIDS-2025. Sebbene l'Intelligenza Artificiale Spiegabile (XAI) e l'Interpretabilità Meccanicistica abbiano guadagnato terreno nei sistemi critici, permane la necessità di comprendere i processi decisionali di modelli complessi di Machine Learning (ML) quando confrontati con specifici vettori di attacco. Una difficoltà primaria identificata nel dataset UAVIDS-2025 è l'"Intersezione del Supporto di Densità", dove certi tipi di attacco—nello specifico gli attacchi Blackhole e Wormhole—mostrano una significativa sovrapposizione nelle loro distribuzioni di caratteristiche. Questa sovrapposizione crea ambiguità che porta a classificazioni errate, anche in modelli ad alte prestazioni, rendendo necessario un approccio rigoroso che combini classificazione avanzata, XAI e test statistici non parametrici per distinguere tra attacchi mascherati.
Metodologia
1. Pre-elaborazione dei Dati e Ingegneria delle Caratteristiche
Lo studio utilizza il dataset UAVIDS-2025, contenente circa 120.000 osservazioni con 22 caratteristiche e una variabile target composta da quattro tipi di attacco (Sybil, Blackhole, Wormhole, Flooding) e traffico normale. La pipeline di pre-elaborazione ha incluso:
- Pulizia: Rimozione di valori duplicati, della caratteristica ridondante "Protocol" (esclusivamente UDP) e dell'indice non informativo "FlowID".
- Codifica: Codifica delle etichette per il target; codifica dummy per le porte di origine/destinazione; e codifica basata sulla frequenza per gli indirizzi IP.
- Trasformazione: Applicazione di trasformazioni di potenza e reciproche per l'ingegneria delle caratteristiche.
- Ridimensionamento: Il rilevamento degli outlier tramite IQR e Box-Plots ha portato alla selezione dello Robust Scaler.
- Selezione delle Caratteristiche: L'Eliminazione Ricorsiva delle Caratteristiche (RFE) con una Random Forest ha identificato le caratteristiche con una contribuzione >2,5%. Per prevenire problemi di multicollinearità nell'analisi SHAP, sono state rimosse le caratteristiche con correlazioni Pearson/Kendall >0,7, risultando in un set finale di otto caratteristiche selezionate: LostPackets, RxBytes, RxByteRate/s, MeanDelay/s, MeanJitter/s, PacketDropRate, AverageHopCount e DstPort654.
2. Addestramento e Valutazione del Modello
Gli autori hanno valutato un ampio spettro di algoritmi utilizzando la validazione incrociata stratificata a 10 fold con ottimizzazione degli iperparametri tramite grid-search e calibrazione delle probabilità. Le famiglie di modelli includevano:
- Ensemble di Alberi: XGBoost, LightGBM, Random Forest, Extra-Trees, Gradient Boosting, HB-Gradient Boosting, AdaBoost e Bagging.
- Reti Neurali Profonde (DNN): MLP, RealMLP e versioni ensemble (Ensemble-RealMLP, Ensemble-NN-Torch, Ensemble-NNFastAiTab).
- Stacking Ibrido: Modelli che combinano stimatori lineari, ad albero e bayesiani (ad es. Stacking-1 e Stacking-2).
- Linee di Base: Regressione Logistica e SVM.
Le prestazioni sono state valutate utilizzando F1-score, Precisione, Recall e Roc-Auc.
3. Spiegabilità e Analisi Statistica
- Analisi SHAP: Il modello con le prestazioni migliori (XGBoost) ha subito un'analisi delle spiegazioni additive di Shapley (SHAP) per determinare le importanze globali e locali delle caratteristiche. Ciò ha incluso l'esame di come specifiche caratteristiche guidano le previsioni per singole osservazioni rispetto alle tendenze generali delle classi.
- Analisi delle Distribuzioni: I grafici a violino e le Stime di Densità del Nucleo (KDE) sono stati utilizzati per visualizzare le forme dei dati, l'asimmetria e le distribuzioni multi-modali.
- Test di Permutazione di Westfall-Young: Per validare statisticamente l'ipotesi di "Intersezione del Supporto di Densità" tra gli attacchi Blackhole e Wormhole, gli autori hanno applicato un test non parametrico di Westfall-Young con B=1000 permutazioni.
- Ipotesi: H0:Pi,V=Pi,W (le distribuzioni sono uguali) vs. H1:Pi,V=Pi,W.
- Statistica: Il test ha utilizzato la Distanza Jensen-Shannon (JSD) come metrica, calcolando la Statistica Max attraverso le caratteristiche per controllare il Tasso di Errore Familiare (FWER) ed evitare problemi di correzione di Bonferroni.
Risultati Chiave
Prestazioni di Classificazione
- Ensemble di Alberi: Tutti i modelli basati su alberi hanno ottenuto punteggi di test superiori al 92%. XGBoost si è distinto come il migliore con una Precisione di test del 95,17%, una Recall del 95,04%, un F1-score del 95,04% e un Roc-Auc del 96,85%.
- Deep Learning: RealMLP e le sue varianti ensemble hanno mostrato prestazioni solide (ad es. F1 di test di RealMLP del 94,28%), sebbene generalmente siano rimaste leggermente indietro rispetto a XGBoost.
- Linee di Base: La Regressione Logistica ha faticato significativamente (
49% F1), mentre la SVM ha raggiunto prestazioni quasi accettabili (73% F1). - Approfondimenti sulla Matrice di Confusione: XGBoost ha dimostrato un'alta accuratezza ma ha esibito specifici pattern di confusione: ha occasionalmente classificato erroneamente gli attacchi Wormhole come traffico Normale e ha confuso gli attacchi Blackhole e Wormhole tra loro.
Risultati di Spiegabilità
- Importanza Globale: Caratteristiche come PacketDropRate, RxByteRate/s, RxBytes e DstPort654 sono state le più influenti per le decisioni del modello nella maggior parte delle classi.
- Classificazioni Errate Locali: L'analisi di istanze specifiche classificate erroneamente (ad es. un attacco Wormhole previsto come Blackhole) ha rivelato che caratteristiche come MeanDelay/s, AverageHopCount e MeanJitter/s spesso assumevano valori elevati per entrambe le classi, creando ambiguità. Il modello si è affidato pesantemente a PacketDropRate per differenziare; quando questo valore era vicino alla mediana, il modello diventava esitante.
- Forme delle Distribuzioni: I grafici a violino e le KDE hanno rivelato che gli attacchi Blackhole e Wormhole condividono somiglianze estreme di forma in caratteristiche come MeanDelay/s e AverageHopCount, caratterizzate da code destre lunghe e centri di massa simili.
Validazione Statistica
Il test di permutazione di Westfall-Young ha confermato che per la maggior parte delle caratteristiche (ad es. LostPackets, RxBytes, PacketDropRate), le distribuzioni degli attacchi Blackhole e Wormhole sono statisticamente diverse (p<0,001). Tuttavia, il test ha anche evidenziato che, nonostante le differenze statistiche nella forma, esiste una significativa Intersezione del Supporto di Densità (sovrapposizione) in regioni specifiche (ad es. [0,25, 1,4] per PacketDropRate). Questa sovrapposizione, dove un attacco mimetizza la densità dell'altro, è la causa radice delle previsioni errate del modello, piuttosto che un fallimento del processo di addestramento.
Significato e Affermazioni
Il documento afferma di fornire modelli robusti, affidabili e spiegabili per il rilevamento delle intrusioni UAV integrando ensemble di alberi all'avanguardia con un'analisi statistica rigorosa. I suoi contributi principali sono:
- Rigor Metodologico: Dimostrare che modelli ad alte prestazioni (come XGBoost) possono ancora fallire a causa di caratteristiche intrinseche dei dati (Intersezione del Supporto di Densità) piuttosto che di una scarsa pre-elaborazione o selezione del modello.
- Analisi della Causa Radice: Utilizzare SHAP e il test di Westfall-Young per individuare che la confusione tra gli attacchi Blackhole e Wormhole deriva da densità di caratteristiche sovrapposte, specificamente in variabili come PacketDropRate e MeanJitter/s.
- Quadro di Spiegabilità: Stabilire un flusso di lavoro che va oltre le semplici metriche di accuratezza per visualizzare e validare statisticamente perché si verificano classificazioni errate, offrendo approfondimenti sulla "natura mascherata" di questi attacchi.
Gli autori concludono che, sebbene XGBoost raggiunga prestazioni straordinarie, la sfida dell'Intersezione del Supporto di Densità rimane una limitazione fondamentale nel dataset UAVIDS-2025 che richiede un'attenta interpretazione della confidenza del modello. Si suggerisce che i lavori futuri includano la validazione su più dataset, l'uso di Deep-CNN per le caratteristiche spaziali e RNN per l'addestramento online.
Sommerso dagli articoli nel tuo campo?
Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.
Ricevi i migliori articoli di computer science ogni settimana.
Scelto da ricercatori di Stanford, Cambridge e dell'Accademia francese delle scienze.
Controlla la tua casella di posta per confermare l'iscrizione.
Qualcosa è andato storto. Riprovare?
Niente spam, cancellati quando vuoi.