XAI and Statistical Analysis for Reliable Intrusion Detection in the UAVIDS-2025 Dataset: From Tree to Hybrid and Tabular DNN Ensembles
Oorspronkelijke auteurs: Iakovos-Christos Zarkadis, Christos Douligeris
Oorspronkelijke auteurs: Iakovos-Christos Zarkadis, Christos Douligeris
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Technische Samenvatting: XAI en Statistische Analyse voor Betrouwbare Inbraakdetectie in de UAVIDS-2025 Dataset
Probleemstelling
Het artikel behandelt de uitdaging van het detecteren van inbraken in netwerken voor onbemande luchtvaartuigen (UAV's), specifiek in de context van de opkomende UAVIDS-2025 dataset. Hoewel Explainable Artificial Intelligence (XAI) en Mechanistische Interpretabiliteit aan populariteit hebben gewonnen in kritieke systemen, blijft er behoefte aan het begrijpen van de besluitvormingsprocessen van complexe Machine Learning (ML) modellen wanneer deze geconfronteerd worden met specifieke aanvalsvectoren. Een primaire moeilijkheid die is geïdentificeerd in de UAVIDS-2025 dataset is de "Dichtheidssteun-Intersectie", waarbij bepaalde aanvalstypen – specifiek Blackhole- en Wormhole-aanvallen – aanzienlijke overlap vertonen in hun verdelingen van kenmerken. Deze overlap creëert ambiguïteit die leidt tot verkeerde classificaties, zelfs bij hoogpresterende modellen, wat een rigoureuze aanpak vereist die geavanceerde classificatie, XAI en niet-parametrische statistische toetsing combineert om onderscheid te maken tussen gemaskeerde aanvallen.
Methodologie
1. Data Pre-processing en Feature Engineering
De studie maakt gebruik van de UAVIDS-2025 dataset, die ongeveer 120.000 observaties bevat met 22 kenmerken en een doelvariabele die bestaat uit vier aanvalstypen (Sybil, Blackhole, Wormhole, Flooding) en normaal verkeer. De pre-processing-pijplijn omvatte:
- Opschoning: Verwijdering van dubbele waarden, het overbodige kenmerk "Protocol" (uitsluitend UDP) en de niet-informatieve index "FlowID".
- Codering: Label-codering voor het doel; dummy-codering voor bron- en bestemmingspoorten; en frequentie-codering voor IP-adressen.
- Transformatie: Toepassing van macht- en reciproke transformaties voor feature engineering.
- Schaling: Detectie van uitschieters via IQR en Box-Plots leidde tot de selectie van de Robust Scaler.
- Feature Selectie: Recursive Feature Elimination (RFE) met een Random Forest identificeerde kenmerken met een bijdrage van >2,5%. Om problemen met multicollineariteit in SHAP-analyse te voorkomen, werden kenmerken met Pearson/Kendall-correlaties >0,7 verwijderd, wat resulteerde in een uiteindelijke set van acht geselecteerde kenmerken: LostPackets, RxBytes, RxByteRate/s, MeanDelay/s, MeanJitter/s, PacketDropRate, AverageHopCount en DstPort654.
2. Modeltraining en Evaluatie
De auteurs evalueerden een breed spectrum aan algoritmen met behulp van gestratificeerde 10-voudige cross-validatie met grid-search hyperparameter-tuning en probabiliteitscalibratie. De model-families omvatten:
- Boom-Ensembles: XGBoost, LightGBM, Random Forest, Extra-Trees, Gradient Boosting, HB-Gradient Boosting, AdaBoost en Bagging.
- Diepe Neuronale Netwerken (DNN): MLP, RealMLP en ensemble-versies (Ensemble-RealMLP, Ensemble-NN-Torch, Ensemble-NNFastAiTab).
- Hybride Stacking: Modellen die lineaire, boom- en Bayesiaanse schatters combineren (bijv. Stacking-1 en Stacking-2).
- Basislijnen: Logistische Regressie en SVM.
De prestaties werden beoordeeld aan de hand van F1-score, Precision, Recall en Roc-Auc.
3. Verklaarbaarheid en Statistische Analyse
- SHAP-analyse: Het best presterende model (XGBoost) onderging een analyse van Shapley Additive explanations (SHAP) om globale en lokale kenmerkbelangrijkheden te bepalen. Dit omvatte het onderzoeken hoe specifieke kenmerken voorspellingen aandrijven voor individuele observaties versus algemene neigingen van klassen.
- Verdelingsanalyse: Violin-plots en Kernel Density Estimations (KDE) werden gebruikt om data-vormen, scheefheid en multi-modale verdelingen te visualiseren.
- Westfall-Young Permutatietest: Om de hypothese van "Dichtheidssteun-Intersectie" tussen Blackhole- en Wormhole-aanvallen statistisch te valideren, pasten de auteurs een niet-parametrische Westfall-Young-test toe met B=1000 permutaties.
- Hypothese: H0:Pi,V=Pi,W (verdelingen zijn gelijk) vs. H1:Pi,V=Pi,W.
- Statistiek: De test gebruikte de Jensen-Shannon Distance (JSD) als maatstaf, waarbij de Max-Statistiek over kenmerken werd berekend om de Family-Wise Error Rate (FWER) te controleren en Bonferroni-correctieproblemen te vermijden.
Belangrijkste Resultaten
Classificatieprestaties
- Boom-Ensembles: Alle boomgebaseerde modellen behaalden testscores van meer dan 92%. XGBoost bleek de beste performer met een test Precision van 95,17%, Recall van 95,04%, F1-score van 95,04% en Roc-Auc van 96,85%.
- Deep Learning: RealMLP en zijn ensemblevarianten toonden sterke prestaties (bijv. RealMLP test F1 van 94,28%), hoewel ze over het algemeen iets achterbleven bij XGBoost.
- Basislijnen: Logistische Regressie had aanzienlijke moeite (
49% F1), terwijl SVM bijna acceptabele prestaties behaalde (73% F1). - Inzichten uit de Confusiematrix: XGBoost toonde hoge nauwkeurigheid, maar vertoonde specifieke verwarringspatronen: het classificeerde Wormhole-aanvallen soms als Normaal verkeer en verwarde Blackhole- en Wormhole-aanvallen met elkaar.
Bevindingen over Verklaarbaarheid
- Globale Belangrijkheid: Kenmerken zoals PacketDropRate, RxByteRate/s, RxBytes en DstPort654 waren het meest invloedrijk voor de beslissingen van het model over de meeste klassen heen.
- Lokale Verkeerde Classificaties: Analyse van specifieke verkeerd geclassificeerde gevallen (bijv. een Wormhole-aanval voorspeld als Blackhole) onthulde dat kenmerken zoals MeanDelay/s, AverageHopCount en MeanJitter/s vaak hoge waarden hadden voor beide klassen, wat ambiguïteit creëerde. Het model vertrouwde sterk op PacketDropRate om onderscheid te maken; wanneer deze waarde dicht bij de mediaan lag, werd het model aarzelend.
- Verdelingsvormen: Violin-plots en KDE's onthulden dat Blackhole- en Wormhole-aanvallen extreme vormgelijkheden delen in kenmerken zoals MeanDelay/s en AverageHopCount, gekenmerkt door lange rechterstaarten en vergelijkbare zwaartepunten.
Statistische Validatie
De Westfall-Young permutatietest bevestigde dat voor de meeste kenmerken (bijv. LostPackets, RxBytes, PacketDropRate) de verdelingen van Blackhole- en Wormhole-aanvallen statistisch verschillend zijn (p<0,001). De test benadrukte echter ook dat ondanks statistische verschillen in vorm, er een significante Dichtheidssteun-Intersectie (overlap) is in specifieke gebieden (bijv. [0,25, 1,4] voor PacketDropRate). Deze overlap, waarbij één aanval de dichtheid van de andere nabootst, is de oorzaak van de valse voorspellingen van het model, en niet een falen van het trainingsproces.
Betekenis en Claims
Het artikel claimt robuste, betrouwbare en verklaarbare modellen te bieden voor UAV-inbraakdetectie door state-of-the-art boom-ensembles te integreren met rigoureuze statistische analyse. De primaire bijdragen zijn:
- Methodologische Rigor: Aantonen dat hoogpresterende modellen (zoals XGBoost) toch kunnen falen vanwege inherente data-kenmerken (Dichtheidssteun-Intersectie) in plaats van slechte pre-processing of modelselectie.
- Oorzaakanalyse: Het gebruik van SHAP en de Westfall-Young-test om aan te tonen dat de verwarring tussen Blackhole- en Wormhole-aanvallen voortkomt uit overlappende kenmerkdichtheden, specifiek in variabelen zoals PacketDropRate en MeanJitter/s.
- Verklaarbaarheidskader: Het vaststellen van een workflow die verder gaat dan simpele nauwkeurigheidsmetrieken om te visualiseren en statistisch te valideren waarom verkeerde classificaties optreden, en inzichten te bieden in de "gemaskeerde aard" van deze aanvallen.
De auteurs concluderen dat hoewel XGBoost uitstekende prestaties behaalt, de uitdaging van Dichtheidssteun-Intersectie een fundamentele beperking blijft in de UAVIDS-2025 dataset die zorgvuldige interpretatie van modelvertrouwen vereist. Voor toekomstig werk wordt voorgesteld cross-dataset validatie op te nemen, het gebruik van Deep-CNN's voor ruimtelijke kenmerken en RNN's voor online training.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.
Ontvang wekelijks de beste computer science papers.
Vertrouwd door onderzoekers van Stanford, Cambridge en de Franse Academie van Wetenschappen.
Check je inbox om je aanmelding te bevestigen.
Er ging iets mis. Opnieuw proberen?
Geen spam, altijd opzegbaar.