A Multi Method Importance and Performance Efficiency Analysis of Topological Metrics for Natural Visibility Graph Based Cyber Attack Detection
Deze studie toont aan dat het toepassen van een consensusgebaseerde belangrijksheidsanalyse op Natural Visibility Graph-metrieken de selectie mogelijk maakt van een compacte subset van drie topologische kenmerken die de nauwkeurigheid van detectie van cyberaanvallen aanzienlijk verbetert en de computationele runtime met meer dan 96% vermindert in vergelijking met het gebruik van de volledige set van 21 metrieken.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
In de digitale wereld stroomt netwerkverkeer als een constante rivier van data, die alles vervoert van onschadelijk surfen op het web tot geavanceerde cyberaanvallen. Om systemen te beschermen, gebruiken beveiligingsexperts computerprogramma's om deze stroom in de gaten te houden, waarbij ze zoeken naar patronen die gevaar signaleren. Jarenlang hebben deze programma's vertrouwd op het tellen van eenvoudige zaken, zoals hoeveel datapakketjes er door een deur gaan of hoe lang een verbinding duurt. Echter, onderzoekers zijn gaan beseffen dat de vorm van de data zelf meer aanwijzingen kan bevatten dan alleen de cijfers. Stel je voor dat je een reeks getallen die een datastroom vertegenwoordigt, verandert in een kaart waar elk punt een stip is en lijnen punten verbinden die elkaar kunnen "zien" zonder dat er iets tussenin staat. Dit creëert een uniek web, of graaf, dat het ritme en de structuur van de oorspronkelijke data behoudt. Door de vorm van deze weben te bestuderen — hoe dicht de punten bij elkaar klonteren, hoeveel paden er tussen hen bestaan en hoe centraal bepaalde punten zijn — kunnen wetenschappers verborgen handtekeningen van kwaadaardige activiteiten ontdekken die standaard tellen zouden missen.
Een team van onderzoekers aan de Karabuk Universiteit in Turkije zette zich af om te testen hoe nuttig deze op vorm gebaseerde aanwijzingen zijn voor het vangen van cyberaanvallen. Ze begonnen met een enorme collectie netwerkrecords die zowel normaal verkeer als verschillende soorten aanvallen bevatten. In plaats van de ruwe data direct in een computerprogramma te voeren, transformeerden ze eerst kleine brokken van de data naar deze visuele weben. Vanuit elk web extraheerden ze eenentwintig verschillende metingen, of topologische metrieken, om de structuur te beschrijven. Sommige van deze metingen keken naar hoe verbonden de punten waren, andere onderzochten de gemiddelde afstand tussen punten, en sommige analyseerden hoe de punten zich in gemeenschappen groepeerden. De onderzoekers gebruikten vervolgens een krachtig type kunstmatige intelligentie, een convolutioneel neuraal netwerk, om te leren hoe ze de weben gecreëerd door normaal verkeer en de weben gecreëerd door aanvallen van elkaar konden onderscheiden.
De centrale vraag die het team wilde beantwoorden, was of al deze eenentwintig vormmetingen daadwerkelijk noodzakelijk waren. In veel wetenschappelijke velden gaan onderzoekers er vaak van uit dat het verzamelen van meer data leidt tot betere resultaten, maar in dit geval kost het extra extraheren van elke meting een aanzienlijke hoeveelheid tijd en rekenkracht. Het team vermoedde dat sommige van deze metingen redundant of minder nuttig waren dan andere. Om dit te achterhalen, pasten ze vier verschillende methoden toe om de belangrijkheid van elke meting te rangschikken. Eén methode keek naar hoeveel de zekerheid van de computer daalde wanneer een specifieke meting werd gehusseld; een andere vergeleek de echte metingen met willekeurige ruis om te zien welke eruit sprongen; een derde methode verwijderde systematisch de minst nuttige metingen om te zien wat er overbleef; en een vierde methode gebruikte een wiskundige benadering om precies uit te leggen hoeveel elke meting bijdroeg aan de uiteindelijke beslissing. Door de resultaten van deze vier verschillende benaderingen te combineren, creëerden ze een enkele, overeengekomen rangschikking van de eenentwintig metrieken.
De resultaten van deze analyse onthulden een duidelijke hiërarchie. De metingen die beschreven hoe dicht de punten in het web bij elkaar klonterden, bleken de meest waardevolle te zijn. Specifiek werden de mediaan, de standaarddeviatie en het gemiddelde van deze clusteringwaarden gerangschikt als de top drie belangrijkste indicatoren. In contrast hiermee werden andere metingen, zoals die die de langste paden of de totale omvang van het web beschreven, veel lager gerangschikt. De onderzoekers testten dit bevinding door hun computerprogramma te trainen met alleen de hoogst gerangschikte metingen, waarbij ze het aantal inputs geleidelijk verminderden van alle eenentwintig tot slechts de top drie. Ze vergeleken de prestaties van deze kleinere sets tegen de volledige set van eenentwintig.
De uitkomst was verrassend. Wanneer het computerprogramma werd getraind met alleen de top drie clusteringmetingen, presteerde het beter dan wanneer het werd getraind met de volledige set van eenentwintig. Het vereenvoudigde model identificeerde aanvallen correct met een nauwkeurigheid van 97,148 procent, vergeleken met 95,999 procent voor het volledige model. Het behaalde ook een hogere score in het balanceren van de detectie van verschillende soorten aanvallen. Belangrijker nog, deze verbetering ging gepaard met een enorme winst in snelheid. De volledige set metingen nam bijna vijftien duizend seconden in beslag om door de gehele experimentele procedure te verwerken, terwijl de top drie metingen slechts ongeveer vijfhonderd negenentachtig seconden vereisten. Dit vertegenwoordigt een reductie in rekentijd van meer dan zesennegentig procent. De studie suggereert dat door te focussen op de meest informatieve structurele aanwijzingen en de rest weg te laten, beveiligingssystemen zowel sneller als nauwkeuriger kunnen worden.
De onderzoekers merkten op dat dit resultaat niet betekent dat alle andere metingen nutteloos zijn, maar eerder dat voor dit specifieke type data en dit specifieke computermodel de extra informatie niet hielp en zelfs afleidend kon werken. De top drie metingen, die de lokale clustering van de datapunten beschrijven, leken de essentiële handtekening van de aanvallen te bevatten. De studie concludeert dat een compacte, zorgvuldig geselecteerde set kenmerken een grotere, ongefilterde collectie kan overtreffen. Hoewel de bevindingen specifiek zijn voor de dataset en de methoden die in dit experiment zijn gebruikt, bieden ze een duidelijk pad voorwaarts voor het bouwen van efficiëntere cyberdefensiesystemen. Door te begrijpen welke structurele details er het meest toe doen, kunnen toekomstige tools worden ontworpen om dreigingen met grotere snelheid en precisie te detecteren, zonder de last van het verwerken van onnodige data.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.