On fair and realistic performance evaluations for graph-based lateral movement detectors
Dit artikel bekritiseert de inconsistente preprocessings- en labelingspraktijken in bestaande benchmarks voor de detectie van laterale beweging, stelt gestandaardiseerde methodologieën voor om eerlijke en realistische evaluaties te waarborgen, en demonstreert dat het herevalueren van gevestigde detectiemethoden onder deze nieuwe beleidsregels significant andere prestatieresultaten oplevert.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je het internet voor als een enorme, bruisende stad waar elke computer een gebouw is en elk datapakketje een bezorgwagen. In deze stad houden beveiligers (cybersecurity-experts) constant de wacht op problemen. Meestal kijken ze naar iemand die van buitenaf probeert in te breken in een gebouw. Maar de sluipste dieven breken niet alleen in; zodra ze eenmaal in een gebouw zijn, beginnen ze van kamer naar kamer te springen, sleutels te stelen en deuren naar de meest waardevolle kluizen te openen. Dit sluipende rondspringen binnen de stad wordt "lateral movement" genoemd. Om deze digitale inbrekers te vangen, bouwen onderzoekers "detectives"—computerprogramma's die naar de verkeerslogs van de stad kijken en proberen de vreemde patronen te ontdekken van een dief die tussen gebouwen beweegt.
Jarenlang hebben deze onderzoekers een race gelopen om de beste detectives te bouwen. Om te zien wie er wint, gebruiken ze "trainingsgronden": gigantische, vooraf gemaakte datasets die een stad simuleren waarin een bekende dief rondrent. Het idee is simpel: als jouw detective de dief in de trainingsgrond vindt, is hij goed. Maar hier is de adder onder het gras: de trainingsgronden zijn rommelig. Sommige onderzoekers maken de logs schoon door "saai" verkeer weg te gooien, terwijl anderen elke enkele stap die de dief zet als een misdaad labelen. Het is alsof je het talent van een detective beoordeelt door hem een test te geven waarbij je alle moeilijke aanwijzingen al hebt verborgen en hem precies hebt verteld waar de boef zich bevindt. Als de regels van de test van de ene onderzoeker naar de andere veranderen, kun je eigenlijk niet zien wie de echt beste detective is.
Dit is precies waar het artikel "On Fair and Realistic Performance Evaluations for Graph-Based Lateral Movement Detectors" onderzoek naar doet. De auteur, Corentin Larroche, treedt op als een scheidsrechter die besluit de scoreborden van de laatste paar grote wedstrijden te controleren. Hij kijkt naar twee beroemde trainingsgronden (datasets genaamd LANL en OpTC) en ontdekt dat onderzoekers wild uiteenlopende regels hebben gebruikt om de data voor te bereiden en de "misdaden" te labelen. Sommigen filterden onschuldige mensen eruit om de test makkelijker te maken, terwijl anderen onschuldig verkeer als kwaadaardig telden. Het artikel betoogt dat deze inconsistente regels de resultaten veel beter doen lijken dan ze in werkelijkheid zijn.
Larroche stelt vervolgens een nieuwe, strengere set regels voor om deze datasets voor te bereiden. Hij suggereert dat we al het verkeer in de test moeten houden, niet alleen de "interessante" delen, en dat we heel voorzichtig moeten zijn met wat we een "lateral movement" noemen. Wanneer hij de tests voor drie beroemde detectiemethoden opnieuw uitvoert met zijn nieuwe, eerlijkere regels, veranderen de resultaten drastisch. De detectives die er in de oude tests uitzagen als superhelden, zien er plotseling veel minder indrukwekkend uit. Bijvoorbeeld, één methode die eerder beweerde een bijna perfecte score te hebben, daalt aanzienlijk wanneer zij gedwongen wordt om met de rommelige, realistische data om te gaan. Het artikel concludeert dat, hoewel detectie van lateral movement nog steeds een zeer moeilijk probleem is, we moeten stoppen met het gebruik van bevooroordeelde aanpassingen in onze tests als we ooit een systeem willen bouwen dat werkt in de echte wereld.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.