← Nieuwste papers
💻 computer science

SOC Copilot: A Complete, Lightweight, and Explainable Multi-Model Anomaly Detection Engine for Security Log Analysis

Dit artikel introduceert SOC Copilot, een lichtgewicht, uitsluitend op de CPU draaiende, ongesuperviseerde multi-model anomaliedetectie-engine die een verbeterde Isolation Forest en een Deep Autoencoder combineert met SHAP-gebaseerde verklaarbaarheid om een nauwkeurigheid van 99,84% te bereiken bij het analyseren van HDFS-beveiligingslogs zonder dat er gelabelde gegevens of GPU-infrastructuur vereist zijn.

Oorspronkelijke auteurs: Shreya V, Joselin Jennilia J, Vilashini V

Gepubliceerd 2026-09-22
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Shreya V, Joselin Jennilia J, Vilashini V

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ✨ Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Elke dag genereren moderne computersystemen een overweldigend volume aan digitale records, bekend als logs. Dit zijn de automatische aantekeningen die machines over hun eigen activiteiten schrijven, waarbij alles wordt bijgehouden van een gebruiker die inlogt tot een bestand dat over een netwerk wordt verplaatst. In een grote organisatie stapelen deze logs zich op in de miljoenen, wat een enorme, chaotische stroom van informatie creëert. Beveiligingsteams, bekend als Security Operations Centers, hebben de taak om deze stroom te bewaken om tekenen van problemen te ontdekken. Het probleem is dat het volume te groot is voor mensen om te lezen, en de oude manier van zoeken naar problemen — het controleren op specifieke, bekende patronen van kwaadaardig gedrag — faalt wanneer aanvallers nieuwe, onbekende methoden gebruiken. Wanneer systemen overbelast raken, missen ze ofwel echte dreigingen, of ze slaan alarm voor onschuldige gebeurtenissen, waardoor analisten uitgeput en verward raken. Het doel van modern beveiligingsonderzoek is om een systeem te bouwen dat automatisch door deze ruis kan zeven, de zeldzame, vreemde gebeurtenissen kan vinden die een aanval signaleren, en precies kan uitleggen waarom het ze heeft gevonden, allemaal zonder dat er dure, gespecialiseerde hardware of een team van experts nodig is om elk enkel voorbeeld van een misdaad te labelen.

Een team van onderzoekers heeft een hulpmiddel ontwikkeld genaamd SOC Copilot om dit specifieke probleem op te lossen. Ze hebben een compleet systeem gebouwd dat draait op standaard computerprocessoren, wat betekent dat het niet de enorme, krachtige grafische kaarten vereist die veel geavanceerde kunstmatige intelligentie-tools nodig hebben. In plaats van te vertrouwen op een database van bekende aanvallen, leert hun systeem wat "normaal" gedrag is en markeert alles dat afwijkt van dat patroon. De onderzoekers testten hun engine op een enorme dataset van meer dan elf miljoen logregels van een Hadoop Distributed File System, een veelgebruikte technologie voor het opslaan van enorme hoeveelheden gegevens. Ze verwerkten deze gegevens naar een hanteerbaar formaat, waarbij gerelateerde gebeurtenissen in blokken werden gegroepeerd en werden omgezet in een lijst van achten vijftig verschillende kenmerken, zoals hoe vaak een specifiek type bericht voorkwam of hoe lang een sequentie van gebeurtenissen duurde.

De kern van hun systeem maakt gebruik van twee verschillende methoden om problemen te zoeken, die samenwerken als twee experts met verschillende specialismen. De eerste methode is een statistisch instrument dat naar uitschieters kijkt, waarbij datapunten worden geïdentificeerd die ver buiten de groep liggen. De tweede methode is een neuraal netwerk, een type computerprogramma dat is ontworpen om te leren hoe het informatie kan comprimeren en vervolgens weer kan opbouwen. Als het programma een patroon ziet dat het nog nooit eerder is tegengekomen, heeft het moeite met het opnieuw opbouwen ervan, en die strijd wordt een signaal dat er iets mis is. De onderzoekers trainden beide methoden alleen op voorbeelden van normaal, veilig gedrag. Ze hebben ze tijdens de leerfase geen enkele voorbeelden van aanvallen getoond, wat de mogelijkheid biedt dat het systeem nieuwe soorten dreigingen detecteert die nog nooit eerder zijn gezien.

Om het systeem betrouwbaar te maken, lieten de onderzoekers de twee methoden niet simpelweg stemmen over een beslissing. Ze pasten eerst de scores van elke methode aan zodat ze eerlijk vergeleken konden worden, en combineerden deze vervolgens met een specifieke weegstrategie die werd bepaald door testen op een aparte set gegevens. Het eindresultaat is een enkele score die aangeeft hoe verdacht een blok logs is. Als de score een bepaalde grens overschrijdt, markeert het systeem het als een anomalie. Cruciaal is dat het systeem niet alleen zegt: "dit is slecht." Het geeft een gedetailleerde uitleg voor zijn beslissing, waarbij wordt benadrukt welke kenmerken van de logregel de melding hebben veroorzaakt. Het wijst ook een ernstniveau toe, variërend van laag tot kritiek, wat menselijke analisten helpt te beslissen welke meldingen zij als eerste moeten onderzoeken.

Toen het team hun definitieve systeem testte op een set gegevens die het nog nooit eerder had gezien, waren de resultaten opmerkelijk nauwkeurig. Van de meer dan zesentwintigduizend blokken logs identificeerde het systeem bijna elke enkele anomalie correct, waarbij slechts één werd gemist. Het hield ook de valse alarmen zeer laag, waarbij slechts een klein fractie van de normale activiteit als verdacht werd gemarkeerd. De combinatie van de twee methoden bleek sterker dan een van beide methoden alleen. Hoewel het neurale netwerk de betere individuele detector was, ving de statistische methode een klein aantal dreigingen die het netwerk miste. Door hen samen te voegen, bereikte het systeem een niveau van nauwkeurigheid dat zeldzaam is in dit veld, waarbij bijna negentig procent werd gehaald op alle belangrijke prestatiecijfers.

De onderzoekers bouwden ook een visueel dashboard waarmee menselijke analisten met het systeem kunnen interageren. Deze interface toont de meldingen, de ernstscores en de verklaringen voor waarom elke melding werd gegenereerd. Het toont de specifieke logtemplates die de melding hebben getriggerd en de kenmerken die het meest hebben bijgeden aan de beslissing. Deze transparantie is essentieel omdat het een mens in staat stelt het oordeel van de machine te vertrouwen en de context van de dreiging te begrijpen. Het hele systeem werd gebouwd om lichtgewicht en uitlegbaar te zijn, waarmee het inspeelt op de veelvoorkomende klachten dat krachtige beveiligingstools te duur zijn om te draaien of te ondoorzichtig zijn om te begrijpen.

De studie bevestigt dat het mogelijk is om een zeer effectieve beveiligingsengine te bouwen zonder te vertrouwen op enorme rekenkracht of enorme gelabelde datasets van bekende aanvallen. Door zich te richten op ongesuperviseerd leren, waarbij het systeem de vorm van normaal gedrag leert, en door meerdere detectiemethoden te combineren, heeft het team een hulpmiddel gecreëerd dat zowel accuraat als begrijpelijk is. Ze hebben aangetoond dat een systeem getraind kan worden op normale gegevens, afgesteld kan worden met zorgvuldige kalibratie, en ingezet kan worden om bijna elke anomalie in een enorme stroom logs te vangen. Het werk beweert niet elk beveiligingsprobleem op te lossen, en erkent dat het momenteel het beste werkt op dit specifieke type loggegevens. Het biedt echter een duidelijk, werkend voorbeeld van hoe men kan overgaan van reactieve regelcontrole naar proactieve, intelligente anomaliedetectie die begrepen en vertrouwd kan worden door de mensen die het moeten gebruiken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →