Parser-Free Querying of Security Logs
Het artikel introduceert Sieve, een systeem dat gebruikmaakt van grote taalmodellen die zijn verankerd in automatisch geëxtraheerde logformaatcontext om uitvoerbare code te genereren voor beveiligingsvragen in natuurlijke taal, waardoor de foutpercentages bij complexe temporale en cross-event loganalyse aanzienlijk worden verlaagd in vergelijking met handmatig scripten.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een rechercheur bent die een misdaad moet oplossen. Je hebt een enorme stapel bewijsmateriaal: miljoenen pagina's met handgeschreven notities, bonnen en logs die zijn achtergelaten door verschillende personen (servers, firewalls, gebruikersaccounts). Het probleem is dat iedereen in zijn eigen slordige, inconsistente handschrift schrijft. De ene persoon schrijft datums als "1 jan", een ander als "01/01", en weer een ander schrijft gewoon "maandag". Sommige notities staan op post-its, anderen op servetten, en de inktkleuren variëren.
Om een zaak op te lossen, moet je specifieke vragen stellen, zoals: "Laat me elke keer zien dat iemand probeerde het gebouw binnen te dringen tussen 02:00 en 04:00 uur."
De Oude Manier: De Overwerkte Bibliotheekmedewerker
Traditioneel proberen beveiligingsteams dit op te lossen door een team bibliotheekmedewerkers (parsers) in te huren om elke enkele notitie te lezen, het handschrift te analyseren en alles opnieuw te schrijven in een perfect, uniform spreadsheet.
- Het Goede: Zodra het spreadsheet klaar is, zijn vragen stellen snel en eenvoudig.
- Het Slechte: Het duurt eeuwen om het spreadsheet te bouwen. Iedere keer als een nieuwe persoon notities begint te schrijven op een iets andere manier, moeten de bibliotheekmedewerkers stoppen, de nieuwe stijl leren en de regels herschrijven. Als er een nieuw type notitie verschijnt dat nog nooit is gezien, crasht het hele systeem totdat de bibliotheekmedewerkers het hebben opgelost.
Het Alternatief: De Grep-Rechercheur
De andere optie is de bibliotheekmedewerkers volledig over te slaan. Je pakt gewoon een vergrootglas (een tool zoals grep) en scant de ruwe, slordige notities zelf.
- Het Goede: Je kunt direct beginnen. Geen wachten op bibliotheekmedewerkers.
- Het Slechte: Je moet exact weten hoe elk mogelijk handschrift eruitziet. Als je één variatie van het woord "inbraak" mist, mis je de aanwijzing. Ook is het vragen stellen van complexe vragen zoals "Vind mensen die binnen 60 seconden via twee verschillende deuren binnenkwamen" ontzettend moeilijk om alleen door handmatig regels tekst te scannen.
De Nieuwe Oplossing: Sieve (De Slimme Vertaler)
Het artikel introduceert Sieve, een systeem dat fungeert als een super-slimme vertaler die direct een aangepast gereedschap voor je kan schrijven.
Hier is hoe Sieve werkt, met een eenvoudige analogie:
- De Vraag: Je stelt Sieve een vraag in gewoon Nederlands: "Vind alle IP-adressen die meer dan 10 keer in een tijdvenster van 5 minuten probeerden binnen te dringen."
- De Snelle Scan: In plaats van het hele miljoen pagina's tellende boek te lezen, bladert Sieve snel door de eerste paar pagina's om te zien hoe het handschrift eruitziet. Het maakt een klein "spiekbriefje" van de verschillende manieren waarop de notities zijn geschreven (bijvoorbeeld: "Oh, soms zeggen ze 'Fout wachtwoord', soms zeggen ze 'Auth-fout'").
- De Code Schrijver: Sieve stuurt je vraag en dit kleine spiekbriefje naar een zeer slimme AI (een Large Language Model). De AI leest niet het hele boek; het gebruikt het spiekbriefje om een aangepast computerscript (zoals een klein robotprogramma) te schrijven dat specifiek is ontworpen om je antwoord te vinden.
- De Uitvoering: Dit aangepaste script draait op de ruwe notities. Omdat het door de AI is geschreven op basis van het spiekbriefje, weet het precies hoe het "Fout wachtwoord" en "Auth-fout" moet vinden en hoe het ze moet tellen.
- Het Resultaat: Het script geeft je het antwoord. Als het script een fout maakt (zoals een typefout), ziet Sieve de fout, vertelt het de AI en vraagt het om het script te herschrijven. Het probeert tot vier keer toe totdat het het goed heeft.
Waarom Dit Een Grote Zaal Is
Het artikel testte dit op 133 verschillende beveiligingsvragen over 5 verschillende soorten logs. Hier is wat ze ontdekten:
- Het Is Slimmer Dan Mensen Voor Moeilijke Gevallen: Wanneer de vragen simpel waren (zoals "vind het woord 'fout'"), was Sieve net zo goed als een menselijk expert die een snel script schrijft. Maar wanneer de vragen moeilijk waren (zoals "vind patronen over tijd en verschillende personen"), maakte Sieve 3 keer minder fouten dan mensen die probeerden scripts van scratch te schrijven.
- Het Heeft Geen Perfecte Bibliotheekmedewerker Eerst Nodig: Sieve heeft geen vooraf gemaakte spreadsheet nodig. Het werkt direct op de slordige ruwe notities.
- Eenvoud Is Beter: Het artikel vond dat je geen chique, dure AI nodig hebt om eerst de handschriftstijlen te achterhalen. Een eenvoudig, snel algoritme dat gewoon telt hoe vaak bepaalde zinsdelen voorkomen, werkt net zo goed als de complexe methoden.
- Het Is Veilig en Betrouwbaar: De AI raadt niet zomaar het antwoord; het schrijft code die draait als een normaal computerprogramma. Dit betekent dat het resultaat deterministisch is (dezelfde vraag geeft altijd hetzelfde antwoord) en je kunt de code bekijken om precies te zien hoe het werkte.
De Conclusie
Sieve overbrugt de kloof tussen de snelheid van het doorzoeken van ruwe tekst en de kracht van gestructureerde databases. Het stelt beveiligingsanalisten in staat om complexe vragen in gewoon Nederlands te stellen en direct accurate antwoorden te krijgen, zonder te wachten tot ingenieurs een nieuw databaseschema bouwen of zelf worstelen met het schrijven van complexe scripts. Het verandert het "slordige notitieboek" op de vlucht in een doorzoekbare database, één vraag per keer.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.