Cross-Vendor Sola ISPM Benchmark: Evaluating Agentic AI for Federated Identity Security Reasoning
Dit artikel introduceert de Cross-Vendor Sola ISPM Benchmark om het vermogen van Agentic AI te evalueren om te redeneren over gefragmenteerde multi-cloud identiteitssystemen, waarbij wordt aangetoond dat het verstrekken van expliciete relationele context de juistheid van antwoorden aanzienlijk verbetert en de foutpercentages in cross-vendor beveiligingsanalyse vermindert.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je een enorm, modern kantoorgebouw voor waar elke afdeling een andere taal en een ander archiefsysteem gebruikt. De HR-afdeling houdt personeelsgegevens bij in één boek, het IT-securityteam gebruikt een digitaal grootboek, het cloud-opslagteam heeft een aparte kaart en het marketingteam gebruikt een totaal andere app.
In het verleden kon je, als je wilde weten "Wie heeft toegang tot de kluis?", gewoon één persoon vragen. Maar tegenwoordig is de "kluis" digitaal en liggen de sleutels verspreid over al deze verschillende systemen. Om het antwoord te vinden, moet je de verbanden leggen tussen het HR-boek, het IT-grootboek en de cloud-kaart.
Dit artikel introduceert een nieuwe manier om te testen of een AI-detective slim genoeg is om deze puzzels op te lossen.
Het Probleen: De "Lost in Translation"-kloof
De auteurs noemen dit de "Correlation Gap" (correlatiekloof).
Stel je voor dat je een detective bent die een verdachte probeert te vinden. Je hebt een foto van het gezicht van de verdachte (hun naam in het HR-systeem) en een beschrijving van hun auto (hun ID in het cloud-systeem). Maar de politie-database weet niet dat "John Doe" in het HR-boek dezelfde persoon is als "J. Doe" in het auto-register.
Huidige AI-modellen zijn als detectives die heel goed zijn in het lezen van één enkel boek, maar slecht in het leggen van verbanden tussen verschillende talen. Ze kunnen het antwoord misschien raden, maar ze raken vaak de weg kwijt omdat ze niet begrijpen hoe de systemen met elkaar communiceren.
De Oplossing: De "Sola Benchmark"
De onderzoekers hebben een trainingsgrond (een benchmark) gebouwd om AI-agenten op dit specifieke probleem te testen.
- De Opzet: Ze creëerden een realistische, chaotische omgeving met behulp van 8 verschillende real-world platforms (zoals AWS, Google, Microsoft en HR-software).
- De Test: Ze gaven de AI 50 complexe vragen, zoals: "Vind alle werknemers die vorige maand zijn ontslagen, maar nog steeds toegang hebben tot onze cloudservers."
- De Uitdaging: Om dit te beantwoorden, moet de AI:
- Naar de HR-lijst kijken om de ontslagen mensen te vinden.
- Die lijst vertalen naar de taal van de Identity Provider (zoals Okta).
- Dat kruisverwijzen met de Cloud Provider (zoals AWS) om te zien wie er nog sleutels heeft.
- Al deze punten verbinden zonder in de war te raken.
Het Experiment: De Detective een Kaart Geven
De onderzoekers testten de AI onder vijf verschillende omstandigheden om te zien wat het meest hielp:
- Geen Context: De detective wordt geblinddoekt in het gebouw geworpen, zonder kaarten of lijsten. Ze moeten gokken en aan elke deur kloppen.
- Alleen Schema: De detective krijgt een lijst met kamernummers en wat er binnenin zit, maar geen kaart van hoe de kamers met elkaar verbonden zijn.
- Schema + Graaf: De detective krijgt de kamerlijst plus een kaart die precies laat zien welke deuren met welke verbonden zijn (bijv. "Deur A in het HR-gebouw leidt rechtstreeks naar Deur B in het Cloud-gebouw").
- Schema + Voorbeelden: De detective krijgt de kamerlijst en een paar voorbeelden van hoe andere detectives soortgelijke puzzels hebben opgelost.
- Volledige Context: De detective krijgt de kamerlijst, de kaart, de voorbeelden en een handleiding.
De Resultaten: De Kaart Maakt het Verschil
De bevindingen waren duidelijk en verrassend:
- Blind Gokken Faalt: Wanneer de AI geen hulp kreeg (Geen Context), had het moeite. Het maakte veel fouten en moest veel vragen stellen om erachter te komen.
- De "Graaf" is het Magische Ingrediënt: De grootste sprong in prestaties vond plaats toen de AI de Security Graph kreeg (de kaart die laat zien hoe systemen verbonden zijn).
- Nauwkeurigheidsboost: Met de volledige kaart en voorbeelden steeg het vermogen van de AI om het juiste antwoord te geven met ongeveer 34%.
- Efficiëntieboost: De AI stopte met gokken en het stellen van onnodige vragen. Het verminderde het aantal "reizen" dat het moest maken met ongeveer 70%.
- Slim maar Verdwaald: Het paper vond dat de AI-modellen eigenlijk best slim zijn. Zelfs zonder hulp konden ze vaak de algemene gedachte van het antwoord raden (bijv. "Ja, er is een risico"). Maar zonder hulp konden ze niet het specifieke bewijs vinden om het te bewijzen (bijv. "Hier zijn de exacte 12 mensen die een risico lopen").
De Conclusie
Het paper concludeert dat AI niet noodzakelijkerwijs "dom" is in security-redenering; het is alleen "blind" zonder de juiste context.
Beschouw het als het geven van een GPS aan een chauffeur. De chauffeur (de AI) weet hoe hij moet rijden en waar hij heen moet, maar zonder de GPS (de gestructureerde kaart van hoe systemen verbonden zijn), raakt hij de weg kwijt, maakt hij verkeerde afslag en verspilt hij tijd. Zodra je hem de GPS geeft, rijdt hij perfect, komt hij sneller aan en weet hij precies welke straten hij moet nemen.
De auteurs hebben deze benchmark gebouwd om te bewijzen dat, voor AI nuttig te zijn in de echte wereld van beveiliging, we niet alleen vragen kunnen stellen; we moeten het de relationele kaart geven die alle verschillende delen van de digitale wereld met elkaar verbindt.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.