ADR: An Agentic Detection System for Enterprise Agentic AI Security
Dit artikel introduceert ADR, een in de praktijk beproefd enterprise-framework voor het beveiligen van Model Context Protocol (MCP)-agenten dat hoge-fideliteit telemetrie, systematische red teaming en een schaalbaar tweelaags detectiesysteem combineert om uitdagingen op het gebied van waarneembaarheid, robuustheid en kosten te overwinnen, en zo superieure prestaties bereikt in real-world implementaties en benchmark-evaluaties.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je een enorm, high-tech kantoor voor waar duizenden werknemers een nieuw soort "super-assistent" (AI-agents) gebruiken om hun werk te doen. Deze assistenten kunnen bestanden lezen, code schrijven en met andere softwaretools communiceren om taken uit te voeren. Ze gebruiken een standaardtaal om met deze tools te praten, genaamd MCP (Model Context Protocol).
Het probleem is dat deze assistenten zo slim en autonoom zijn dat ze kunnen worden misleid. Een hacker kan een assistent een geheime instructie fluisteren, waardoor het overtuigd wordt om wachtwoorden te stelen of belangrijke bestanden te verwijderen, terwijl de assistent denkt dat het gewoon zijn werk doet.
Traditionele beveiligingswachten (zoals diegene die veranderingen in bestanden bewaken) kunnen zien dat een bestand is gewijzigd, maar ze kunnen niet horen waarom de assistent het heeft gewijzigd. Ze missen het "denkproces" achter de actie.
Dit paper introduceert ADR (Agentic Detection and Response), een nieuw beveiligingssysteem dat specifiek is ontworpen om deze AI-assistenten in de gaten te houden. Hieronder wordt uitgelegd hoe het werkt, in eenvoudige bewoordingen:
1. Het Probleem: Het "Blind Vlak"
Stel je de oude beveiligingstools voor als een camera die een fabrieksvloer bewaakt. Ze kunnen zien dat een werknemer een doos oppakt en door de deur loopt. Maar ze kunnen het gesprek van de werknemer niet horen en ze kunnen het briefje in zijn hand niet zien waarop staat: "Deze doos is eigenlijk een bom."
- De Kloof: Oude tools zien de actie (bestand schrijven), maar missen de intentie (de prompt en de redenering).
- Het Risico: Hackers kunnen de AI ervan overtuigen dat het stelen van data een normale taak is.
2. De Oplossing: Het ADR-systeem
De auteurs hebben een drieledig systeem gebouwd om dit op te lossen, dat fungeert als een hoogopgeleid beveiligingsteam.
Deel A: De "Adelaarsblik"-sensor (ADR Sensor)
In plaats van alleen de fabrieksvloer te bewaken, zit deze sensor direct in het brein van de AI.
- Wat het doet: Het registreert alles: wat de gebruiker vroeg, hoe de AI erover dacht, welke tools het gebruikte en wat er daarna gebeurde.
- De Analogie: Het is als een griffier in een rechtbank die elk woord dat tijdens een vergadering wordt gesproken, opneemt, niet alleen het uiteindelijke besluit. Dit geeft beveiligingsteams het volledige "verhaal" van wat de AI deed, niet alleen het resultaat.
Deel B: Het "Twee-traps"-detectiveteam (ADR Detector)
Elke enkele actie controleren met een super-slimme (maar dure) AI-detective zou te veel geld en tijd kosten. Daarom gebruikt ADR een tweestapsproces:
- Trap 1 (De Snelle Triage): Een snelle, lichtgewicht scanner bekijkt duizenden acties per seconde. Het is als een bouncer bij een club die snel identiteitsbewijzen controleert. Als iets er duidelijk veilig uitziet, laat hij het passeren. Als iets er "verdacht" uitziet (zoals het vragen om een wachtwoord), markeert hij het.
- Trap 2 (De Diepe Duik): De gemarkeerde items gaan naar een senior detective. Deze detective heeft toegang tot het reglement van het bedrijf, handleidingen voor code en een lijst met bekende criminele trucs. Het leest het volledige verhaal (van de Sensor) en beslist: "Is dit een echte aanval of gewoon een misverstand?"
- Waarom het werkt: Dit bespaart geld door de dure detective niet te gebruiken voor saaie, veilige taken, maar zorgt ervoor dat verdachte taken diep en zorgvuldig worden geanalyseerd.
Deel C: De "Rood Team"-simulator (ADR Explorer)
Voordat het systeem live gaat, moet het worden getest.
- Wat het doet: Een speciaal AI-"Rood Team" probeert het systeem te breken. Het bedenkt nieuwe, lastige manieren om de AI-assistenten te misleiden.
- De Analogie: Stel je een brandoefening voor waarbij een team probeert een brand in het gebouw te smokkelen om te zien of de alarmen werken. Wanneer het Rood Team een nieuwe truc vindt, leert het systeem ervan en wordt het slimmer voordat echte hackers het kunnen gebruiken.
3. De Resultaten: Bewijs uit de Wereld
Het team testte dit meer dan tien maanden lang bij Uber op meer dan 7.200 computers.
- Succes: Het systeem vond honderden gevallen waarin werknemers per ongeluk (of kwaadwillig) wachtwoorden en geheimen deeltten met de buitenwereld.
- Nauwkeurigheid: Het was ongelooflijk precies. Bij tests had het nul valse alarmen op een specifieke benchmark (wat betekent dat het nooit "wolf" riep als er geen wolf was), terwijl het toch 67% van de echte aanvallen opving.
- Vergelijking: Het presteerde 2 tot 4 keer beter dan andere topbeveiligingstools die momenteel beschikbaar zijn.
4. De "Shift-Left"-preventie
Omdat het systeem zo goed was in het opsporen van gedeelde geheimen, stopte het team niet alleen bij het vangen ervan; ze stopten ze voordat ze konden gebeuren.
- Ze voegden een "pre-prompt"-controle (een haakje) toe die scant wat de gebruiker op het punt staat te typen. Als het een wachtwoord ziet, blokkeert het dit direct.
- Dit werkte met 97,2% nauwkeurigheid, waardoor lekken werden voorkomen voordat ze zelfs maar begonnen.
Samenvatting
Het paper presenteert ADR als het eerste grootschalige, bewezen beveiligingssysteem voor het nieuwe tijdperk van AI-assistenten. Het lost het probleem op van "we kunnen niet zien wat de AI denkt" door het volledige gesprek op te nemen, een slim twee-traps detectiveproces te gebruiken om geld te besparen, en zichzelf voortdurend te trainen door te proberen zijn eigen systeem te hacken. Het bleek succesvol in een echte zakelijke omgeving, waarbij het echte beveiligingsrisico's opving die oude tools misten.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.