← Nieuwste papers
💻 computer science

Runtime Risk Detection and Control for AI Agents and LLM Applications

Dit artikel presenteert een artefact-gebaseerde casestudy van AgentGuard AI v2.4.0, een onderzoeksprototype dat runtime risicodetectie- en controlemechanismen voor AI-agenten operationaliseert, terwijl het de bruikbaarheid ervan als een inspecteerbaar governance-instrument benadrukt en specifieke reproduceerbaarheidsgebreken identificeert die claims van productieve effectiviteit uitsluiten.

Oorspronkelijke auteurs: Deepak Kumar Gour, Sushma Agrawal

Gepubliceerd 2026-09-15
📖 7 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Deepak Kumar Gour, Sushma Agrawal

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ✨ Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een wereld voor waarin computerprogramma's niet alleen vragen beantwoorden, maar ook actief de digitale wereld in gaan om informatie te verzamelen, beslissingen te nemen en op eigen houtje acties te ondernemen. Dit zijn AI-agenten. Ze zijn als digitale werknemers die vluchten kunnen boeken, gegevens kunnen analyseren of slimme apparaten kunnen aansturen door een reeks kleine stappen aan elkaar te koppelen. Echter, dit nieuwe vermogen brengt een specifiek soort gevaar met zich mee. Omdat deze agenten informatie van het internet kunnen lezen en daarop kunnen handelen, kan een slimme truc die verborgen zit in een onschuldig ogende website de agent kunnen misleiken om iets schadelijks te doen, zoals gegevens te stelen of bestanden te verwijderen. Het probleem is dat tegen de tijd dat een mens de fout opmerkt, de agent mogelijk al schade heeft aangericht. Om dit te stoppen, hebben we een manier nodig om deze agenten te bewaken terwijl ze werken, te spotten wanneer ze een risicovolle zet willen doen, en hen te pauzeren voor een menselijke controle voordat ze handelen.

Dit is de uitdaging waar een onderzoeksproject genaamd AgentGuard AI zich mee bezighoudt. De onderzoekers, werkzaam vanuit een universiteit in India, hebben een prototype systeem gebouwd dat is ontworpen om te fungeren als een waakhond voor deze autonome programma's. Hun doel was niet om een perfect beveiligingsproduct voor de echte wereld te bouwen, maar om een werkend model te creëren dat kon laten zien hoe men drie cruciale ideeën kan verbinden: het detecteren van risicovol gedrag, het scoren van hoe gevaarlijk dat gedrag is, en beslissen wat de volgende stap is. Ze wilden zien of ze een systeem konden bou�eld dat niet alleen problemen signaleert, maar ook een duidelijk, onveranderlijk verslag bijhoudt van elke beslissing, zodat mensen later precies kunnen terugzien wat er is gebeurd en waarom. Het resultaat is een gedetailleerde blik op een softwaretool die probeert orde en menselijk toezicht te brengen in de chaotische wereld van AI-agenten.

Het systeem dat zij hebben gebouwd, genaamd AgentGuard AI, werkt als een verkeerstoren voor digitale agenten. Het begint met het observeren van de stroom gebeurtenissen terwijl de agent werkt. Het zoekt naar specifieke patronen die op gevaar duiden, zoals een agent die probeert toegang te krijgen tot een geheim bestand of een verwarrende instructie opvolgt die een valstrik zou kunnen zijn. Wanneer het iets verdachts opmerkt, slaat het niet alleen alarm; het berekent een risicoscore. Deze score is geen enkel getal dat uit het niets wordt getrokken. In plaats daarvan is het een combinatie van zes verschillende factoren, waaronder hoe risicovol de tools van de agent zijn, hoe veilig het systeem is en hoe de gebruiker zich gedraagt. Deze factoren worden samen gewogen om een definitieve score te produceren die het systeem vertelt hoe ernstig de situatie is.

Zodra de risicoscore is berekend, gaat het systeem over naar de besluitvormingsfase. Het kan vier mogelijke staten aanbevelen: het kan de agent door laten gaan, nauwlettend in de gaten houden, de mogelijkheden van de agent beperken, of de actie volledig blokkeren. Cruciaal is dat dit systeem transparant is ontworpen. Het houdt een gedetailleerd logboek bij van elke stap, van de initiële waarschuwing tot de uiteindelijke aanbeveling. Het maakt het mogelijk dat verschillende mensen verschillende rollen hebben; een manager kan de regels wijzigen, een onderzoeker kan tests uitvoeren, en een beoordelaar kan de logs bekijken om acties goed te keuren of af te wijzen. Het systeem bevat ook privacyfuncties, zoals het verbergen van gevoelige delen van het gesprek in de logs, en het creëert een digitale "keten" van records die het zeer moeilijk maakt om de geschiedenis van wat er is gebeurd te vervalsen.

Om te testen of dit idee daadwerkelijk werkte, voerden de onderzoekers een specifiek experiment uit. Ze gebruikten geen echte agenten of echte hackers. In plaats daarvan gebruikten ze een ingebouwde simulator om vijfentwintig nep-gebeurtenissen te genereren. Sommige van deze gebeurtenissen waren veilig, terwijl andere zo waren ontworpen dat ze op aanvallen leken. Het systeem verwerkte deze gebeurtenissen en produceerde een compleet pakket aan bewijsmateriaal, inclusief de ruwe gegevens, de risicoscores, de meldingen en de uiteindelijke beslissingen. De onderzoekers inspecteerden dit pakket vervolgens zorgvuldig door te kijken naar wat het systeem op zijn scherm toonde en wat er in de digitale bestanden was opgeslagen.

De inspectie onthulde dat het systeem inderdaad alle punten kon verbinden. Het slaagde erin een gebeurtenis te nemen, de risico's te scoren, een aanbeveling te doen en het bewijs op een manier op te slaan die later gereviewed kon worden. Dit bewees dat de basisworkflow mogelijk was. Echter, de test bracht ook significante gebreken aan het licht die voorkomen dat dit een direct inzetbare beveiligingstool is. De onderzoekers ontdekten dat het systeem niet perfect consistent was. Bijvoorbeeld, het scherm toonde één versie van de risicoscore-regels, maar het opgeslagen bestand toonde een andere versie. In een ander geval zei het systeem dat het een actie met een hoog risico zou blokkeren, maar de opgeslagen registratie zei dat het simpelweg om een menselijke controle zou vragen. Deze mismatches betekenen dat als je het experiment later opnieuw zou proberen uit te voeren, je mogelijk niet exact hetzelfde resultaat zou krijgen, wat een groot probleem is voor elk systeem dat beweert betrouwbaar te zijn.

Bovendien ontbrak het het systeem aan enkele essentiële details die nodig zijn voor echte bewijsvoering. Het legde niet de specifieke 'random seed' vast die werd gebruikt om de testgebeurtenissen te genereren, noch legde het de exacte versie van de computercode vast die werd uitgevoerd. Zonder deze details is het onmogelijk voor een andere onderzoeker om het experiment exact te reproduceren om de resultaten te verifiëren. De studie merkte ook op dat het systeem draaide als een eenvoudige simulatie op één enkele computer, en niet als een complexe, hoogwaardige service die de real-world traffic aan kan. Het was een onderzoeksprototype, geen afgewerkt product.

De onderzoekers waren zeer duidelijk over wat hun werk wel en niet bereikt heeft. Ze hebben niet bewezen dat hun systeem echte hackers kan stoppen of dat het beter is dan andere beveiligingstools. Ze hebben het niet getest met echte mensen die de meldingen beoordelen om te zien of het systeem hun werklast verminderde of hun beslissingen verbeterde. Wat ze wel hebben bewezen, is dat ze een framework konden bouwen dat detectie, scoring en menselijke controle koppelt aan één inspecteerbaar proces. Ze lieten zien dat het mogelijk is om een digitaal spoor te creëren dat een risicovolle gebeurtenis verbindt met een menselijke beslissing, maar ze lieten ook zien dat het bouwen van een systeem dat consistent, reproduceerbaar en klaar voor de echte wereld is, veel meer werk vereist.

De waarde van dit onderzoek ligt in de eerlijkheid ervan. In plaats van een gepolijste, perfecte oplossing te presenteren, presenteerden de onderzoekers een werkend model dat ze vervolgens zelf weer uit elkaar haalden om te laten zien waar het sterk en waar het zwak was. Ze demonstreerden dat hoewel het idee van een governance-bewuste AI-waakhond solide is, de details er enorm toe doen. Een systeem dat beweert AI-agenten te beschermen, moet in staat zijn zijn eigen records kloppend te houden, ervoor te zorgen dat zijn regels consistent worden toegepast, en voldoende informatie te bieden zodat mensen zijn beslissingen kunnen vertrouwen. Totdat die onderdelen zijn opgelost, blijft het systeem een krachtig instrument voor onderzoek en een blauwdruk voor de toekomst, maar nog niet een schild voor het heden.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →