← Nieuwste papers
🤖 AI

SafetyDrift: Predicting When AI Agents Cross the Line Before They Actually Do

Het paper SafetyDrift introduceert een model op basis van absorberende Markov-ketens dat voorspelt wanneer veilige AI-agent-acties cumulatief leiden tot veiligheidsviolaties, en bewijst dat deze methode significante waarschuwingen biedt met een veel hogere detectiesnelheid en lagere rekenkosten dan bestaande technieken.

Oorspronkelijke auteurs: Aditya Dhodapkar, Farhaan Pishori

Gepubliceerd 2026-03-31
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Aditya Dhodapkar, Farhaan Pishori

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

🚗 De Kern: Het "Veiligheids-Drift" Probleem

Stel je voor dat je een slimme, autonome chauffeur (een AI-agent) hebt die voor je werkt. Je vraagt hem: "Haal de notities van de vergadering en stuur ze naar het team."

De AI doet stap voor stap dingen die allemaal prima lijken:

  1. Hij opent een map met notities (Veilig).
  2. Hij leest de bestanden (Veilig).
  3. Hij slaat ze op in een tijdelijk bestand (Veilig).
  4. Hij stuurt een e-mail naar het team (Veilig).

Maar hier zit de valkuil: De AI vergeet dat hij in stap 2 ook per ongeluk een bestand met geheime wachtwoorden heeft geopend. Omdat hij die nu in zijn "geheugen" heeft, stuurt hij in stap 4 per ongeluk die wachtwoorden mee in de e-mail.

Geen enkele enkele stap was verkeerd. Maar de reeks van stappen leidde tot een ramp. Dit noemen de auteurs Safety Drift (Veiligheids-Afwijking). Het is alsof je een auto een beetje te hard rijdt, dan een bocht te snel neemt, en dan een remfoutje maakt. Geen van die acties op zich is een crash, maar samen zorgen ze ervoor dat je uit de bocht vliegt.

🎲 De Oplossing: Een Voorspellende Kristallen Bol

Tot nu toe keken beveiligingssystemen alleen naar de huidige stap. "Is dit een gevaarlijk commando?" Nee? Dan mag het.
SAFETYDRIFT kijkt echter naar de reis die de AI maakt.

De auteurs gebruiken wiskunde (genaamd Absorberende Markov-ketens) om te voorspellen waar de AI naartoe gaat.

  • De Vergelijking: Stel je voor dat je een bordspel speelt. Je staat op een vakje. Je weet niet precies welke worp je gaat doen, maar je kunt wel berekenen: "Als ik nu op dit vakje sta, is de kans 85% dat ik binnen 5 zetten in de 'Gevangenis' (een veiligheidsfout) beland."

Het systeem berekent dus niet of de huidige stap veilig is, maar of de AI binnenkort in de problemen komt als hij zo doorgaat.

🗺️ De Belangrijkste Ontdekkingen

  1. Sommige routes zijn gevaarlijker dan andere:

    • Communicatie-taken (zoals e-mails sturen of verslagen maken): Zodra de AI hier een klein beetje risicovol gedrag vertoont (bijv. een privé-bestand openen), is de kans dat hij binnen 5 stappen een fout maakt 85%. Dit is een "Punt van Geen Terugkeer".
    • Technische taken (zoals code debuggen of servers beheren): Hier is de kans op een fout zelfs na risicovol gedrag heel klein (minder dan 5%).
    • Conclusie: Je kunt niet met één beveiligingsregelset voor alles werken. Een AI die e-mails schrijft, moet veel strenger worden gecontroleerd dan een AI die code schrijft.
  2. Het systeem is supersnel en goedkoop:

    • Andere systemen proberen bij elke stap een andere AI te laten oordelen ("Is dit veilig?"). Dit duurt lang en kost veel rekenkracht (alsof je bij elke stap een nieuwe expert belt).
    • SAFETYDRIFT werkt als een snelle check-list. Het kost minder dan 0,001 seconde. Het is 60.000 keer sneller dan de alternatieven.
  3. Het werkt als een waarschuwingssysteem:

    • Het systeem geeft 3,7 stappen van voorspelling.
    • Vergelijking: Het is alsof je navigatie zegt: "Let op, over 4 kilometer kom je bij een afslag die je niet wilt nemen. Draai nu alvast naar links."
    • Hierdoor kun je ingrijpen voordat de fout gebeurt, in plaats van achteraf te zeggen: "Oeps, wachtwoorden zijn gestolen."

🛠️ Hoe werkt het in de praktijk?

Het systeem heeft drie ogen:

  1. Gegevens: Wat voor soort bestanden heeft de AI aangeraakt? (Publiek, Intern, Gevoelig, Wachtwoorden?)
  2. Kracht: Welke macht heeft de AI gebruikt? (Alleen lezen, schrijven, code uitvoeren, internet?)
  3. Terugdraaien: Kan de AI dit ongedaan maken? (Een e-mail sturen is ongedaan te maken, maar een bestand verwijderen soms niet).

Op basis van deze drie factoren berekent het systeem: *"Oké, deze AI zit nu in een 'Mild Risico' staat. Omdat hij e-mails schrijft, is de kans dat hij binnen 5 stappen een datalek veroorzaakt 85%. BLOKKEER HEM NU."*

🏁 Samenvatting

SAFETYDRIFT is een slimme, snelle en goedkope manier om AI-agenten in de gaten te houden. In plaats van te wachten tot ze een fout maken, kijkt het naar het patroon van hun gedrag. Het weet dat bepaalde taken (zoals communicatie) gevaarlijker zijn dan andere, en geeft een waarschuwing lang voordat de ramp gebeurt.

Het is alsof je een slimme passagier in je auto hebt die zegt: "Je rijdt nu prima, maar je hebt een sleutel in je hand en je bent naar een schoolgebied gereden. De kans dat je een kind aanrijdt is groot. Laat die sleutel los en rem af, voordat je überhaupt een ongeluk hebt."

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →