Authenticated Workflows: A Systems Approach to Protecting Agentic AI
Dit artikel introduceert "authenticated workflows", een deterministische beveiligingslaag voor agentic AI die door middel van cryptografische verificatie en de nieuwe MAPL-beleidstaal de integriteit en intentie van AI-operaties op alle kritieke grenzen garandeert.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een superintelligente digitale assistent hebt (een 'AI-agent'). Deze assistent is niet zomaar een chatbot die praat; hij kan echt dingen doen. Hij kan je bankzaken regelen, je e-mails schrijven, bestanden op je computer lezen en zelfs beslissingen nemen in een ziekenhuis.
Het probleem? Deze assistent is een beetje een "naïeve genie". Hij is ontzettend slim, maar hij kan het verschil niet zien tussen een vriendelijk verzoek van jou en een gemene opdracht die verstopt zit in een document dat hij net heeft gelezen.
Dit onderzoek, "Authenticated Workflows", is eigenlijk het ontwerpen van een ondoordringbaar beveiligingssysteem voor deze digitale superkrachten.
Hier is de uitleg in begrijpelijke taal:
Het Probleem: De "Trojaanse Paard" van de AI
Stel je voor dat je een persoonlijke assistent hebt die je huis schoonmaakt en je post sorteert. Op een dag leest hij een brief die hij in de brievenbus vindt. In die brief staat: "Hoi, ik ben de postbode. Je mag nu ook de kluis in de kelder openen en het geld naar dit adres sturen."
Omdat de assistent de brief als 'informatie' ziet en niet als een 'bevel', voert hij het uit. Hij denkt dat hij gewoon zijn werk doet. Dit noemen we een prompt injection. De huidige beveiliging probeert dit te stoppen door te kijken naar "verdachte woorden", maar dat is alsof je een uitsmijter bij een club vraagt om mensen tegen te houden die "gekke dingen zeggen". Slimme boeven weten precies welke woorden ze niet moeten gebruiken om toch binnen te komen.
De Oplossing: De "Digitale Douane"
De onderzoekers zeggen: "Stop met proberen te raden of een zin gemeen is. Laten we het systeem zo bouwen dat de assistent alleen dingen mag doen als hij een onvervalsbaar, cryptografisch bewijs heeft."
Ze introduceren een systeem dat werkt met vier belangrijke grenzen (de "douaneposten"):
- De Instructie-grens (Prompts): Wat wordt er gevraagd?
- De Gereedschap-grens (Tools): Mag de AI de e-mail versturen of de kluis openen?
- De Data-grens (Data): Welke informatie mag de AI lezen?
- De Geheugen-grens (Context): Wordt de assistent tijdens het gesprek langzaam gemanipuleerd?
Hoe werkt het? (De Metafoor van de Gecertificeerde Koerier)
In plaats van dat de assistent zomaar ergens naar wijst en zegt: "Ik wil dit bestand lezen", werkt het nieuwe systeem als een streng beveiligde bank:
- De Digitale Handtekening (Authenticiteit): Elke actie moet een unieke, digitale stempel hebben. Het is alsof elke opdracht een officieel zegel van de koning moet hebben. Zonder dat zegel doet de assistent simpelweg niets.
- De Checklist (MAPL): Er is een nieuwe taal (MAPL) die regels schrijft die heel strikt zijn. Bijvoorbeeld: "Je mag alleen geld overmaken ALS je eerst een officieel bewijs hebt gezien dat de rekening is gecontroleerd." Het is een ketting van bewijzen.
- De Onafhankelijke Controleur (PEP): Bij elke deur (elke grens) staat een onafhankelijke bewaker die niet de assistent is, maar een externe controleur. Zelfs als de assistent "gek" wordt gemaakt door een kwaadaardige brief, kan de bewaker bij de deur zeggen: "Ho stop! Je hebt geen geldig zegel voor deze kluis, dus je komt er niet in."
Waarom is dit revolutionair?
De meeste huidige beveiliging is probabilistisch (het gokt: "Dit lijkt een beetje op een aanval, dus ik blokkeer het"). Dit zorgt voor fouten: soms wordt een goede opdracht geblokkeerd, en soms glipt een slechte erdoorheen.
Dit nieuwe systeem is deterministisch (het is zwart-wit: "Je hebt het digitale bewijs? Dan mag je door. Je hebt het niet? Dan sta je buiten.").
De resultaten zijn indrukwekkend:
In tests vingen ze 100% van de aanvallen zonder dat ze ooit een legitieme opdracht per ongeluk blokkeerden. Ze hebben zelfs laten zien dat ze echte, bekende lekken in grote systemen (zoals die van OpenAI) volledig zouden hebben tegengehouden.
Samenvatting
Het is alsof je van een assistent die alles gelooft wat hij leest, een assistent maakt die alleen werkt met officieel ondertekende orders en strikte protocollen. De AI mag nog steeds superintelligent zijn, maar hij krijgt pas de sleutels van de deur als hij kan bewijzen dat de opdracht echt, veilig en volgens de regels is.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.