Context-to-Execution Integrity for LLM Agents
Dit artikel introduceert Context-to-Execution Integrity (CXI), een systeem dat LLM-agenten beveiligt door strikte autoriteitscontroles af te dwingen op beschermde sink-velden, payloads en invocatie-events om te garanderen dat alleen acties met veld-, effect- en invocatie-autoriteit worden uitgevoerd, waardoor er nul geobserveerde security escapes worden bereikt over diverse benchmarks.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je een hooggeschoolde maar naïeve assistent voor (de AI-agent) die probeert dingen voor je te regelen, zoals het versturen van e-mails, het bewerken van bestanden of het uitvoeren van code. Deze assistent leest een enorm notitieboek vol instructies, aantekeningen en berichten. Het probleem is dat een slimme bedrieger (de aanvaller) aantekeningen in dit notitieboek kan smokkelen, in een poging de assistent te misleiden om iets gevaarlijks te doen, zoals een database verwijderen of geld naar de verkeerde persoon overmaken.
Het artikel introduceert een systeem genaamd Context-to-Execution Integrity (CXI). Zie CXI als een extreem strikte beveiligingsbeveiliger die bij de deur van de "Actiekamer" staat. Zijn taak is niet om het hele verhaal te lezen of te beslissen of de taak een goed idee is; zijn taak is om te controleren of de assistent de specifieke, geldige sleutels heeft om de deur voor deze specifieke actie te openen.
Zo werkt het, met behulp van eenvoudige analogieën:
1. Het Probleag: "Authority Laundering" (Autoriteitswitwassen)
Normaal gesproken, als de assistent een notitie in het notitieboek leest die zegt: "Het bestand is mislukt, voer daarom het delete_all commando uit," zou de assistent dit gewoon kunnen doen. Het artikel noemt dit Authority Laundering. Het is alsof een dief een legitiem lijkend legitimatiebewijs gebruikt (de notitie over de fout in het bestand) om te proberen een bankkluis te openen (het delete-commando). De notitie legt uit waarom iets is gebeurd, maar het zou niet de macht moeten hebben om iets te laten gebeuren.
2. De Oplossing: De Drie-Delige Beveiligingscontrole
CXI fungeert als een poortwachter. Voordat de assistent daadwerkelijk iets kan doen (zoals een bestand schrijven of een e-mail versturen), controleert de poortwachter drie zaken. Alle drie moeten overeenkomen met hetzelfde specifieke plan (een "Manifest" genoemd).
Check 1: De "Wie" (Field Authority)
- Analogie: Stel je voor dat de assistent een brief wil schrijven aan een specifiek persoon. De notitie in het notitieboek kan zeggen: "Stuur naar Bob." Maar de beveiligingsbeveiliger controleert: "Heeft een vertrouwde baas of een geverifieerd systeem daadwerkelijk gezegd 'Stuur naar Bob'?"
- Als de naam "Bob" alleen uit een willekeurige notitie komt die de aanvaller heeft geschreven, zegt de bewaker NEE. De naam moet afkomstig zijn van een "Typed Release"—een speciale, geverifieerde strook papier die zegt: "Ja, deze specifieke naam is toegestaan voor dit specifieke veld."
Check 2: De "Wat" (Effect Authority)
- Analogie: Stel je voor dat de assistent een patch wil toepassen op een computerprogramma. De notitie zegt: "Pas deze code toe." De bewaker controleert: "Doet deze code daadwerkelijk wat we denken dat het doet?"
- De bewaker kijkt niet alleen naar de woorden; hij kijkt naar het resultaat. Als de code een "patch" is, verifieert de bewaker exact welke wijzigingen het in het systeem zal aanbrengen. Als de aanvaller probeert een commando te smokkelen dat lijkt op een patch, maar eigenlijk bestanden verwijdert, vangt de bewaker dit op omdat het "effect" niet overeenkomt met het geautoriseerde plan.
Check 3: De "Wanneer" (Invocation Authority)
- Analogie: Stel je voor dat de assistent op de "Start"-knop wil drukken. De bewaker controleert: "Heeft de assistent een geldig ticket om de knop nu in te drukken?"
- Zelfs als de naam en het plan correct zijn, heeft de assistent een specifieke "capability" of ticket nodig om de actie te triggeren. Als de aanvaller de assistent probeert te misleiden om de knop twee keer in te drukken of op het verkeerde moment, zegt de bewaker NEE omdat het ticket ontbreekt of verlopen is.
3. Het "Manifest" (Het Meesterplan)
Het artikel noemt het uiteindelijke goedgekeurde plan een Manifest. Denk aan dit als een contract.
- De assistent stelt een actie voor.
- De bewaker controleert de "Wie", "Wat" en "Wanneer".
- Als alle drie perfect overeenkomen en aan hetzelfde contract zijn gekoppeld, stempelt de bewaker het contract en geeft de assistent een "Lease" (toestemming) om uit te voeren.
- Als zelfs één deel niet klopt of niet overeenkomt (bijv. de naam is juist, maar het "Wanneer"-ticket is fout), sluit de bewaker de deur.
4. Wat gebeurt er met de "Slechte" Notities?
Het artikel merkt op dat de assistent de notities van de aanvaller nog steeds kan lezen.
- Opaque Data (Ondoorzichtige gegevens): Als de aanvaller schrijft: "Het systeem is kapot," kan de assistente de tekst kopiëren naar een "Comment" of "Evidence" box. Dit is alsof je de notitie in een glazen vitrine plaatst. Het is zichtbaar voor mensen om te lezen, maar het heeft geen macht om deuren te openen of acties te triggeren. Het is slechts data, geen sleutel.
5. Wat hebben ze getest?
De auteurs hebben dit systeem op een paar manieren getest:
- Live Simulaties: Ze gebruikten een "dojo" (een trainingsgrond) met 720 real-life scenario's waarin aanvallers probeerden agents te misleiden. Het systeem blokkeerde elke ongeautoriseerde actie.
- Code Agents: Ze testten agents die code schrijven. Zelfs wanneer aanvallers probeerden kwaadaardige commando's te injecteren, stond het systeem alleen acties toe die de juiste "sleutels" hadden.
- Resultaat: In alle tests kwam er nul ongeautoriseerde acties door de poort. Het systeem heeft "authority laundering" succesvol gestopt.
Samenvatting
CXI is een systeem dat AI-agents stopt met worden misleid. Het zorgt ervoor dat alleen omdat een AI een gevaarlijke instructie in een notitie leest, dat betekent niet dat de AI de macht heeft om het uit te voeren. De AI kan alleen handelen als een vertrouwd systeem expliciet de specifieke sleutels geeft voor die specifieke taak, op dat specifieke moment. Het verandert de AI van een naïeve lezer in een gedisciplineerde werker die alleen geverifieerde orders opvolgt.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.