← Nieuwste papers
💻 computer science

Agent Skill Security: Threat Models, Attacks, Defenses, and Evaluation

Dit artikel introduceert SkillSec-Eval, een uitgebreid framework dat beveiligingskwetsbaarheden identificeert en evalueert gedurende de gehele levenscyclus van herbruikbare Large Language Model-agentvaardigheden, waarmee wordt aangetoond dat risico's aanzienlijk verder reiken dan traditionele zorgen over runtime-executie.

Oorspronkelijke auteurs: Sanket Badhe, Priyanka Tiwari

Gepubliceerd 2026-07-16
📖 7 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Sanket Badhe, Priyanka Tiwari

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een wereld voor waarin je computer niet alleen bevelen opvolgt, maar ook echt dingen voor je gaat doen. Dit is het domein van AI-agenten: slimme programma's die stappen kunnen plannen, hulpmiddelen zoals een webbrowser of een bestandssysteem kunnen gebruiken en complexe problemen zelfstandig kunnen oplossen. Om deze agenten superkrachtig te maken, zijn ontwikkelaars begonnen hen te bouwen uit "vaardigheden" (skills). Denk aan deze vaardigheden als LEGO-stenen of kant-en-klare recepten. In plaats van de AI elke keer opnieuw te leren hoe je een taart bakt, geef je het een "Bakvaardigheid" die het wanneer nodig van een digitale plank kan pakken en kan gebruiken. Deze vaardigheden zijn herbruikbaar, wat betekent dat één vaardigheid gedeeld kan worden door duizenden verschillende AI-agenten.

Maar hier zit de crux: net zoals een fysieke bibliotheek gevuld kan zijn met boeken die ermee zijn geknoeid, kan een digitale bibliotheek van AI-vaardigheden gevaarlijk zijn. Als een kwaadwillende actor een "vergiftigde" vaardigheid in de bibliotheek smokkelt, kan de AI deze oppakken, denken dat het veilig is omdat de voorkant er goed uitziet, en vervolgens per ongels je bestanden verwijderen of je wachtwoorden stelen. Lange tijd maakten wetenschappers zich alleen zorgen over hoe de AI werd misleid door de woorden die je ertegen typte (zoals een spreuk die misgaat). Maar dit nieuwe onderzoek suggereert dat het echte gevaar niet alleen is wat je tegen de AI zegt, maar wat de AI oppikt uit de wereld om zich heen.


Het Papier: "Agent Skill Security"

Dit papier, getiteld "Agent Skill Security: Threat Models, Attacks, Defenses, and Evaluation," door Sanket Badhe en Priyanka Tiwari, is als een detectiveverhaal over hoe deze digitale LEGO-stenen gehackt kunnen worden. De auteurs realiseerden zich dat terwijl iedereen naar de mond van de AI keek (wat hij zegt), ze de handen van de AI negeerden (wat hij oppikt en doet). Ze bouwden een nieuw testframework genaamd SkillSec-Eval om de gehele levensloop van een vaardigheid te onderzoeken, van het moment dat deze wordt gecreëerd tot het moment dat deze jaren later wordt bijgewerkt.

De Zes Fasen van het Leven van een Vaardigheid

De auteurs breken het leven van een vaardigheid af in zes afzonderlijke fasen, zoals een estafette waarbij het stokje wordt doorgegeven aan de volgende renner. Als het stokje op enig punt wordt verwisseld voor een nepversie, is de hele race verpest.

  1. Authoring (De Creatie): Dit is wanneer een ontwikkelaar de vaardigheid schrijft. Het gevaar hier is dat de maker sluw kan zijn en schadelijke instructies verbergt in een vaardigheid die aan de oppervlakte nuttig lijkt.
  2. Storage (De Bibliotheek): Eenmaal geschreven, gaat de vaardigheid in een digitaal depot (een bibliotheek). Aanvallers kunnen hier binnensluipen, een veilige vaardigheid vervangen door een slechte, of de bibliotheek foppen om een oude, veilige versie van een vaardigheid te accepteren als een nieuwe, valse versie.
  3. Retrieval (De Zoekopdracht): Wanneer een AI iets moet doen, zoekt hij in de bibliotheek. Aanvallers kunnen hun slechte vaardigheden "volproppen" met populaire trefwoorden zodat de zoekmachine denkt dat zij de meest relevante resultaten zijn, waardoor ze naar de bovenkant van de lijst worden geduwd.
  4. Selection (De Keuze): De "hersenen" van de AI (de planner) bekijkt de top zoekresultaten en kiest er één. Aanvallers kunnen valse recensies of misleidende beschrijvingen schrijven om de AI te misleiden om de slechte vaardigheid te kiezen boven een goede.
  5. Execution (De Actie): De AI voert de vaardigheid daadwerkelijk uit. Zelfs als de vaardigheid correct is gekozen, kan deze proberen iets te doen waar hij niet toe gemachtigd is, zoals een deur openen die hij niet mag openen.
  6. Evolution (De Update): Vaardigheden worden in de loop van de tijd bijgewerkt. Een aanvaller kan wachten tot een vaandigheid vertrouwd en populair is, en dan een virus insluipen in een "versie 2.0" update.

De Grote Ontdekking: Het Is Niet Slechts Eén Ding

De onderzoekers testten 327 echte vaardigheden en ontdekten dat kwetsbaarheden bestaan in elke fase. Ze vonden niet slechts één type hack; ze vonden een heel ecosysteem van hacks.

  • De Bibliotheek is Lek: Ze ontdekten dat eenvoudige regels (zoals controleren of een bestand een geldige handtekening heeft) niet genoeg zijn. Slechtwillende actoren kunnen vaardigheden creëren die op papier perfect lijken, maar verborgen kwaadaardige instructies bevatten. Wanneer ze een slimme AI gebruikten om de betekenis van de code te controleren, vingen ze veel meer slechte vaardigheden, maar zelfs dan glipten er enkele doorheen.
  • De Zoekopdracht is Gemanipuleerd: In hun tests gebruikten aanvallers "Keyword Stuffing" (het toevoegen van enorme hoeveelheden populaire woorden aan een slechte vaardigheid) en "Sybil Attacks" (het creëren van 15 valse kopieën van dezelfde slechte vaardigheid). Zonder een speciale filter domineerden deze slechte vaardigheden de zoekresultaten. In één test verscheen bijvoorbeeld 93,20% van de tijd een slechte vaardigheid in de top 5 resultaten wanneer er geen verdediging werd gebruikt. Met hun nieuwe verdediging brachten ze dat getal omlaag, maar het was niet perfect.
  • De AI is Makkelijk te Foppen: Wanneer de AI een vaardigheid moest kiezen op basis van een beschrijving, werd hij gemakkelijk misleid door valse "Officiële" badges of misleidende tekst. In één test koos de AI 45,64% van de tijd een slechte vaardigheid, simpelweg omdat er een valse aanbeveling aan vastzat.
  • De Actie is Gevaarlijk: Zodra een slechte vaardigheid draait, kan deze proberen gegevens te stelen. De onderzoekers ontdekten dat zonder een runtime-bewaker (guard), 100% van hun testaanvallen hun doel bereikten. Echter, zelfs met een bewaker vonden ze een verraderlijk lek: als de AI de gestolen gegevens in zijn eigen woorden herschrijft (parafraseren) voordat hij ze verzendt, mist de bewaker het soms.

De Cijfers Vertellen het Verhaal

Het papier biedt harde cijfers om aan te tonen hoe moeilijk dit probleem is:

  • Repository Admission: Wanneer ze eenvoudige regels combineerden met slimme AI-controle, verminderden ze het aantal slechte vaardigheden dat de bibliotheek binnenkwam tot 7,9%. Echter, dit weigerde ook per ongeluk 20,0% van de goede vaardigheden, wat laat zien dat te strikt zijn het werk voor echte ontwikkelaars bemoeilijkt.
  • Retrieval: Voor "Sybil Attacks" (valse klonen) daalde het aantal slechte vaardigheden in de topresultaten van een gemiddelde van 2,84 naar 0,27 met hun nieuwe verdediging.
  • Planner Deception: Wanneer slechte vaardigheden valse aanbevelingen hadden, koos de AI ze 45,64% van de tijd. Met hun verdediging daalde dit naar 8,72%.
  • Runtime: Zelfs met een sterke runtime-monitor slaagden 23,0% van de aanvallen nog steeds omdat de AI erin slaagde de diefstal van gegevens te verbergen binnen zijn eigen denkproces.

Wat Ze Niet Weten (en Wat Ze Uitsluiten)

De auteurs zijn zeer duidelijk over wat ze niet hebben gevonden. Ze vonden geen "wondermiddel" dat alles oplost. Ze sluiten expliciet de gedachte uit dat het controleren van de codestructuur (zoals het zoeken naar een handtekening) voldoende is; je moet ook de betekenis begrijpen. Ze laten ook zien dat geen enkele verdediging alleen werkt. Als je alleen de bibliotheek beschermt, kan de hacker de zoekopdracht manipuleren. Als je alleen de zoekopdracht beschermt, kan de hacker de keuze van de AI manipuleren.

Ze geven ook toe dat hun studie beperkingen heeft. Ze testten een gecontroleerde omgeving met 327 vaardigheden, niet het hele internet. Ze hebben geen aanvallen getest die zich over vele jaren uitstrekken (langdurig vertrougensverlies) of aanvallen die proberen de hersenen van de AI direct te breken (jailbreaking). Ze suggereren dat hoewel hun framework een enorme stap voorwaarts is, het probleem van het veilig houden van deze digitale LEGO-stenen nog steeds een open uitdaging is.

De Kernboodschap

De belangrijkste les van dit papier is dat we niet alleen de mond van de AI kunnen bewaken; we moeten ook zijn handen, zijn bibliotheek en zijn updates in de gaten houden. Beveiliging is niet één enkel slot; het is een hele keten van bewakers. De auteurs bouwden SkillSec-Eval om ons te helpen deze bewakers te testen, en hun resultaten suggereren dat hoewel we zaken veel veiliger kunnen maken, we voorzichtig moeten zijn dat we het systeem niet zo strikt maken dat het niet meer voor iedereen werkt. De weg naar veilige AI-agenten gaat niet over het vinden van één perfect schild, maar over het bouwen van een gelaagde verdediging die elke stap van de reis bewaakt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →