← Nieuwste papers
🤖 AI

Benchmarking Security Risk Detection and Verification in Open Agentic Skill Ecosystems

Dit artikel introduceert SkillVetBench, een tweestaps beveiligingsbenchmark voor open agentische skill-ecosystemen die semantische analyse van skill-specificaties combineert met runtime-executie in een geïnstrumenteerde sandbox om effectief kwaadaardige gedragingen te detecteren en te verifiëren die statische methoden missen.

Oorspronkelijke auteurs: Ismail Hossain, Sai Puppala, Zhuoran Lu, Sajedul Talukder, Nan Jiang

Gepubliceerd 2026-06-02
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Ismail Hossain, Sai Puppala, Zhuoran Lu, Sajedul Talukder, Nan Jiang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een wereld voor waarin je persoonlijke AI-assistent niet slechts één robot is, maar een Zwitsers zakmes dat door iedereen in de gemeenschap kan worden geüpgraded. Je kunt nieuwe "vaardigheden" downloaden (zoals een nieuw mesje of een schroevendraaier) om je AI te helpen dingen te doen zoals je banksaldo controleren, code schrijven of vluchten boeken. Dit is de wereld van Open Agentic Skill Ecosystems.

Het probleem? Net als een echt Zwitsers zakmes, als een kwaadwillig persoon een verborgen mesje verstopt in een "onschuldig ogende" schroevendraaier, merk je het misschien pas op als het je snijdt. Dit wordt een supply-chain attack genoemd.

Het artikel introduceert SkillVetBench, een nieuw systeem voor het testen van beveiliging dat ontworpen is om deze verborgen gevaren te vangen voordat ze je pijn doen. Hier is hoe het werkt, eenvoudig uitgelegd:

Het Probleen: De vaardigheid die "te mooi om waar te zijn" is

Stel je voor dat je een vaardigheid downloadt genaamd "Weather Checker". Het ziet er onschadelijk uit. Er staat: "Ik zal je vertellen wat het weer is."

  • De valstrik: De instructies (de tekst) zeggen het één, maar de verborgen code doet iets anders. Misschien steelt het stiekem je wachtwoorden of installeert het een virus.
  • De oude manier: Eerdere beveiligingsinstrumenten waren als spellcheckers. Ze keken alleen naar de tekst of de codestructuur. Als de code er schoon uitzag maar de intentie kwaadaardig was (verborgen in de instructies), miste de spellchecker dit. Ze konden ook niet zien wat de vaardigheid daadwerkelijk deed wanneer deze werd uitgevoerd.

De Oplossing: SkillVetBench (De Tweestaps-detective)

De auteurs hebben een beveiligingscontrole met twee stappen gebouwd, zoals een uitsmijter en een agent die samenwerken.

Fase 1: De "Slimme Lezer" (Semantische Analyse)

Eerst gebruikt het systeem een superintelligente AI (een LLM) om het "cv" van de vaardigheid te lezen (de beschrijving in natuurlijke taal en de instructies).

  • Wat het doet: Het zoekt niet alleen naar slechte woorden; het vraagt: "Wat beweert deze vaardigheid te doen? Komt het verhaal overeen met de acties?"
  • De analogie: Stel je een sollicitatiegesprek voor. Een kandidaat zegt: "Ik ben een bakker." Maar de Slimme Lezer merkt op dat de kandidaat een koksmuts draagt, een geweer vasthoudt en praat over "explosief deeg". De lezer markeert dit als verdacht, zelfs als het cv er schoon uitziet.
  • Waarom het belangrijk is: Het vangt dreigingen op die verborgen zitten in de instructies (zoals Prompt Injection), waar oude tools volledig overheen keken.

Fase 2: De "Veilige Sandbox" (Runtime Verificatie)

Als de Slimme Lezer argwaan krijgt, wordt de vaardigheid verplaatst naar een Sandbox.

  • Wat het doet: Dit is een virtuele, geïsoleerde ruimte (een digitale speeltuin) waar de vaardigheid gedwongen wordt te draaien. Het systeem houdt elke beweging in de gaten: Probeert het een bestand te openen? Probeert het een telefoongesprek te plegen? Probeert het andere software te installeren?
  • De analogie: Het is alsof je een verdachte in een verhoorkamer met glazen wanden plaatst. Je kijkt toe hoe ze proberen een slot te kraken. Als ze daadwerkelijk het slot kraken, heb je bewijs dat ze een dief zijn. Als ze alleen maar praatten over het kraken van een slot maar het nooit echt deden, weet je dat ze alleen maar blufden.
  • Het resultaat: Dit verandelt een "misschien is het slecht" vermoeden in een "we hebben het op heterdaad betrapt" oordeel.

Wat ze ontdekten (De "Aha!" momenten)

De onderzoekers hebben dit systeem getest tegen echte kwaadaardige vaardigheden die in het wild zijn gevonden (inclusief een recente aanvalscampagne genaamd "ClawHavoc"). Hier is wat zij ontdekten:

  1. Oude tools waren blind: De oude beveiligingsscanners misten tot wel 89% van de slechte vaardigheden. Ze waren als beveiligers die naar het identiteitsbewijs van een persoon keken, maar negeerden dat de persoon een bom vasthield.
  2. De "High-Permission" tools zijn de gevarenzone: Het artikel vond dat de meeste aanvallen plaatsvonden wanneer vaardigheden specifieke, krachtige tools gebruikten.
    • Analogie: Een kind een sleutel van de voordeur geven is prima. Een kind de sleutel van de bankkluis (exec), de mogelijkheid om het huis te slopen (write_file), of de mogelijkheid om een eigen beveiligingsbeambte in te huren (spawn) geven, is gevaarlijk. De studie liet zien dat aanvallen zich zwaar concentreren op deze "super-tools".
  3. Instructies zijn de zwakke schakel: Veel slechte vaardigheden hadden geen slechte code; ze hadden slechte verhalen. Ze misleidden de AI met de gedachte: "Oh, ik moet dit wachtwoord stelen om mijn werk te doen." Het nieuwe systeem ving deze op omdat het het verhaal las, niet alleen de code.

De Kernboodschap

SkillVetBench is een nieuwe standaard voor het controleren van AI-vaardigheden. Het combineert het lezen van de instructies (om verborgen trucs te vangen) met het observeren van de actie (om daadwerkelijke misdaden te vangen).

Het artikel concludeert dat om AI veilig te houden, we niet meer alleen naar de code kunnen kijken. We moeten kijken naar wat de AI daadwerkelijk doet wanneer deze draait, omdat het echte gevaar vaak schuilgaat in de kloof tussen wat een vaardigheid zegt te doen en wat het daadwerkelijk doet.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →