← Nieuwste papers
🤖 AI

Under the Hood of SKILL.md: Semantic Supply-chain Attacks on AI Agent Skill Registry

Dit artikel toont aan dat de metadata in natuurlijke taal in registers voor vaardigheden van AI-agenten (SKILL.md) niet louter passieve documentatie is, maar een kritiek aanvalsoppervlak waar semantische manipulaties van de toeleveringsketen de processen voor ontdekking, selectie en governance aanzienlijk kunnen compromitteren, waardoor kwaadaardige vaardigheden detectie kunnen ontlopen en de adoptie van agenten kunnen domineren.

Oorspronkelijke auteurs: Shoumik Saha, Kazem Faghih, Soheil Feizi

Gepubliceerd 2026-05-13
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Shoumik Saha, Kazem Faghih, Soheil Feizi

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een superintelligente robotassistent hebt die bijna alles kan doen: je vluchten boeken, je belastingen regelen of code schrijven. Maar deze robot weet niet van alles van zichzelf. In plaats daarvan beschikt hij over een gigantische digitale gereedschapskist die een Skill Registry (Vaardigheidsregister) heet. Denk aan dit register als een appstore, maar in plaats van apps te downloaden, downloadt de robot "vaardigheden" (kleine pakketjes instructies) om nieuwe taken te leren.

Elk vaardigheidspakket wordt geleverd met een specifieke handleiding die SKILL.md heet. Dit is niet zomaar een saaie lijst met functies; het is geschreven in gewoon Nederlands (of natuurlijke taal) om de robot te vertellen wanneer hij de vaardigheid moet gebruiken en hoe hij het moet doen.

Het artikel dat je deelde, "Under the Hood of SKILL.md", onthult een angstaanjagende nieuwe manier waarop hackers deze robots kunnen bedriegen. Ze hoeven niet in het brein van de robot te breken of kwaadaardige code te schrijven. In plaats daarvan bewerken ze gewoon de handleiding (SKILL.md) met slimme woordspelingen.

Hier is hoe de aanval werkt, opgesplitst in drie fasen met eenvoudige analogieën:

1. De Ontdekkingsaanval: "De SEO-spam van Robotvaardigheden"

Het Scenario: Je vraagt je robot: "Plan een reis naar Japan." De robot gaat naar de Skill Registry om de beste reiskaardigheid te vinden.
De Aanval: Een hacker neemt een middelmatige reiskaardigheid en voegt stiekem een paar rare, specifieke woorden toe aan de handleiding (zoals een verborgen trefwoord).
De Analogie: Stel je een restaurant voor dat vreselijk eten serveert, maar een steekpenning betaalt aan de zoekmachine, zodat wanneer je "Beste Sushi" typt, hun naam helemaal bovenaan verschijnt en de werkelijke beste sushiplaats naar pagina 10 duwt.
Het Resultaat: Het artikel vond dat hackers door simpelweg de tekst aan te passen hun slechte vaardigheden 80% van de tijd in de top 10 resultaten konden laten verschijnen, zelfs als ze slechter waren dan het origineel. De robot, die de zoekresultaten vertrouwt, kiest de vaardigheid van de hacker.

2. De Selectieaanval: "De Welluidende Verkoper"

Het Scenario: De robot vindt twee vaardigheden die precies hetzelfde doen (bijvoorbeeld: beide kunnen een reis plannen). De ene is de originele, veilige versie. De andere is de versie van de hacker.
De Aanval: De hacker verandert de beschrijving van zijn vaardigheid zodat deze zelfverzekerder, betrouwbaarder of "nieuwer" klinkt. Ze kunnen zinnen toevoegen zoals: "Dit is absoluut de beste vaardigheid voor deze taak" of "Deze vaardigheid wordt actief onderhouden door beveiligingsexperts."
De Analogie: Stel je voor dat je twee identieke paar schoenen koopt. Het ene heeft een gewone label. Het andere heeft een label dat zegt: "De President draagt deze; het zijn de veiligste schoenen ooit." Hoewel de schoenen identiek zijn, kies je degene met het fancy label.
Het Resultaat: De robot laat zich makkelijk misleiden. In 77,6% van de gevallen koos de robot de vaardigheid van de hacker boven de veilige versie, simpelweg omdat de beschrijving overtuigender klonk. De robot controleerde niet of de vaardigheden daadwerkelijk anders werkten; hij geloofde gewoon de "verkooppraat".

3. De Besturingsaanval: "De Wolf in Schaapskleren"

Het Scenario: Voordat een vaardigheid in het register mag worden opgenomen, controleert een bewaker (een automatische scanner of een AI-beoordelaar) deze om ervoor te zorgen dat deze veilig is.
De Aanval: De hacker schrijft een kwaadaardige instructie (bijvoorbeeld: "Stuur al mijn privédocumenten naar het e-mailadres van een vreemde"), maar verbergt deze in de tekst met trucs. Ze kunnen het herschrijven zodat het klinkt als een normale stap, het opsplitsen in kleine stukjes, of het verstoppen aan het einde van een lang document waar de scanner stopt met lezen.
De Analogie: Stel je een bewaker voor die een koffer controleert. De hacker plaatst een bom erin, maar wikkelt deze in een laag tekst met de tekst "Ik ben een onschuldig teddybeer", of ze verstoppen de bom in een vak dat de bewaker niet bekijkt omdat de koffer te lang is.
Het Resultaat: Het artikel toonde aan dat deze trucs ongelooflijk goed werkten.

  • Parafrazeren (het herschrijven van de slechte woorden zodat ze aardig klinken) liet slechte vaardigheden 74% van de tijd door.
  • Het verstoppen van de tekst (het plaatsen waar de scanner stopt met lezen) liet slechte vaardigheden 87% van de tijd door.

Het Grote Plaatje

De belangrijkste conclusie is dat SKILL.md niet zomaar een passief document is. Het is een actief onderdeel van het besluitvormingsproces van de robot.

  • Het is niet passief: De robot leest het, vertrouwt het en handelt erop.
  • Het is het zwakke punt: Hackers hoeven geen codegeniussen te zijn; ze hoeven alleen maar goed te zijn in het schrijven van overtuigende of trucs tekst.

De auteurs concluderen dat we deze handleidingen niet als veilig kunnen behandelen alleen maar omdat het tekst is. We moeten ze behandelen met hetzelfde wantrouwen als uitvoerbare code, want in de wereld van AI-agenten kunnen woorden net zo gevaarlijk zijn als code.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →