← Nieuwste papers
🤖 AI

What Keeps Agent Skills from Being Reusable? Evidence from 138K SKILL.md Files

Een analyse van 138.133 openbare SKILL.md-bestanden onthult dat meer dan 90% lijdt aan defecten die de herbruikbaarheid beperken—voornamelijk zwakke routing-metadata, opgeblazen inhoud en gebrekkige bronorganisatie—wat een kwaliteitsgegarandeerde workflow vereist die spec-bewuste prompting, geautomatiseerde linting en safety gating combineert om betrouwbare herbruikbaarheid van LLM-agent skills mogelijk te maken.

Oorspronkelijke auteurs: Chi Zhang, Yimin Liu, Xinze Chen, Ping Ji

Gepubliceerd 2026-08-11
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Chi Zhang, Yimin Liu, Xinze Chen, Ping Ji

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je net een super-slimme robotassistent hebt gebouwd. Je hebt hem geleerd om een miljoen dingen te doen, maar hij is nog steeds een beetje onhandig. Om hem te helpen, besluit je hem een bibliotheek van "referentiebladen" te geven: kleine digitale kaartjes die de robot precies vertellen hoe hij met specifieke situaties moet omgaan, zoals "hoe een kapotte link te repareren" of "hoe een rommelige inbox te organiseren". In de wereld van kunstmatige intelligentie worden deze referentiebladen Agent Skills genoemd. Het zijn speciale bestanden (meestal genaamd SKILL.md) die fungeren als mini-programma's, waardoor een robot in staat is om eerdere trucs te onthouden en deze in nieuwe gesprekken te gebruiken.

De grote hoop is dat zodra je een echt goed referentieblad hebt geschreven, je dit met miljoenen andere robots kunt delen, zodat zij allemaal direct beter worden in die specifieke taak. Het is als het delen van een perfect recept: je kookt één keer een gerecht, schrijft het op, en iedereen anders kan het net zo goed laten smaken zonder dat jij daarvoor hulp nodig hebt. Maar om dit te laten werken, moet het recept duidelijk, veilig en gemakkelijk te vinden zijn. Als het recept is geschreven in een geheime code, de ingrediëntenlijst mist, of de kok vertelt om "het huis af te branden", dan is het niet alleen nutteloos, maar ook gevaarlijk. Dit artikel stelt een eenvoudige maar cruciale vraag: Zijn de referentiebladen die mensen delen eigenlijk bruikbaar, of zijn ze grotendeels defect?

De Grote Skill-Speurtocht

De auteurs van dit artikel, een team van onderzoekers van universiteiten in New York en Ohio, besloten detective te spelen. Ze gingen op een enorme speurtocht over het internet, specifiek zoekend naar 138.133 publieke "referentiebladen" (SKILL.md-bestanden) die mensen hadden gedeeld in 20.556 verschillende digitale repositories. Denk hierbij aan het binnenlopen van een gigantische, chaotische bibliotheek waar iedereen een boek in de kast kan gooien, en vervolgens elk boek controleren om te zien of het wel een echt recept is of gewoon een stapel krabbels.

Ze keken niet alleen naar typefouten. Ze bouwden een tweeledige "kwaliteitsscanner" om te controleren op twee soorten problemen:

  1. De "Regelbrekers" (Niveau 1): Dit zijn skills die de officiële regels negeren. Misschien ontbreekt de titel, zijn de instructies te lang, of is de sectie "wanneer te gebruiken" leeg.
  2. De "Slechte Gewoontes" (Niveau 2): Dit zijn skills die de regels wel volgen, maar nog steeds slordig of gevaarlijk zijn. Misschien bevatten ze een "To-Do"-lijst, lekken ze geheime wachtwoorden, of vertellen ze de robot om een hulpmiddel te gebruiken dat alleen op een specifieke computer werkt.

De Schokkende Ontdekking: De Bibliotheek is een Bende

De resultaten waren een behoorlijke schok. De onderzoekers ontdekten dat 91,8% van de gecontroleerde skills minstens één defect vertoonde. Dat is alsof je een bibliotheek binnenloopt en ontdekt dat bijna elk boek in de kast een gescheurde pagina, een ontbrekend hoofdstuk of een briefje met "Niet lezen" heeft.

De meest voorkomende problemen waren niet van het soort exotische, hoogtechnologische hackingaanvallen. Ze waren eigenlijk vrij saai en menselijk:

  • Verwarrende Labels: Veel skills hadden geen duidelijke beschrijving van wanneer ze gebruikt moeten worden. Het is alsof je een kruidenpotje hebt met het label "Mysterieus Poeder" in plaats van "Kaneel". De robot kan het juiste skill niet vinden wanneer het nodig is.
  • Te Veel Fluff: Sommige skills waren opgeblazen met extra tekst, code of instructies die eigenlijk niets toevoegden. Het is alsof een recept drie paragrafen besteedt aan het uitleggen hoe je bloem koopt voordat het vertelt dat je het moet mengen.
  • Gevaarlijke Geheimen: Sommige skills bevatten per ongeluk echte wachtwoorden of instructies die bestanden kunnen verwijderen, wat vergelijkbaar is met een recept dat zegt: "voeg een snufje gif toe".

Waarom is dit belangrijk?

De onderzoekers voerden een stresstest uit om te zien of deze "defecte" skills daadwerkelijk problemen veroorzaakten. Ze simuleerden een robot die probeert een skill te vinden op basis van een eenvoudige beschrijving. Het resultaat? Robots waren veel beter in het vinden van de "schone" skills (die met goede labels) dan de "defecte" ones. Wanneer het label ontbrak of verwarrend was, gaf de robot vaak gewoon op en gebruikte de skill helemaal niet.

Dit suggereert dat zelfs als een skill zou kunnen werken, deze vaak nutteloos is omdat de robot hem niet kan vinden of niet weet hoe hij moet beginnen. De studie merkte ook op dat skills die gemarkeerd waren als door AI geschreven, de neiging hadden om meer problemen met veiligheid en draagbaarheid te hebben dan die door mensen geschreven waren, hoewel de auteurs voorzichtig zijn om te zeggen dat dit een patroon is dat ze observeerden, en geen regel dat AI altijd slechter is.

De Weg Vooruit: Een Betere Manier van Schrijven

Dus, wat is de oplossing? De auteurs stellen een "Quality-Assured Generation Workflow" voor. Stel je een productielijn voor voor deze referentiebladen:

  1. Schrijf met een Blauwdruk: Begin door de officiële regels strikt te volgen.
  2. De Snelle Scan: Voer een eenvoudige controle uit om voor de meest voor de hand liggende fouten te vangen (zoals ontbrekende titels of te veel tekst).
  3. Het Reparatiestation: Als een skill de scan niet doorstaat, gebruik dan een slim instrument om de makkelijke onderdelen automatisch te herstellen.
  4. De Veiligheidspoort: Voordat de skill wordt vrijgegeven, zorgt een laatste controle ervoor dat deze geen gevaarlijke geheimen of commando's bevat.

Het artikel concludeert dat hoewel de huidige bibliotheek van gedeelde skills een puinhoop is, dat niet hoeft te zijn. Door deze skills te behandelen als serieuze software-artefacten — door ze te controleren op veiligheid, duidelijkheid en herbruikbaarheid — kunnen we die chaotische bibliotheek veranderen in een betrouwbare gereedschapskist die robots daadwerkelijk helpt bij hun taken. De auteurs geven toe dat ze niet alles hebben opgelost (ze hebben niet elke skill in een echte robot getest), maar hun gegevens suggereren sterk dat het opschonen van de "labels" en de "veiligheid" van deze bestanden de eerste stap is om AI-agents echt nuttig te maken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →