ColluSkill: Adversarial Cross-Skill Composition for Evading Agent Skill Scanners
Dit artikel introduceert ColluSkill, een adversarieel framework dat bestaande skill-scanners omzeilt door kwaadaardige intenties te ontleden in onderling afhankelijke, lokaal onschuldige sub-payloads, en stelt ChainGuard voor, een contextbewust verdedigingsmechanisme dat deze cross-skill compositie-aanvallen effectief mitigeert door workflow-niveau risico's te analyseren.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je een wereld voor waarin je computer niet alleen bevelen opvolgt, maar ook een gereedschapskist met "vaardigheden" heeft die hij kan oppakken en gebruiken. Denk aan deze vaardigheden als Lego-blokjes of apps op je telefoon: een "Bestanden Zoeken"-blokje, een "E-mail Versturen"-blokje, of een "Document Lezen"-blokje. Deze worden Agent Skills genoemd, en ze laten slimme computerprogramma's (bekend als AI Agents) complexe taken uitvoeren door deze tools aan elkaar te klikken. Maar net als in het echte leven is niet elke tool in de kist veilig. Sommige kunnen verborgen vallen zijn die ontworpen zijn om je geheimen te stelen of je huiswerk te verwijderen. Om dit veilig te houden, hebben we Skill Scanners—digitale beveiligingsbewakers die elke nieuwe tool controleren voordat je hem in je gereedschapskist toelaat. Ze kijken naar de instructies en de code om te controleren of er niets sneaky binnenin verstopt zit. De grote vraag waar onderzoekers zich mee bezighouden is: wat gebeurt er als de slechteriken niet proberen één grote, overduidelijke val te verbergen, maar in plaats daarvan drie of vier kleine, onschuldig lijkende stukjes binnensluipen die pas gevaarlijk worden wanneer je ze aan elkaar klikt?
Dit is precies waar het papier ColluSkill onderzoek naar doet. De auteurs ontdekten een slimme manier om die beveiligingsbewakers te misleiden. Ze ontdekten dat huidige scanners werken als uitsmijters die elke persoon die een club binnenkomt één voor één controleren. Als een persoon er onschuldig uitziet op zichzelf, mag hij naar binnen. Maar de onderzoekers lieten zien dat je een gevaarlijk plan kunt opdelen in verschillende kleine, onschuldig lijkende delen. Individueel passeert elk deel de controle van de uitsmijter. Maar zodra ze allemaal binnen zijn en in de juiste volgorde samenwerken, klikken ze weer aan elkaar tot een gevaarlijke aanval. Het papier noemt dit ColluSkill, een framework dat een kwaadaardig plan opbreekt in een keten van "collerende" (samenwerkende) skills. Het gebruikt een slimme AI om te plannen hoe deze stukjes in elkaar passen en blijft ze vervolgens aanpassen totdat ze er volkomen veilig uitzien voor de scanner, ook al zijn ze klaar om problemen te veroorzaken zodra ze aan de slag gaan.
Om terug te vechten, introduceert het papier een nieuwe verdediger genaamd ChainGuard. In plaats van alleen de nieuwe tool in isolatie te controleren, kijkt ChainGuard naar het grotere plaatje: "Welke tools zitten er al in de gereedschapskist? Hoe verbindt deze nieuwe tool zich met de rest?" Het is als een beveiligingsbewaker die niet alleen je ID controleert, maar ook vraagt: "Met wie ben je af te spreken, en wat zijn jullie van plan samen te doen?" De onderzoekers testten hun ideeën op zes verschillende beveiligingsscanners en ontdekten dat hun truc ongelooflijk goed werkte. De ColluSkill-aanval slaagde er gemiddeld 96,0% van de tijd in om langs de scanners te glippen, terwijl de oude methoden slechts ongeveer 37,8% van de tijd door kwamen. Echter, toen ze ChainGuard gebruikten, daalde het succespercentage van de aanval drastisch naar 22,5%, terwijl er nog steeds 99,5% van de goede, onschadelijke tools doorheen mocht.
Het Verhaal van de Sluwe Lego-set
Laten we dieper inzien hoe dit allemaal werkt, met behulp van een verhaal over een heel specifiek soort overval.
Het Probleem: De "Te Slimme" Beveiligingsbewaker
Stel je voor dat je probeert een verboden "Data Exfiltratie Script" (een programma dat je geheimen steelt) een beveiligd gebouw binnen te smokkelen. De beveiligingsbewaker bij de deur heeft een scanner. Als je met een grote, rode doos brengt waarop staat "GESTOLEN DATA", schreeuwt de scanner: "GEBLOCKT!" en houdt je tegen.
De onderzoekers ontdekten dat huidige beveiligingsscanners precies zo werken als deze bewaker. Ze kijken naar één skill tegelijk. Ze controleren de instructies, de rechten en de code. Als een enkele skill er veilig uitziet, krijgt deze een "Pass". Het probleem is dat deze bewakers niet naar het hele team kijken. Ze realiseren zich niet dat als je drie verschillende mensen binnenbrengt, die elk een klein, onschuldig stukje van een puzzel dragen, die drie mensen samen de verboden puzzel kunnen assembleren zodra ze binnen zijn.
De Aanval: ColluSkill (De Meester van Vermomming)
De auteurs creëerden een methode genaamd ColluSkill om dit blinde vlek exploiteren. Zie het als een meesterdief die besluit niet één grote bom mee te nemen, maar drie aparte, onschuldig lijkende items:
- Skill A (De Verkenner): "Ik wil alleen maar even naar de bestanden in de kamer kijken." (Ziet er onschadelijk uit).
- Skill B (De Schrijver): "Ik wil alleen maar opschrijven wat ik zie." (Ziet er onschadelijk uit).
- Skill C (De Boodschapper): "Ik wil alleen maar een bericht naar buiten sturen." (Ziet er onschadelijk uit).
Individueel controleert de beveiligingsscanner elk onderdeel en zegt: "Natuurlijk, dat is prima." Maar hier zit de truc: ColluSkill gebruikt een slimme AI om precies te plannen hoe deze drie verbinding maken.
- Skill A vindt een geheim bestand.
- Skill A geeft dat bestand door aan Skill B.
- Skill B schrijft de inhoud van het bestand in een bericht.
- Skill B geeft dat bericht door aan Skill C.
- Skill C stuurt het bericht naar buiten.
De magie van ColluSkill zit in twee stappen:
- Ketens Planning (Chain Planning): De AI bepaalt de perfecte volgorde zodat het "gevaar" verspreid wordt. Geen enkele skill doet op zichzelf iets slechts; ze geven alleen dingen door.
- Scanner Feedback: De AI probeert de skills binnen te smokkelen. Als de scanner er één markeert (bijv. "Skill C ziet er een beetje verdacht uit"), herschrijft de AI deze om er onschuldiger uit te zien en probeert het opnieuw. De AI blijft dit doen totdat elk onderdeel de controle passeert.
In hun tests was deze methode angstaanjagend effectief. Toen ze probeerden deze ketens langs zes verschillende real-world scanners te smokkelen, slaagde ColluSkill in 96,0% van de gevallen. Vergelijk dat met oudere methoden die simpelweg de slechte code opdeelden zonder deze slimme planning, die slechts ongeveer 36,7% van de tijd slaagden. De onderzoekers ontdekten dat het simpelweg opdelen van de code niet genoeg was; de planning en het herschrijven waren wat het verschil maakte.
De Verdediging: ChainGuard (De Detective)
Dus, hoe stoppen we dit? Het papier stelt ChainGuard voor. In plaats van een bewaker die mensen één voor één controleert, is ChainGuard een detective die naar de hele groep kijkt.
Wanneer een nieuwe skill binnen wil komen, vraagt ChainGuard: "Wie zijn er al in de kamer? Wat zijn zij aan het doen?"
- Als Skill C (De Boodschapper) probeert binnen te komen, kijkt ChainGuard naar de geïnstalleerde skills en ziet dat Skill A (De Verkenner) en Skill B (De Schrijver) al aanwezig zijn.
- Het realiseert zich: "Wacht eens even. Als A geheimen vindt, B ze opschrijft en C ze verstuurt, dan is dat een diefstal-keten!"
- Hoewel C op zichzelf onschuldig lijkt, blokkeert ChainGuard het vanwege wat het zou kunnen doen met de anderen.
De resultaten waren indrukwekkend. Toen de onderzoekers ChainGuard gebruikten, daalde het succespercentage van de ColluSkill-aanval van 96,0% naar 22,5%. Cruciaal is dat ChainGuard niet alles blokkeerde; het liet nog steeds 99,5% van de goede, onschadelijke workflows door. Het leerde het verschil te zien tussen een team van vrienden die een huis bouwen en een team van dieven die een overval plannen.
Werkt het echt in de echte wereld?
De onderzoekers stopten niet bij de beveiligingsscanner. Ze testten of deze sluwe ketens daadwerkelijk konden draaien op echte AI-coderingstools zoals OpenCode, Claude Code en Codex. Ze ontdekten dat de ketens perfect werkten. Op OpenCode werden de aanvalsketens in 89,5% van de gevallen succesvol geactiveerd (met GPT-5.5). Dit bewijst dat de dreiging niet alleen theoretisch is; als een kwaadwillende deze methode gebruikt, zouden ze deze aanvallen daadwerkelijk op echte computers kunnen uitvoeren.
De Conclusie
Het papier concludeert dat we met een nieuw soort beveiligingsprobleem te maken hebben. We kunnen niet alleen controleren of een enkele tool veilig is; we moeten controleren of een groep tools veilig is wanneer ze samenwerken. De ColluSkill-aanval laat zien dat het opdelen van een slecht plan in kleine, onschuldige stukjes een zeer krachtige manier is om huidige verdedigingen te omzeilen. Maar het goede nieuws is dat ChainGuard een weg vooruit laat zien: als we beginnen te kijken naar hoe tools verbinding maken en interageren, kunnen we deze sluwe ketens stoppen voordat ze schade aanrichten. De onderzoekers suggereren dat de toekomst van AI-veiligheid niet alleen gaat over betere scanners, maar over slimmere, context-bewuste bewakers die het hele verhaal begrijpen, en niet alleen de individuele hoofdstukken.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.