← Nieuwste papers
💻 computer science

SkillJack: Persistent Skill Backdoors in Self-Evolving Agents

Dit artikel introduceert SkillJack, een nieuwe aanval die de ervaring-naar-vaardigheid-pipeline van zelfevoluerende agenten exploiteert om vergiftigde interacties te transformeren in persistente, ondetecteerbare kwaadaardige gedragingen die de verwijdering van bronrecords overleven en veiligheidsfilters omzeilen.

Oorspronkelijke auteurs: Zonghao Ying, Xiangfan Wu, Huiyu Wu, Xing Zheng, Huangsheng Cheng, Xiaorong Shi, Jing Guo

Gepubliceerd 2026-08-05
📖 3 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Zonghao Ying, Xiangfan Wu, Huiyu Wu, Xing Zheng, Huangsheng Cheng, Xiaorong Shi, Jing Guo

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een wereld voor waarin je digitale helpers niet slechts statische hulpmiddelen zijn die precies doen wat je hen vertelt, maar nieuwsgierige metgezellen die daadwerkelijk leren van elk gesprek. Dit is de opwindende grens van "zelf-evoluerende agenten". Denk aan hen als een videogame-personage dat niet simpelweg reset na elk level; in plaats daarvan houdt het een dagboek bij, ontdekt wat werkte en verandert die lessen in permanente "vaardigheden" die het voor altijd kan gebruiken. Als je het leert hoe je een cake moet bakken, onthoudt het niet alleen het recept voor vandaag; het schrijft een nieuwe vaardigheid genaamd "Bakken" in zijn brein om het morgen te gebruiken. Dit klinkt geweldig omdat dit betekent dat deze agenten slimmer kunnen worden zonder dat er een mens nodig is om ze constant te herprogrammeren. Maar, net als in het echte leven, als een kwaadwillende actor een student probeert te misleiden om een gevaarlijke truc te leren, wordt die truc onderdeel van hun permanente vaardighedenset. De grote vraag die onderzoekers stellen is: wat gebeurt er als iemand een giftige les in het dagboek van een agent smokkelt? Vergeet de agent het later gewoon, of verandert hij die gifstof per ongeluk in een superkrachtig, permanent wapen?

Dit is precies wat een team onderzoekers van Tencent Zhuque Lab, onder leiding van Zonghao Ying, ter studie nam in hun paper, "SkillJack." Ze ontdekten een sluwe nieuwe manier om deze lerende agenten te hacken die veel gevaarlijker is dan eerdere methoden. In plaats van alleen een slecht bericht in het geheugen van de agent te verbergen om één keer gelezen te worden, lieten zij zien hoe een aanvaller de leerprocedure van de agent zelf kan misleiden. Stel je een vervalser voor die niet alleen een valse brief schrijft, maar de agent ervan overtuigt om die valse brief te herschrijven naar een glimmende, officieel uitziende "Skill Card" die wordt opgeborgen in de permanente bibliotheek van de agent. Zodra die kaart is gemaakt, gebruikt de agent deze automatisch voor toekomstige taken, en kan de oorspronkelijke valse brief worden verwijderd zonder de gevaarlijke vaardigheid ooit te verwijderen.

De onderzoekers noemen deze aanval "SkillJack." Ze testten het op twee verschillende systemen die ontworpen zijn om ervaringen om te zetten in vaardigheden, en de resultaten waren verbijsterend. Ze ontdekten dat het proces van het omzetten van een rommelig, verdacht gesprek naar een schone, herbruikbare vaardigheid feitelijk fungeert als een "witwasmachine". In hun tests markeerde een veiligheidscontroleur 98,5% van de oorspronkelijke slechte gesprekken als gevaarlijk. Maar nadat de agent die gesprekken had omgezet in vaardigheden, ving de veiligheidscontroleur slechts 11,4% van hen op. De slechte intentie was verborgen binnen de beschrijving van de nieuwe vaardigheid, waardoor het onschuldig leek.

Nog erger is dat deze "vergiftigde vaardigheden" ongelooflijk duurzaam zijn. De onderzoekers ontdekten dat zelfs nadat ze de oorspronkelijke slechte verslagen uit het geheugen van de agent hadden verwijderd, 80,0% van de aanvallen nog steeds plaatsvond omdat de permanente vaardighedskaart nog steeds aanwezig was. De agent bleef de slechte vaardigheid op nieuwe taken toepassen, met een succespercentage van 56,2% op het ene systeem en 89,2% op het andere. De studie suggereert dat dit niet slechts een glitch is in één specifiek programma; het is een fundamenteel risico in de manier waarop deze zelflerende agenten werken. Het paper concludeert dat we niet langer alleen de "broncode" van een slecht idee kunnen opschonen; we moeten elke enkele vaardigheid volgen die er ooit van is geleerd, anders blijft het gevaar verborgen in het volle zicht, klaar om keer op keer opnieuw te worden gebruikt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →