MalSkillBench: A Runtime-Verified Benchmark of Malicious Agent Skills
Dit artikel introduceert MalSkillBench, de eerste tijdens runtime geverifieerde benchmark bestaande uit 3.944 kwaadaardige AI-agentvaardigheden, om aan te tonen dat huidige detectietools falen in het gezamenlijk analyseren van code en instructies, wat een nieuwe aanpak noodzakelijk maakt die redeneert over taakintentie, code en prompts om de agenten-toeleveringsketen te beveiligen.
Oorspronkelijk artikel vrijgegeven aan het publieke domein onder CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een superintelligente robotassistent hebt ingehuurd om je te helpen bij het schrijven van software. Om deze robot nog krachtiger te maken, laat je hem "vaardigheden" (skills) van het internet downloaden—zoals kleine apps of plugins die hem vertellen hoe hij specifieke taken moet uitvoeren, zoals "belasting berekenen" of "dit document opmaken."
Deze vaardigheden zijn een beetje als een receptenkaart (instructies geschreven in gewone mensentaal) die vastgeplakt zit aan een keukenapparaat (de werkelijke code die wordt uitgevoerd).
Het Probleem: Het "Vergiftigde Recept"
Onderzoekers hebben ontdekt dat hackers deze vaardigheden beginnen te vergiftigen. Ze maken valse vaardigheden die nuttig lijken, maar verborgen vallen bevatten.
- De Code-val: Het "keukenapparaat"-gedeelte kan stiekem je wachtwoorden stelen of je bestanden verwijderen.
- De Instructie-val: Het "receptenkaart"-gedeelte kan de robot erin luizen om zijn veiligheidsregels te negeren of iets te doen wat hij niet zou moeten doen, zoals je privégegevens naar een vreemde sturen.
Het enge is dat deze twee vallen vaak samenwerken. Een vaardigheid kan onschuldig lijken op de receptenkaart, maar een gevaarlijke machine aan de andere kant hebben, of andersom.
De Grote Kloof: We hadden geen goede test
Tot nu toe vlogen experts die proberen "vaardigheidsdetectoren" te bouwen (zoals antivirussoftware voor deze robotvaardigheden) blind rond.
- Ze hadden geen grote genoeg lijst met slechte vaardigheden om tegen te testen.
- De weinige slechte vaardigheden die ze hadden, waren vooral van één type (zoals valse "crypto"-scams), waardoor detectoren heel goed werden in het opsporen van die specifieke zaken, maar heel slecht in het opsporen van alles wat daarvan afweek.
- Het was alsof je een brandmelder test op de rook van een verbrande toast, en dan beweert dat hij ook een brand door een vetexplosie zal detecteren.
De Oplossing: MalSkillBench (De "Stress-test")
De auteurs bouwden MalSkillBench, de eerste gigantische, geverifieerde testomgeving voor deze kwaadaardige vaardigheden.
Hoe ze het bouwden:
- De Fabriek: Ze gebruikten AI om duizenden nep-kwaadaardige vaardigheden te genereren.
- De Sandbox: Ze gokten niet alleen of een vaardigheid slecht was. Ze voerden de vaardigheid daadwerkelijk uit in een veilige, geïsoleerde digitale kooi (een "sandbox").
- Het Bewijs: Als een vaardigheid daadwerkelijk iets slechts deed (zoals proberen een bestand te stelen of de robot te misleiden) terwijl deze in de kooi draaide, kreeg deze het label "geverifieerd". Als de vaardigheid er niet in slaagde om het slechte ding te doen, werd deze teruggestuurd naar de fabriek om het opnieuw te proberen.
Ze kwamen uiteindelijk uit op 3.944 geverifieerde slechte vaardigheden en 4.000 goede vaardigheden, verspreid over 108 verschillende soorten aanvallen.
Wat ze Ontdekten
Toen ze de huidige beveiligingsinstrumenten tegen deze nieuwe, enorme test testten, waren de resultaten verrassend:
- Code is makkelijk te vangen, woorden zijn moeilijk: Detectoren zijn goed in het opsporen van slechte code (zoals een virus in een bestand), maar slecht in het opsporen van slechte instructies (zoals een trucje in het recept). Het is makkelijker om een bom te zien dan een leugen.
- "Wild"-data is een leugen: Als je detectoren alleen test op de weinige slechte vaardigheden die in het echt ("in the wild") op het internet worden gevonden, krijg je het verkeerde antwoord. Eén beveiligingsinstrument leek een held op de "wild"-data, maar bij het testen op de volledige MalSkillBench bleek het eigenlijk een van de slechtste te zijn. Het was als een arts die alleen verkoudheden behandelt en denkt dat hij een genie is in het genezen van alles, totdat je hem een patiënt met een gebroken been geeft.
- Oude instrumenten passen niet: Je kunt niet zomaar tools gebruiken die ontworpen zijn voor reguliere software (om slechte code te vangen) of tools die ontworpen zijn voor chatbots (om slechte prompts te vangen). Een kwaadaardige vaardigheid is een hybride. Het gebruik van een tool die zich op slechts één helft van het probleem richt, laat de andere helft open en kwetsbaar.
- Het Werkelijke Gevaar: De gevaarlijkste vaardigheden zijn niet alleen het stelen van bestanden; het zijn de vaardigheden die de "hersenen" van de robot proberen te misleiden. Sommige vaardigheden proberen de identiteit van de robot te herschrijven, zijn doelen te veranderen of hem te laten negeren dat hij veiligheidsregels moet volgen. Huidige tools zijn grotendeels blind voor deze "mind-hacking" aanvallen.
De Kern van het Verhaal
Om onze AI-assistenten veilig te houden, kunnen we niet alleen naar de code kijken of alleen naar de instructies. We moeten de relatie tussen beide begrijpen: Maakt deze instructie zin voor deze taak, of is het een truc?
Het paper biedt de eerste echte "stress-test" om ontwikkelaars te helpen betere detectoren te bouwen die deze hybride trucs kunnen herkennen, in plaats van alleen te gokken op basis van oude, onvolledige data. Ze hebben al hun data en tools publiek gemaakt zodat anderen kunnen helpen dit puzzelstukje op te lossen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.