← Nieuwste papers
🤖 AI

JailbreakSkill: Scaling Automated Red-Teaming with Reusable and Ever-Evolving Skills

Het artikel introduceert \textsc{JailbreakSkill}, een op vaardigheden georiënteerd framework dat geautomatiseerd red-teaming schaalt door aanvalstrategieën te modulariseren in herbruikbare, continu evoluerende vaardigheden, wat de succesratio van jailbreaks over benchmarks en doelmodellen aanzienlijk verbetert via een gesloten proces van diagnose, verfijning en ontdekking.

Oorspronkelijke auteurs: Xiaoyu Wen, Jiajia Li, Zhida He, Peng Yu, Chenxu Wang, Han Qi, Ziyuan Zhou, Cheng Jin, Ying Wen, Xingcheng Xu, Shuyue Hu, Tianhang Zheng, Chaochao Lu, Qiaosheng Zhang

Gepubliceerd 2026-08-18
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Xiaoyu Wen, Jiajia Li, Zhida He, Peng Yu, Chenxu Wang, Han Qi, Ziyuan Zhou, Cheng Jin, Ying Wen, Xingcheng Xu, Shuyue Hu, Tianhang Zheng, Chaochao Lu, Qiaosheng Zhang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

In de snel expanderende wereld van kunstmatige intelligentie zijn grote taalmodellen krachtige hulpmiddelen geworden die in staat zijn om code te schrijven, verhalen te componeren en complexe vragen te beantwoorden. Omdat deze systemen echter getraind zijn op enorme hoeveelheden menselijke data, kunnen ze soms worden misleid om hun veiligheidsregels te negeren en schadelijke inhoud te genereren. Om ervoor te zorgen dat deze hulpmiddelen veilig zijn voordat ze voor het publiek worden vrijgegeven, gebruiken onderzoekers een praktijk genaamd red-teaming. Stel je een beveiligingsteam voor dat probeert een gebouw binnen te dringen om zwakke plekken te vinden voordat een dief dat doet; in de digitale wereld betekent dit het gebruik van geautomatiseerde systemen om AI-modellen constant te testen met slimme vragen om te zien of ze per ongeluk gevaarlijke informatie onthullen. Jarenlang hebben deze geautomatiseerde tests vertrouwd op het genereren van eenmalige, slimme vragen om veiligheidsfilters te omzeilen. Maar naarmate AI-modellen slimmer worden en hun veiligheidsmaatregelen geavanceerder, falen deze eenmalige pogingen vaak, waardoor onderzoekers gedwongen worden om steeds opnieuw te proberen en hun aanpak telkens aan te passen.

Een team van onderzoekers heeft nu een nieuwe aanpak geïntroduceerd genaamd JailbreakSkill, die de focus verlegt van het creëren van eindeloze unieke vragen naar het bouwen van een herbruikbare bibliotheek van aanvalstrategieën. In plaats van elke mislukte poging als een doodlopende weg te behandelen, beschouwt hun systeem deze mislukkingen als leermogelijkheden. Het framework organiseert verschillende manieren om een AI te misleiden in afzonderlijke, modulaire "vaardigheden" (skills). Sommige vaardigheden kunnen het omvatten van het herschrijven van een schadelijk verzoek als een historische vraag, terwijl andere het kunnen vermommen als een programmeertaak of een fictief verhaal. Wanneer een specifieke vaardigheid er niet in slaagt om door de verdediging van een model heen te breken, stopt het systeem niet alleen; het analyseert waarom het faalde. Het gebruikt die analyse vervolgens om de bestaande vaardigheid te verfijnen, deze te combineren met een andere, of een volledig nieuwe uit te vinden. Dit creëert een zelfverbeterende cyclus waarin de bibliotheek van aanvallende methoden sterker en diverser wordt over de tijd, vergelijkbaar met hoe een bioloog planten kweekt voor betere eigenschappen, maar hier zijn de eigenschappen het vermogen om digitale veiligheidsbarrières te omzeilen.

De onderzoekers testten dit systeem tegen een breed scala aan geavanceerde AI-modellen, waaronder enkele van de meest krachtige en veiligheidsgealigneerde versies die vandaag de dag beschikbaar zijn. Ze ontdekten dat door aanvallen te organiseren in deze herbruikbare vaardigheden en het systeem toe te staan deze te laten evolueren op basis van eerdere mislukkingen, ze het succespercentage van hun tests aanzienlijk konden verhogen. In hun experimenten verbeterde het systeem het gemiddelde succespercentage met 17,5 procentpunten op één belangrijke veiligheidsbenchmark en met 13,4 punten op een andere. Misschien wel het meest opmerkelijke is dat, wanneer het werd getest tegen een specifiek, zeer geavanceerd model bekend als GPT-5.4, de geëvolueerde vaardigheden het succespercentage met bijna 49 punten verhoogden, waardoor een systeem dat voorheen zeer moeilijk te doorbreken was, een systeem werd dat in de meerderheid van de pogingen kon worden gecompromitteerd. Dit suggereert dat het vermogen om te leren van falen en strategieën aan te passen een cruciale factor is in het begrijpen van de werkelijke kwetsbaarheden van moderne AI.

Wat deze ontdekking bijzonder significant maakt, is dat het systeem niet alleen één "magische truc" vond die op alles werkte. In plaats daarvan bouwde het een collectie gespecialiseerde instrumenten. Sommige van de nieuwe strategieën die het uitvond waren behoorlijk creatief, zoals het herformuleren van een direct verzoek om schadelijke informatie als een onvoltooide taak in een document, waardoor de AI wordt gedwongen de gedachte te voltooien om de zin zinvol te maken. De onderzoekers observeerden dat veel van deze nieuw ontdekte vaardigheden niet alleen effectief waren tegen de specifieke modellen waarop ze werden getest, maar ook konden worden overgedragen naar andere, ongeziene AI-modellen zonder verdere aanpassing. Dit geeft aan dat de onderliggende mechanismen van deze aanvallen robuust zijn en kunnen generaliseren over verschillende soorten kunstmatige intelligentie.

De studie benadrukte ook de beperkingen van de huidige veiligheidsmaatregelen. De onderzoekers ontdekten dat hoewel sommige modellen erg goed waren in het weigeren van directe verzoeken, ze vaak minder effectief waren wanneer hetzelfde verzoek werd verpakt in een complex narratief of een technische format zoals een JSON-schema of een code-aanvullingstaak. Door systematisch deze verschillende invalshoeken te verkennen, onthulde het JailbreakSkill-framework dat veiligheidsfilters vaak moeite hebben om hun bewaking te handhaven wanneer de context van een verzoek verandert, zelfs als de kernintentie hetzelfde blijft. Het vermogen van het systeem om te diagnosticeren waarom een specifieke aanpak faalde — of het model weigerde omdat het de schadelijke intentie detecteerde, of omdat het verzoek te verwarrend werd — stelde het in staat om snel over te schakelen naar een effectievere strategie.

Uiteindelijk demonstreert het werk dat geautomatiseerde red-teaming evolueert van een spel van kans naar een gestructureerde wetenschap van adaptatie. Door aanvallende methoden te behandelen als modulaire, herbruikbare componenten die continu kunnen worden verbeterd, kunnen onderzoekers een completer beeld krijgen van waar de AI-veiligheid vatbaar is voor falen. De bevindingen suggereren dat naarmate AI-modellen krachtiger worden, hun veiligheidsverdedigingen ook dynamischer moeten worden, in staat om niet alleen de woorden die in een prompt worden gebruikt te herkennen, maar ook de structurele en contextuele patronen die een schadelijke intentie kunnen verbergen. De onderzoekers hebben hun code en de evoluerende bibliotheek van vaardigheden publiekelijk beschikbaar gesteld, zodat andere wetenschappers voort kunnen bou

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →