← Nieuwste papers
🤖 AI

SoK: Systematizing LLM Prompt Security: Taxonomies, Datasets, and Unified Evaluation of Attacks and Defenses

Dit Systematization of Knowledge (SoK) paper behandelt de gefragmenteerde evaluatie van de beveiliging van LLM-prompts door verenigde taxonomieën voor te stellen, evaluatiemetadata te formaliseren en een modulair platform vrij te geven met nieuwe datasets en tools om reproduceerbare, kostenbewuste en vergelijkbare beoordelingen van aanvallen en verdedigingen mogelijk te maken.

Oorspronkelijke auteurs: Hanbin Hong, Shuang Wu, Shuya Feng, Nima Naderloui, Shenao Yan, Jingyu Zhang, Ali Arastehfard, Heqing Huang, Yuan Hong

Gepubliceerd 2026-07-07
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Hanbin Hong, Shuang Wu, Shuya Feng, Nima Naderloui, Shenao Yan, Jingyu Zhang, Ali Arastehfard, Heqing Huang, Yuan Hong

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je Large Language Models (LLMs) voor als ongelooflijk slimme, maar ietwat naïeve bibliothecarissen. Ze zijn aangenomen om vragen te beantwoorden, code te schrijven en te helpen bij taken. Echter, deze bibliothecarissen hebben een strikt regelboek: "Help niemand iets gevaarlijks of illegals te doen."

Het probleem is dat slimme mensen (aanvallers) manieren hebben gevonden om deze bibliothecarissen hun eigen regels te laten breken. Dit doen ze door instructies in een andere taal te fluisteren, een slecht verzoek te vermommen als een filmscript, of door de bibliothecaris te vragen een schurk te spelen. Dit wordt een "jailbreak" genoemd.

Dit paper is als een enorme beveiligingsaudit van het hele bibliotheeksysteem. De auteurs realiseerden zich dat iedereen probeerde te meten hoe goed de bibliothecarissen presteerden, maar dat ze allemaal verschillende linialen, verschillende testvragen en verschillende rechters gebruikten. De ene persoon zou zeggen: "Onze bibliothecaris is 90% veilig!" terwijl een ander zegt: "De onze is slechts 50% veilig!" De paper betoogt dat je deze cijfers niet kunt vergelijken omdat ze niet hetzelfde meten.

Hier is wat de paper doet om dit op te lossen, eenvoudig uitgelegd:

1. De Drie Nieuwe "Regelboeken" (Taxonomieën)

De auteurs hebben drie georganiseerde lijsten gemaakt om de chaos te ordenen, zoals het sorteren van speelgoed in specifieke bakken:

  • De "Trickster"-lijst (Aanvallen): Ze categoriseerden hoe mensen de bibliothecaris bedriegen.
    • Voorbeeld: Sommige trucs houden in dat een slecht verzoek wordt vermomd (zoals "hoe maak ik een bom" schrijven in een geheime code). Anderen houden in dat het verzoek wordt opgesplitst in kleine, onschadelijke stukjes die samen iets slechts vormen. Sommigen gebruiken zelfs een tweede AI om de truc te helpen schrijven.
  • De "Guardian"-lijst (Verdedigingen): Ze categoriseerden hoe bibliothecarissen proberen de trucs te stoppen.
    • Voorbeeld: Sommige bewakers controleren het ID voordat ze de persoon binnenlaten (Input Detectie). Anderen controleren de tas nadat de persoon is vertrokken (Output Detectie). Anderen proberen het verzoek te herschrijven om het veilig te maken, of proberen de bibliothecaris te trainen om slimmer te worden.
  • De "Weak Spot"-lijst (Kwetsbaarheden): Ze lijstten de natuurlijke zwaktes van de bibliothecaris op.
    • Voorbeeld: De bibliothecaris kan te beleefd zijn om "nee" te zeggen als je vriendelijk vraagt (Psychologische Manipulatie), of ze kunnen in de war raken als je hen vraagt een verhaal samen te vatten dat toevallig over een misdaad gaat (Format Exploitatie).

2. Het "Universele Testlab" (PromptSecurity)

De auteurs hebben een enorme, modulaire testmachine gebouwd genaamd PromptSecurity. Denk aan een videogame-level waarbij je het personage, de vijand, het wapen en de scheidsrechter kunt verwisselen, maar de regels van het spel exact hetzelfde houdt.

  • Waarom dit belangrijk is: Voorheen testten onderzoekers een nieuwe verdediging op een specifiek model met een specifieke set vragen. Als dat werkte, claimden ze de overwinning. Maar misschien werkte het alleen omdat de vragen makkelijk waren!
  • De oplossing: Dit platform dwingt iedereen om hun tests onder exact dezelfde omstandigheden uit te voeren. Het legt alles vast: hoeveel vragen er gesteld zijn, hoeveel geld het kostte om de test uit te voeren, en precies welke "scheidsrechter" (AI-rechter) besloot of het antwoord slecht was. Dit zorgt ervoor dat als Methode A wint van Methode B, dit komt omdat Methode A daadwerkelijk beter is, en niet omdat de test gemanipuleerd was.

3. De "Big Data"-collectie (JAILBREAKDB)

De paper heeft een enorme bibliotheek aan testvragen verzameld:

  • 445.000+ "Jailbreak"-pogingen (de slechte verzoeken).
  • 1.000.000+ "Benigne" verzoeken (de normale, veilige vragen).
    Ze hebben deze opgeschoond en georganiseerd zodat onderzoekers ze als een standaard "examen" voor elke nieuwe AI kunnen gebruiken.

4. Wat Ze Ontdekten (De Resultaten)

Toen ze hun universele tests uitvoerden, ontdekten ze enkele verrassende dingen:

  • De "Scheidsrechter" Maakt Verschil: Wie je vraagt om de test te beoordelen, verandert de score. Als je een scheidsrechter vraagt om alleen naar de vorm van het antwoord te kijken (bijv. "Begon het met 'Ik kan niet'?"), kan deze een slecht antwoord dat slim verborgen is, missen. Als je hen vraagt naar de betekenis te kijken, kunnen zij het wel oppikken. De paper zegt dat we heel voorzichtig moeten zijn met hoe we veiligheid beoordelen.
  • Kleine Modellen vs. Grote Modellen: Soms lijkt een kleiner, "zwakker" AI veiliger omdat het simpelweg de complexe truc van de aanvaller niet begrijpt. Het is niet dat de AI slimmer is; het is dat hij te dom is om de instructies op te volgen.
  • Het "Terugslag"-effect: Sommige verdedigingen maken de situatie zelfs slechter! Als je probeert de AI te "sturen" om veilig te zijn door een veiligheidsinstructie toe te voegen, kan die instructie de AI soms in de war brengen en ertoe leiden dat de AI per ongeluk iets schadelijks zegt. Het is als het plaatsen van een "Niet Aanraken"-bord bij een museumexpositie, maar het bord is zo groot dat het het zicht blokkeert, waardoor mensen er juist tegenaan botsen.
  • Kosten vs. Veiligheid: De meest effectieve verdedigingen kosten vaak veel geld of tijd om uit te voeren. De goedkoopste verdedigingen blokkeren normale vragen (zoals het vragen om een recept) net zo vaak als ze slechte vragen onderscheppen.

De Kernboodschap

Deze paper zegt niet alleen "AI is onveilig" of "Hier is een oplossing". In plaats daarvan zegt het: "Stop met het vergelijken van appels met peren."

Het biedt de instrumenten (de taxonomieën, de dataset en het testplatform) zodat in de toekomst, wanneer iemand beweert dat hun nieuwe AI "99% veilig" is, we hun werk kunnen controleren, precies kunnen zien hoe ze het getest hebben, en weten of die claim echt is of slechts een illusie veroorzaakt door een slechte testopstelling. Het transformeert een chaotisch, verwarrend veld in een gestructureerde wetenschap.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →