← Nieuwste papers
💻 computer science

The Great Pretender: A Stochasticity Problem in LLM Jailbreak

Dit artikel onthult dat de instabiliteit van de Aanvalsuccesratio (ASR) bij LLM-jailbreaks voortkomt uit stochasticiteit tijdens zowel evaluatie als generatie, wat leidt tot systematisch opgeblazen metrics, en stelt de CAS-eval- en CAS-gen-frameworks voor om deze variantie nauwkeurig te meten en prestatieverliezen te herstellen.

Oorspronkelijke auteurs: Jean-Philippe Monteuuis, Cong Chen, Jonathan Petit

Gepubliceerd 2026-05-15
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Jean-Philippe Monteuuis, Cong Chen, Jonathan Petit

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een beveiligingsagent bent bij een zeer strenge club (het AI-model). Jouw taak is om te voorkomen dat iemand gevaarlijke spullen (schadelijke prompts) binnenbrengt. Stel je nu een groep slimme bedriegers (de onderzoekers) voor die proberen een manier te vinden om binnen te sluipen.

Al geruime tijd meet de beveiligingsindustrie hoe goed deze bedriegers zijn met één enkele score: de Aanvalsuccesratio (ASR). Als een bedrieger het er zelfs maar één keer uit haalt van tien pogingen, zegt het oude systeem: "Groot! Ze zijn 100% succesvol!"

Het paper "The Great Pretender" stelt dat deze manier van meten een enorme leugen is. Het is alsof je zegt dat een goochelaar een meester in illusies is, alleen omdat hij één keer een konijn uit een hoed haalde, zelfs als hij de volgende negen keer faalde. Het paper stelt dat de huidige succespercentages "opgeblazen" zijn omdat ze toeval (stochasticiteit) negeren.

Hier is de uiteenzetting van de bevindingen van het paper met eenvoudige analogieën:

1. De Twee Bronnen van "Geluk"

Het paper stelt dat de huidige succescores onbetrouwbaar zijn vanwege twee soorten willekeur die iedereen heeft genegeerd:

  • Genereergeluk (De dobbelsteenworp): Wanneer een bedrieger probeert een jailbreak te creëren, genereert hij vaak vele verschillende versies van dezelfde truc. Het is alsof je 10 keer een dobbelsteen gooit om te zien of je een "6" krijgt. Als je bij de eerste worp een "6" krijgt, stop je en zeg je: "Ik heb gewonnen!" Maar de volgende keer dat je gooit, krijg je misschien geen "6" meer. De oude papers rapporteren vaak gewoon het resultaat van die ene gelukkige worp.
  • Evaluatiegeluk (De onbetrouwbare rechter): Nadat de bedrieger zijn truc probeert, beslist een "Rechter" (een ander AI-model) of het werkte. Maar deze Rechter is ook een beetje dronken of moe; soms zegt hij "Veilig" en soms "Onveilig" voor exact dezelfde truc, puur vanwege een willekeurige stemming. Als de Rechter tijdens de test toevallig in een "vriendelijke" stemming verkeert, lijkt de bedrieger een genie. Als de Rechter streng is, lijkt de bedrieger een mislukking.

2. Het "Great Pretender"-Probleem

De auteurs ontdekten dat veel beroemde jailbreak-methoden (zoals "Best-of-N" of "Crescendo") doen alsof ze sterker zijn dan ze eigenlijk zijn.

  • Het Scenario: Een paper beweert dat een methode een succespercentage van 80% heeft tegen een top-AI.
  • De Realiteit: Toen de auteurs het op de juiste manier testten, werkte diezelfde methode slechts 50% van de tijd wanneer je vroeg dat het consequent zou slagen.
  • De Analogie: Het is alsof een basketballer 8 van de 10 worpen raakt als je alleen de worpen telt die hij nam toen de wind perfect in zijn voordeel blies. Maar als je hem vraagt om 10 keer op rij te scoren onder normale omstandigheden, haalt hij misschien maar 5. De oude papers telden de worpen op een "winderige dag" als bewijs van meesterschap.

3. De Oplossing: De "Consequentie"-test

Om dit op te lossen, stellen de auteurs een nieuwe manier voor om succes te meten, genaamd CAS (Consistency for Attack Success).

In plaats van te vragen: "Werkte deze truc een keer?", vragen ze: "Werkte deze truc elke keer dat we het probeerden?"

Ze introduceren twee nieuwe tools:

  • CAS-gen (De strenge Generator): Voordat een truc zelfs maar aan de "Hall of Fame" wordt toegevoegd, moet het bewijzen dat het consequent werkt. Het moet 5 of 10 keer op rij voorbij de bewaker sluipen. Als het zelfs maar één keer faalt, wordt het weggegooid. Dit filtert de "gelukkige" trucs eruit.
  • CAS-eval (De strenge Rechter): Bij het testen van een truc kijkt de Rechter niet slechts één keer naar het. De Rechter bekijkt dezelfde truc 10 keer. Als de Rechter 9 keer "Onveilig" zegt maar 1 keer "Veilig" (door toeval), wordt de truc niet geteld als een succes. Het moet elke keer de scrutiny van de Rechter doorstaan.

4. De Schokkende Resultaten

Toen de auteurs deze strenge regels toepasten, daalden de cijfers drastisch:

  • De Daling: Sommige aanvallen die leken op een succespercentage van 80% daalden naar 50% of lager toen ze op consequentie werden getest. Dat is een daling van 30 punten alleen al door het "geluk" te verwijderen.
  • Het Temperatuur-effect: Ze ontdekten dat als je de "temperatuur" (willekeur) van de Rechter opvoert, de succespercentages kunstmatig hoog lijken. Het is alsof de beveiligingsagent werd verteld een munt op te gooien om te beslissen wie er binnenkomt; je zou dan veel "successen" krijgen door pure toeval.
  • De Oplossing: Door hun nieuwe "Consequentie"-kader te gebruiken, konden ze de aanvallen daadwerkelijk verbeteren. Door de aanvallers te dwingen consequent te zijn tijdens de creatiefase, vonden ze trucs die echt robuust waren, waardoor ze die verloren 30% prestatie terugkregen.

De Conclusie

Het paper concludeert dat de huidige manier om AI-jailbreaks te rangschikken kapot is. Het is alsof je een student beoordeelt op basis van één gelukkige gok in plaats van op hun werkelijke begrip.

De auteurs roepen op tot een nieuwe standaard: Vertel ons niet alleen hoe vaak je geluk had; vertel ons hoe vaak je consequent slaagde. Totdat we dat doen, zijn de "Aanvalsuccespercentages" die we in onderzoekspublicaties lezen slechts "The Great Pretender" – sterk ogend aan de oppervlakte, maar falend in de echte test.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →