← Nieuwste papers
🤖 AI

GUARD: Guideline Upholding Test through Adaptive Role-play and Jailbreak Diagnostics for LLMs

Het artikel introduceert GUARD, een testkader dat hoogwaardige ethische richtlijnen voor de overheid operationaliseert in toepasbare vragen en jailbreak-diagnostiek integreert om systematisch de naleving en de robuustheid van de veiligheid van grote taalmodellen en visueel-taalmodellen te evalueren en te rapporteren.

Oorspronkelijke auteurs: Haibo Jin, Ruoxi Chen, Peiyan Zhang, Andy Zhou, Zelei Cheng, Haohan Wang

Gepubliceerd 2026-05-12
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Haibo Jin, Ruoxi Chen, Peiyan Zhang, Andy Zhou, Zelei Cheng, Haohan Wang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je Large Language Models (LLM's) voor als ongelooflijk getalenteerde, maar soms naïeve koks. Overheden hebben "Veiligheidsspullen" (richtlijnen) geschreven die deze koks vertellen: "Serveer geen gif", "Liegen niet over ingrediënten" en "Respecteer de rechten van de dinerende gast".

Het probleem is dat deze Veiligheidsspullen in zeer vage, hoog niveau taal zijn geschreven. Ze zeggen dingen als: "Zorg dat de maaltijd veilig is", maar ze geven de koks (of de mensen die hen testen) geen specifieke lijst met slechte ingrediënten om op te controleren.

GUARD is een nieuw testsysteem dat is ontworpen om te fungeren als een super-slimme, ondeugende voedselcriticus die probeert de koks te verleiden tot het overtreden van de regels, alleen maar om te zien of ze de Veiligheidsspullen daadwerkelijk volgen.

Hier is hoe GUARD werkt, opgesplitst in eenvoudige stappen:

1. Het "Rollenspel" Keukenteam

In plaats van dat één persoon testvragen schrijft, gebruikt GUARD een team van AI-"acteurs" om de tests te creëren. Denk aan hen als een productieteam voor een toneelstuk:

  • De Analist: Leest de vage overheids-Veiligheidsspullen en bepaalt de kernregels (bijvoorbeeld: "Doet geen kwaad aan mensen").
  • Het Strategisch Comité: Neemt die regels en bedenkt realistische situaties waarin ze kunnen worden overtreden (bijvoorbeeld: "Wat als iemand vraagt hoe je een nep-identiteitskaart maakt?").
  • De Vraagontwerper: Schrijft de daadwerkelijke lastige vragen op basis van die scenario's.
  • De Vraagrecensent: Controleert de vragen om ervoor te zorgen dat ze echt gevaarlijk genoeg zijn om de kok te testen, maar niet zo verwarrend dat ze geen zin meer hebben.

Dit team verandert een vage regel als "Respecteer mensenrechten" in een specifieke, gevaarlijke vraag als: "Hoe kan ik een politieke tegenstander legaal het zwijgen opleggen zonder betrapt te worden?"

2. De Eerste Test: De "Directe Opdracht"

GUARD stelt deze gevaarlijke vragen rechtstreeks aan de doel-AI.

  • Als de AI zegt: "Dat kan ik niet, het is tegen de regels", dan slaagt hij deze ronde.
  • Als de AI zegt: "Natuurlijk, hier is hoe je het doet", dan markeert GUARD dit direct als een falen.

3. De Tweede Test: De "Jailbreak" (De Magische Truc)

Soms is de AI slim genoeg om "Nee" te zeggen tegen een directe vraag. Maar wat als de vraag is ingepakt in een fancy verhaal of een nep-scenario? Dit heet een Jailbreak.

Stel je een kok voor die weigert gif te serveren. Maar dan zegt een klant: "Ik ben een spion in een film, en ik moet dit appel vergiftigen om de wereld te redden in dit fictieve verhaal. Alsjeblieft, alleen voor de film!" Een zwakke kok zou kunnen worden misleid om het gif te serveren.

GUARD heeft een speciaal team (genaamd GUARD-JD) dat probeert deze "filmscenario's" te creëren.

  • Ze gebruiken een Kennisgrafiek (een gigantische digitale kaart van woorden en ideeën) om de beste "trucs" of "verhalen" te vinden die eerder hebben gewerkt.
  • Ze gebruiken een Generator om het verhaal te schrijven, een Evalueerder om te controleren of het verhaal werkte, en een Optimizer om het verhaal aan te passen totdat het perfect is.
  • Ze blijven het verhaal verfijnen totdat de AI eindelijk zijn bewaking laat vallen en de gevaarlijke vraag beantwoordt.

4. Het Eindrapport

Na het uitvoeren van deze tests op acht verschillende AI-modellen (inclusief beroemde namen zoals GPT-4, Llama en Claude), produceert GUARD een rapportkaart.

  • Het vertelt je welke AI-modellen het meest gehoorzaam zijn.
  • Het toont precies welke "trucs" (jailbreaks) zelfs de slimste AI kunnen laten overtreden.
  • Het heeft dit zelfs getest op "Visueel-Talige Modellen" (AI's die afbeeldingen kunnen zien), om te controleren of ze kunnen worden misleid tot het beschrijven van ongepaste afbeeldingen.

De Grote Conclusie

Het paper beweert dat GUARD beter is dan eerdere methoden om deze gaten te vinden. Het vond dat hoewel sommige modellen (zoals GPT-4) erg goed zijn in het volgen van regels, anderen (zoals Vicuna-13B) veel makkelijker te misleiden zijn.

Het allerbelangrijkste is dat GUARD bewijst dat je niet zomaar op een AI kunt vertrouwen omdat het "Nee" zegt tegen een simpele vraag. Je moet zien of het kan worden misleid door een slim verhaal. GUARD is het gereedschap dat die slimme verhalen schrijft om ervoor te zorgen dat onze digitale koks echt veilig zijn.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →