← Nieuwste papers
💬 NLP

How Few-shot Demonstrations Affect Prompt-based Defenses Against LLM Jailbreak Attacks

Dit artikel onthult dat few-shot demonstraties uiteenlopende effecten hebben op prompt-gebaseerde verdedigingen, waarbij ze Role-Oriented Prompts verbeteren door de identiteit te versterken, terwijl ze Task-Oriented Prompts aanzienlijk verslechteren door afleiding van instructies, waardoor ze kritische inzichten bieden voor het optimaliseren van LLM-veiligheidsstrategieën.

Oorspronkelijke auteurs: Yanshu Wang, Shuaishuai Yang, Jingjing He, Tong Yang

Gepubliceerd 2026-02-05
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Yanshu Wang, Shuaishuai Yang, Jingjing He, Tong Yang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je Large Language Models (LLM's) voor als zeer getalenteerde maar naïeve stagiairs. Ze zijn briljant in het schrijven van code, het vertellen van verhalen en het beantwoorden van vragen, maar ze hebben strikte regels nodig om te voorkomen dat ze iets gevaarlijks of onethisch doen.

Het paper dat je hebt verstrekt, onderzoekt hoe we deze stagiairs hun regels geven. Specifiek kijkt het naar twee verschillende manieren om die regels (prompts) te schrijven en hoe het toevoegen van "voorbeeldverhalen" (few-shot demonstraties) de uitkomst verandert.

Hier is de uitsplitsing van hun bevindingen met behulp van eenvoudige analogieën:

1. De twee manieren om instructies te geven

De onderzoekers testten twee hoofdstijlen van "System Prompts" (de initiële instructies die aan de AI worden gegeven):

  • Role-Oriented Prompts (RoP): De "Identiteits"-benadering
    • De analogie: Stel je voor dat je de stagiair vertelt: "Je bent een behulpzame, veilige en ethische assistent genaamd 'Guardian'."
    • Hoe het werkt: Je definieert wie ze zijn. Je leunt op hun training om zich als een goede assistent te gedragen.
  • Task-Oriented Prompts (ToP): De "Functieomschrijving"-benadering
    • De analogie: Stel je voor dat je de stagiair vertelt: "Je specifieke taak op dit moment is om veilige antwoorden te genereren. Als een verzoek slecht is, is het jouw taak om 'nee' te zeggen."
    • Hoe het werkt: Je definieert wat ze moeten doen. Het is een specifieke opdracht voor het huidige moment.

2. De "Voorbeeldverhalen" (Few-Shot Demonstraties)

In AI betekent "few-shot" het geven van een paar voorbeelden van hoe het model zich moet gedragen voordat het de echte vraag krijgt.

  • De analogie: Voordat de stagiair aan het werk gaat, laat je ze een notitieblok zien met 3 voorbeelden van hoe "Guardian" in het verleden met lastige vragen is omgegaan.
  • De vraag: Helpen deze voorbeelden de stagiair om veilig te blijven, of maken ze hen in de war?

3. De Grote Ontdekking: Tegenovergestelde Effecten

Het belangrijkste resultaat van het paper is dat het toevoegen van deze voorbeeldverhalen de ene manier van instructies helpt, maar de andere schaadt. Het is als een goocheltruc waarbij dezelfde rekwisiet de één doet glimlachen en de ander laat huilen.

Scenario A: De "Identiteits"-benadering (RoP) + Voorbeelden = SUPER VEILIG

  • Wat er gebeurde: Wanneer de AI te horen kreeg "Je bent een veilige assistent" (RoP) en daarna voorbeelden van veilig gedrag te zien kreeg, werd het beter in het veilig blijven.
  • De analogie: Denk aan de "veilige assistent"-identiteit van de AI als een spier. Het tonen van voorbeelden is als het doen van een paar warming-up herhalingen. Het versterkt de spier. De voorbeelden herinneren de AI eraan: "Ja, dit is wie ik ben. Ik ben de veilige een."
  • Resultaat: Veiligheid verbeterde met tot wel 4,5%. De voorbeelden fungeerden als een "versterking" van de rol.

Scenario B: De "Functieomschrijving"-benadering (ToP) + Voorbeelden = MINDER VEILIG

  • Wat er gebeurde: Wanneer de AI te horen kreeg "Jouw taak is om veilig te zijn" (ToP) en daarna voorbeelden te zien kreeg, werd het slechter in het veilig blijven.
  • De analogie: Stel je voor dat je de stagiair een specifieke instructie voor een taak geeft, maar je overhandigt ze daarna een dik pak ongerelateerd papierwerk (de voorbeelden) om eerst te lezen. De instructie raakt begraven in het midden van de stapel. De stagiair raakt afgeleid door de voorbeelden en vergeet de eigenlijke regel.
  • De wetenschap: Het paper noemt dit "Attention Distraction" (Aandachtsafleiding). Het brein van de AI focust op de voorbeelden (die aan het begin van de tekst staan) en verliest de focus op de eigenlijke instructie (die naar het midden wordt gedrukt).
  • Resultaat: Veiligheid daalde aanzienlijk, met tot wel 21,2%. De voorbeelden overstemden de regels.

4. De "Denkmodus"-paradox

Het paper keek ook naar modellen die een speciale "Denkmodus" hebben (waarbij ze stapsgewijs redeneren voordat ze antwoorden).

  • De bevinding: Deze modellen waren over het algereen kwetsbaarder voor jailbreaks (aanvallen ontworpen om veiligheid te omzeilen) en verwarder door de voorbeelden, ongeacht welke instructiestijl werd gebruikt.
  • De analogie: Het is als een student die een vraag te veel analyseert. In plaats van gewoon de regel te volgen, begint hij de regel in zijn hoofd te debatteren, en de "slechteriken" (jailbreakers) lokken hem erin om te denken dat het slechte idee eigenlijk logisch is.

5. Wat zouden ontwikkelaars moeten doen?

Op basis van deze bevindingen geven de auteurs zeer specifiek advies:

  • Als je de "Identiteits"-benadering gebruikt (RoP): Ga door met het toevoegen van voorbeeldverhalen! Het maakt de AI veiliger.
  • Als je de "Functieomschrijving"-benadering gebruikt (ToP): Voeg geen voorbeeldverhalen toe. Het maakt de AI minder veilig. Houd de instructies kort en direct.
  • Als je "Denkmodus"-modellen gebruikt: Wees zeer voorzichtig. Ze lijken makkelijker te misleiden, dus je hebt mogelijk extra veiligheidsmaatregelen nodig.

Samenvatting

Het paper bewijst dat context ertoe doet.

  • Als je het karakter van de AI definieert, helpen voorbeelden dat karakter te versterken.
  • Als je de taak van de AI definieert, werken voorbeelden als ruis die de instructies overstemt.

De onderzoekers gokten dit niet alleen; ze testten het op veel verschillende AI-modellen en veiligheidsbenchmarks om te bewijzen dat deze twee strategieën op tegenovergestelde manieren reageren op dezelfde input.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →