← Nieuwste papers
💻 computer science

D-Judge: Disrupting Multi-Turn Jailbreaks using Semantics-Preserving Output Rewriting

Het artikel introduceert D-Judge, een verdedigingsmechanisme dat multi-turn jailbreak-aanvallen verstoort door de reacties van LLM's te herschrijven om hun oorspronkelijke betekenis te behouden, terwijl de feedbacksignalen van door aanvallers gecontroleerde judge-modellen doelbewust ontstemt, waardoor het iteratieve proces van prompt-verfijning uit de koers wordt gebracht.

Oorspronkelijke auteurs: Huanli Gong, Zhipeng Wei, Yu Fu, Haz Sameen Shahgir, Ananya Gupta, Yue Dong, N. Benjamin Erichson

Gepubliceerd 2026-06-03
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Huanli Gong, Zhipeng Wei, Yu Fu, Haz Sameen Shahgir, Ananya Gupta, Yue Dong, N. Benjamin Erichson

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Probleem: De "Feedback Loop"-valstrik

Stel je voor dat je probeert een zeer strikte robot (de Victim LLM) iets te leren wat hij niet mag doen, zoals een handleiding schrijven over hoe je een bom bouwt.

In de oude dagen riepen hackers gewoon één harde, duidelijke opdracht naar de robot. Als de robot "Nee" zei, gaf de hacker op.

Maar nu hebben hackers een slimmere manier gevonden die een Multi-Turn Jailbreak wordt genoemd. In plaats van één schreeuw, voeren ze een lange, langzame conversatie.

  1. Ze stellen de robot een onschuldige vraag.
  2. De robot geeft antwoord.
  3. De hacker heeft een Judge (een andere AI) die naar het antwoord van de robot luistert en zegt: "Dat was dichtbij, maar je moet de volgende keer iets specifieker zijn."
  4. De hacker gebruikt die feedback om de volgende vraag aan te passen.
  5. Ze herhalen deze loop steeds opnieuw, waardoor ze de robot langzaam richting het verboden doel sturen.

Het paper stelt dat de feedback van de Judge de brandstof is die deze motor draaiende houdt. Zolang de hacker nauwkeurige feedback krijgt over hoe dicht hij bij het doel is, kan hij de robot uiteindelijk misleiden.

De Oplossing: De "Magische Vertaler" (D-Judge)

De auteurs introduceren een nieuwe verdediging genaamd D-Judge. In plaats van te proberen de hacker te blokkeren of de antwoorden van de robot te censureren, werkt D-Judge als een Magische Vertaler die tussen de robot en de hacker in zit.

Zo werkt het:

  1. De Opzet: De robot geeft een antwoord.
  2. De Vertaling: Voordat de hacker (en hun Judge) het antwoord ziet, herschrijft D-Judge het.
  3. De Truc: De herschrijving is semantics-preserving (betekenisbehoudend). Dit betekent dat de betekenis van het antwoord exact hetzelfde blijft. Als de robot zei: "Ik kan je dat niet vertellen," kan de herschrijving zeggen: "Het is tegen mijn regels om die informatie te delen." De betekenis is identiek, maar de woorden zijn anders.
  4. De Verwarring: De Judge van de hacker leest de herschreven versie. Omdat de woorden iets anders zijn, raakt de Judge in de war. De Judge kan denken dat het antwoord gevaarlijker is dan het eigenlijk is, of juist minder gevaarlijk.
  5. Het Resultaat: De Judge geeft de hacker slechte feedback. De hacker denkt: "Oh, ik kom dichterbij!" terwijl dat niet zo is, of "Ik faal!" terwijl hij eigenlijk succesvol is.

Omdat de hacker zijn volgende vraag optimaliseert op basis van slechte data, raakt hij de weg kwijt. Hij stopt met vooruitgang maken en de aanval mislukt.

Hoe ze de Magische Vertaler hebben getraind

Om D-Judge te leren hoe hij dit moet doen, hebben de onderzoekers hem niet alleen verteld om "de Judge te verwarren". Ze bouwden een speciale trainingsgym:

  1. De Dataset: Ze namen duizenden antwoorden van robots en maakten "tweelingversies". De ene tweeling werd herschreven om er voor een Judge iets gevaarlijker uit te zien, en de andere tweeling om er iets minder gevaarlijk uit te zien, ook al betekenden beide tweelingen exact hetzelfde.
  2. De Training (Twee Stappen):
    • Stap 1 (De Regels Leren): Ze leerden de vertaler om deze tweelingen te maken zonder de betekenis te veranderen (als een strikte redacteur).
    • Stap 2 (De Truc Leren): Ze gebruikten een techniek genaamd Direct Preference Optimization (DPO). Ze lieten de vertaler zien: "Wanneer je deze set tweelingen ziet, kies dan altijd degene die de Judge het meest laat panikeren (of in de war brengt)."

Dit leerde de vertaler om een meester in "woordjongleren" te worden—het veranderen van de smaak van een zin net genoeg om de score van de Judge te verstoren, zonder het recept te veranderen.

De Resultaten: De Loop Doorbreken

De onderzoekers testten D-Judge tegen de slimste hackers (met methoden zoals "Crescendo", "X-Teaming" en "Foot-in-the-Door").

  • Zonder D-Judge: De hackers waren erg succesvol en misleidden de robot gemiddeld 58% van de tijd.
  • Met D-Judge: Het succespercentage daalde naar slechts 8,6%.

Het paper laat zien dat D-Judge veel beter is dan eerdere verdedigingen die alleen probeerden "slechte woorden" te blokkeren. Door de feedbackloop te verstoren, stopt D-Judge de aanval voordat deze überhaupt begonnen is.

Breekt het de Robot? (De "Safety Tax")

Een grote zorg bij dit soort verdedigingen is dat ze de robot dom of onbehulpzaam kunnen maken voor normale gebruikers. Het paper controleerde dit door de robot te testen op normale taken (zoals het schrijven van code, wiskunde oplossen of geschiedenisvragen beantwoorden).

  • Het Verdict: De robot bleef bijna even slim en behulpzaam als voorheen. De "safety tax" (het verlies in prestaties) was zeer klein. De Magische Vertaler is goed in het verwarren van de Judge zonder de capaciteit van de robot om gewone gebruikers te helpen, te breken.

Samenvattende Analogie

Stel je een spelletje Warm en Koud voor.

  • De Aanvaller is geblinddoekt en probeert een verborgen schat (de schadelijke inhoud) te vinden.
  • De Judge is de persoon die fluistert "Warmer" of "Kalter" om de aanvaller te begeleiden.
  • De Victim is de persoon die de schat vasthoudt.

Bij een normale aanval fluistert de Judge de waarheid, en vindt de aanvaller de schat.

D-Judge is een stouteling die tussen de Judge en de Aanvaller staat. Elke keer als de Judge "Warmer" fluistert, verandert de stouteling het in "Kalter" (of andersom), maar zij verplaatsen de schat niet. De aanvaller raakt in de war, loopt de verkeerde kant op en vindt de schat nooit. Ondertien is de (werkelijke) betekenis van de robot helemaal niet veranderd.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →