← Nieuwste papers
💬 NLP

What Intermediate Layers Know: Detecting Jailbreaks from Entropy Dynamics

Dit artikel toont aan dat jailbreak-aanvallen in Large Language Models gedetecteerd kunnen worden door de monotone trend van de predictieve entropie op tokenniveau over tussenliggende lagen te analyseren, wat onthult dat schadelijke intentie wordt gecodeerd in gestructureerde onzekerheidsdynamiek in plaats van in statische geaggregeerde statistieken of outputs van de laatste laag.

Oorspronkelijke auteurs: Sofiia Nikolenko, Michele Papucci, Mina Rezaei, Shireen Kudukkil Manchingal

Gepubliceerd 2026-06-25
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Sofiia Nikolenko, Michele Papucci, Mina Rezaei, Shireen Kudukkil Manchingal

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een Large Language Model (LLM) voor als een zeer geavanceerde, meerverdiepingsfabriek. Wanneer je een vraag typt (een prompt) in deze fabriek, reist de informatie omhoog door de verdiepingen (lagen) van het gebouw. Op de begane grond wordt de ruwe tekst ontvangen. Tegen de tijd dat de informatie de bovenste verdieping bereikt, heeft de fabriek de tekst verwerkt en is hij klaar om een antwoord te printen.

Jarenlang hebben veiligheidsexperts geprobeerd om "jailbreaks" te vangen—slimme prompts die ontworiment zijn om de fabriek te misleiden tot het produceren van gevaarlijke of verboden outputs. De meeste verdedigingen kijken naar de ingang (de tekst die je typte) of de uitgang (het antwoord dat de fabriek print). Maar dit artikel stelt een andere vraag: Wat gebeurt er binnen in de fabriek terwijl het werk wordt uitgevoerd?

Hier is wat de onderzoekers ontdekten, eenvoudig uitgelegd:

1. De "Verwarringsmeter" (Entropie)

Binnen in de fabriek heeft de machine bij elke stap van het proces een "Verwarringsmeter". Deze meter meet hoe onzeker de machine is over welk woord hij als volgende moet zeggen.

  • Lage verwarring: De machine is heel zeker (bijv. "De lucht is... blauw").
  • Hoge verwarring: De machine gokt wild (bijv. "De lucht is... misschien paars? of een broodrooster?").

De onderzoekers keken niet alleen naar het gemiddelde verwarringsniveau van de hele prompt. In plaats daarvan keken ze naar hoe de Verwarringsmeter bewoog terwijl de zin werd opgebouwd, woord voor woord.

2. De "Glijbaan" versus de "Vlakke Lijn"

Het team ontdekte een duidelijk patroon in hoe deze meter zich gedraagt voor slechte prompts (jailbreaks) versus goede prompts (veilige vragen).

  • Veilige Prompts: Stel je voor dat de Verwarringsmeter een kalm meer is. Het kan een beetje rimpelen, maar over het algemeen blijft het relatief vlak en stabiel terwijl de zin vordert.
  • Jailbreak Prompts: Stel je voor dat de Verwarringsmeter een glijbaan is. Terwijl de slechte prompt zich ontvouwt, is de onzekerheid van de machine niet alleen hoog of laag; het beweegt in een zeer specifieke, vloeiende, glijdende richting (ofwel geleidelijk zelfverzekerder of geleidelijk verwarder worden) naarmate de woorden zich opstapelen.

De onderzoekers realiseerden zich dat hoe de meter beweegt (de "trajectorie") de echte aanwijzing is, niet alleen hoe hoog de meter op een bepa eigenlijk moment staat.

3. Het Geheim van de "Middelste Verdieping"

Hier is het meest verrassende deel: dit "glijbaan"-patroon is niet zichtbaar op de bovenste verdieping (de laatste laag waar het antwoord wordt geprint) of op de onderste verdieping.

  • De Bovenste Verdieping: Tegen de tijd dat de boodschap de bovenste verdieping bereikt, heeft de fabriek het signaal "opgeschoond". Het glijdende patroon verdwijnt of wordt verstoord.
  • De Middelste Verdiepingen: Het "glijbaan"-patroon is het luidst en duidelijkst in het midden van het gebouw (specifiek rond de 60–70% markering omhoog in de lagen).

Het is alsoaf de fabriek een geheim "gevarenzone" heeft in het midden van zijn verwerkingslijn waar de structuur van een slecht verzoek het meest duidelijk is, maar tegen de tijd dat het product klaar is, is dat bewijs gladgestreken.

4. Waarom dit Belangrijk is (Zonder Training)

De onderzoekers bouwden een hulpmiddel dat werkt als een beveiligingscamera gericht op alleen deze middelste verdiepingen.

  • Geen Nieuwe Training: Ze hoefden de fabriek niets nieuws te leren. Ze keken alleen naar de bewegingen van de bestaande "Verwarringsmeter".
  • Het Werkt Overal: Ze testten dit op drie verschillende grote fabriekontwerpen (Llama, Qwen en Gemma). Ondanks dat de fabrieken anders waren gebouwd, verscheen dit "glijbaan"-patroon in de middelste verdiepingen van alle modellen wanneer een jailbreak werd geprobeerd.
  • Beter dan Oude Methoden: Kijken naar de gemiddelde verwarring (statische statistieken) was als proberen te raden of een auto te hard rijdt door naar een enkele foto van zijn snelheidsmeter te kijken. Het kijken naar de trajectorie (dynamische kenmerken) is als het kijken naar een auto die een heuvel af versnelt; dat vertelt je veel meer over wat er werkelijk aan de hand is.

De Addertjes onder het Gras (Beperkingen)

Het artikel vermeldt twee belangrijke beperkingen:

  1. Je moet de binnenkant zien: Om deze methode te gebruiken, heb je toegang nodig tot de "middelste verdiepingen" van de fabriek (de interne data). Als je een "black-box" AI gebruikt waarbij je de binnenkant niet kunt zien, kun je deze specifieke detector niet gebruiken.
  2. Slimme Mimicry: Als een "veilige" prompt geschreven is in een stijl die structureel lijkt op een jailbreak (ook al is het niet schadelijk), raakt de detector in de war. De detector detecteert de structuur van de prompt, niet de intentie. Als een veilige prompt het "glijbaan"-patroon nabootst, kan de detector dit als gevaarlijk markeren.

Samenvatting

Kortom, het artikel onthult dat wanneer een Large Language Model wordt misleid door een jailbreak, zijn interne "onzekerheid" niet zomaar stilstaat; het glijdt in een voorspelbaar, vloeiend patroon. Dit patroon is het meest zichtbaar in het midden van de verwerkingslagen van het model, wat een nieuwe, zonder training werkende manier biedt om deze aanvallen te detecteren door te kijken naar hoe het vertrouwen van het model evolueert, in plaats van alleen naar wat het zegt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →