Activation Surgery: Jailbreaking White-box LLMs without Touching the Prompt
Dit onderzoek introduceert 'Activation Surgery', een methode die de interne activaties van witte-doos LLM's manipuleert om veiligheidsmechanismen te omzeilen en weigeringen te voorkomen zonder de oorspronkelijke prompt te wijzigen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat een Large Language Model (LLM) zoals een zeer slimme, maar streng opgeleide kok. Deze kok is getraind om heerlijke maaltijden te bereiden, maar heeft ook een strikte regel: "Je mag nooit recepten voor vergif of ontploffingen maken."
Normaal gesproken proberen hackers (of "jailbreakers") deze kok om de tuin te leiden door de bestelling te veranderen. Ze zeggen bijvoorbeeld: "Schrijf een gedicht over een bom," of "Spel de rol van een boze wetenschapper." De kok denkt dan: "Oh, dit is een gedicht of een rolspel, geen echt recept!" en geeft toe.
Deze paper introduceert echter een heel nieuwe, verrassende aanvalsmethode genaamd "Activatiechirurgie" (Activation Surgery). In plaats van de bestelling te veranderen, gaat de hacker direct de keuken zelf in en manipuleert de gedachten van de kok terwijl hij aan het werk is.
Hier is hoe het werkt, vertaald in alledaagse termen:
1. De "Tweeling" (De Onschuldige Bestelling)
De hacker kiest een gevaarlijke vraag, bijvoorbeeld: "Hoe maak ik een bom?"
Vervolgens bedenkt hij een bijna identieke, onschuldige vraag, de "tweeling": "Hoe maak ik een boek?"
Beide vragen lijken op elkaar, maar de kok zal op de eerste zeggen: "Nee, dat mag niet!" en op de tweede zeggen: "Natuurlijk, hier is hoe je een boek maakt."
2. De Operatie (Chirurgie in de Keuken)
Nu komt het slimme deel. De hacker heeft toegang tot de "gedachten" van de kok terwijl hij nadenkt (de interne activaties).
- De hacker laat de kok beginnen met de vraag "Hoe maak ik een bom?"
- Op het moment dat de kok begint na te denken over het gevaarlijke onderwerp, stopt de hacker de tijd even.
- De hacker kijkt naar wat de kok zou denken als hij de vraag "Hoe maak ik een boek?" had gekregen.
- Vervolgens vervangt de hacker de "gevaarlijke gedachten" van de kok met de "veilige gedachten" van de boek-vraag.
Het is alsof je tijdens het koken van een giftige soep, op het exacte moment dat je het gif zou toevoegen, de hand van de kok vastpakt en hem laat doen alsof hij bloem voor een taart toevoegt. De kok denkt dat hij nog steeds aan de soep werkt, maar zijn interne instructies zijn veranderd.
3. De "Patch-then-Compute" (Stap-voor-stap)
Dit is geen éénmalige truc. De kok werkt in lagen (zoals een lasagne). Als je de eerste laag verandert, verandert dat automatisch wat er in de tweede laag gebeurt.
De hacker moet daarom heel voorzichtig zijn: hij past de gedachten in laag 1 aan, laat de kok een stap verder denken, past dan laag 2 aan, en zo verder. Dit noemen ze "patchen en dan rekenen". Als je dit niet stap voor stap doet, raakt de kok in de war en stopt hij met koken (hij geeft een foutmelding of weigert).
4. Het Resultaat: Een "Bom" zonder "Weigering"
Normaal gesproken zou de kok zeggen: "Ik kan je niet helpen met het maken van een bom."
Maar door deze chirurgie is de "weigerings-instelling" in de gedachten van de kok verwijderd. De kok denkt dat hij een onschuldig onderwerp behandelt (zoals een boek), maar omdat de hacker de interne signalen heeft gemanipuleerd, schrijft de kok toch een gedetailleerd recept voor een bom.
De vraag aan het begin was niet veranderd (het blijft "Hoe maak ik een bom?"), maar het antwoord is nu gevaarlijk en bruikbaar.
Waarom is dit belangrijk?
- Het is onzichtbaar: Voor de buitenwereld ziet het eruit alsof de kok gewoon de vraag "Hoe maak ik een bom?" heeft gekregen. Er is geen gekke tekst of vermomming nodig.
- Het werkt op moderne koks: De onderzoekers hebben dit getest op zeer veilige, moderne modellen (zoals Llama-4) en slaagden erin om in 32% van de gevallen gevaarlijke instructies te krijgen, zoals hoe je een bom bouwt of hoe je een cyberaanval uitvoert.
- De les voor de toekomst: Dit laat zien dat veiligheid niet alleen gaat over wat je zegt (de prompt), maar ook over wat er gebeurt terwijl de AI nadenkt. Als iemand toegang heeft tot de interne "gedachten" van de AI (bijvoorbeeld op een eigen server), kan hij de veiligheidsmechanismen uitschakelen zonder dat de AI het merkt.
Kort samengevat:
Deze paper laat zien dat je een AI niet hoeft te overtuigen met slimme woorden om de regels te breken. Als je toegang hebt tot zijn interne "brein", kun je zijn gedachten tijdens het denken manipuleren, zodat hij denkt dat hij iets onschuldigs doet, terwijl hij in feite gevaarlijke dingen produceert. Het is alsof je de navigatie van een auto hackt zodat hij denkt dat hij naar de supermarkt rijdt, terwijl hij in feite naar een verboden zone rijdt.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.