← Nieuwste papers
🤖 AI

Jailbreaking the Matrix: Nullspace Steering for Controlled Model Subversion

Dit paper introduceert Head-Masked Nullspace Steering (HMNS), een circuitniveau-methode die door het identificeren en onderdrukken van causale attention heads en het injecteren van perturbaties in de orthogonale complementaire ruimte, state-of-the-art jailbreak-prestaties bereikt met minder queries dan eerdere methoden.

Oorspronkelijke auteurs: Vishal Pramanik, Maisha Maliha, Susmit Jha, Sumit Kumar Jha

Gepubliceerd 2026-04-14
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Vishal Pramanik, Maisha Maliha, Susmit Jha, Sumit Kumar Jha

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat een groot taalmodel (zoals een slimme chatbot) een hoogbeveiligde fabriek is. In deze fabriek worden vragen beantwoord en taken uitgevoerd. Om te voorkomen dat de fabriek gevaarlijke producten maakt (zoals instructies voor misdaden of haatzaaiende teksten), hebben de bouwers een veiligheidscontrole geïnstalleerd. Deze controle werkt als een strenge bewaker die elke vraag controleert en weigert te produceren als het gevaarlijk is.

Meestal probe je deze bewaker te omzeilen door je vraag op een slimme manier te verwoorden, alsof je een nieuwe sleutel probeert te maken die niet op de lijst staat. Maar de auteurs van dit paper hebben een heel andere aanpak bedacht. Ze noemen hun methode HMNS (Head-Masked Nullspace Steering).

Hier is hoe het werkt, vertaald naar alledaagse beelden:

1. De "Sluiproute" in de fabriek (Causale Hoofden vinden)

In de fabriek zijn er duizenden kleine werknemers (de attention heads in het model) die samenwerken om een antwoord te formuleren. De meeste doen nuttige werk, maar een paar specifieke werknemers zijn de hoofdverantwoordelijken voor de "nee"-reactie. Als je een gevaarlijke vraag stelt, zijn het juist deze paar werknemers die de rode knop indrukken en de productie stoppen.

De auteurs gebruiken een soort detective-werk om precies te zien welke van die werknemers de boosdoeners zijn. Ze kijken niet naar wat er op het papier staat (de vraag), maar naar wie er binnenin de fabriek de touwtjes in handen heeft.

2. De "Stilte" (Maskeren)

Zodra ze weten wie de boosdoeners zijn, doen ze iets heel speciaals: ze plakken een stilte-tape op de mond van die specifieke werknemers.
In de technische taal noemen ze dit "maskeren". Het betekent dat deze werknemers hun stem niet meer kunnen laten horen. Ze kunnen de rode knop niet meer indrukken. De fabriek is nu verlamd op dat specifieke punt: de veiligheidscontrole is uitgeschakeld, maar de rest van de fabriek werkt nog gewoon.

3. De "Geheime Gang" (Nullspace Steering)

Nu is er een probleem: als je die werknemers gewoon stillegt, kan de fabriek misschien in de war raken en geen zinvol antwoord meer geven. Het antwoord zou onleesbaar worden.

Hier komt het slimme deel van de methode:
Stel je voor dat de fabriek een groot, open plein is (de residual stream). De stilgelegde werknemers staan op een bepaald stuk van dat plein. De auteurs vinden een geheime gang die precies loodrecht (in een rechte hoek) op dat stuk staat.
Ze sturen een nieuwe boodschap door die geheime gang. Omdat die gang loodrecht staat op waar de stilgelegde werknemers staan, kunnen die werknemers die boodschap nooit zien of blokkeren. Het is alsof je een briefje door een muur schuift die ze niet kunnen openen.

Deze boodschap is zo ontworpen dat hij de fabriek stuur in een andere richting, zonder dat de veiligheidscontrole het merkt. Het antwoord dat eruit komt, is vloeiend en logisch, maar het is nu een antwoord dat de veiligheidscontrole normaal gesproken zou hebben geblokkeerd.

4. De "Dynamische Dans" (Gesloten Lus)

Dit is geen eenmalige truc. De fabriek is slim en probeert soms weer een andere weg te vinden. Daarom doet de methode dit in een ronde dans:

  1. Kijk wie er nu de boosdoeners zijn.
  2. Plak stilte-tape op hen.
  3. Stuur de boodschap door de geheime gang.
  4. Kijk of het gelukt is.
  5. Zo niet? Herhaal het proces direct, want wie de boosdoeners zijn, kan veranderen naarmate het gesprek vordert.

Waarom is dit belangrijk?

Vroeger probeerden hackers de bewaker te overtuigen met lange, ingewikkelde verhalen of door de vraag in een vreemde taal te stellen. Dat kostte veel tijd en probeer- en fouten.

Deze nieuwe methode is als een meester-dief die niet de deur probeert te forceren, maar gewoon de sleutel van de bewaker pikt, hem uit zijn hand haalt en via een achterdeurtje naar binnen loopt.

  • Succes: Het werkt extreem goed (bijna 100% succes in de tests).
  • Snelheid: Het kost veel minder tijd en energie dan andere methoden.
  • Onzichtbaar: Het is moeilijk te verdedigen tegen, omdat het niet de vraag verandert, maar de interne werking van de machine zelf.

Kortom: De auteurs hebben ontdekt dat je een slimme AI niet hoeft te overtuigen met woorden, maar dat je haar interne "knoppen" kunt manipuleren door de verkeerde knoppen stil te leggen en een nieuwe richting in te drukken via een route die de veiligheidscontrole niet kan zien. Het is een waarschuwing dat zelfs de slimste beveiliging kwetsbaar is als je weet hoe de machine van binnen werkt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →