← Nieuwste papers
💻 computer science

The Linear Geometry of Interpretable Tokens: Jailbreaking Attacks and Defenses for Unlearned Diffusion Models

Dit artikel onthult dat gewiste concepten in ontleerde diffusiemodellen voortbestaan als coherente lineaire subruimten binnen token-embeddings, wat leidt tot de ontwikkeling van SubAttack, een krachtige jailbreaking-methode die deze structuur exploiteert, en SubDefense, een lichtgewicht mechanisme dat de subruimte projecteert om resterende schadelijke concepten robuust te onderdrukken terwijl de kwaliteit van de generatie behouden blijft.

Oorspronkelijke auteurs: Siyi Chen, Yimeng Zhang, Sijia Liu, Qing Qu

Gepubliceerd 2026-08-17
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Siyi Chen, Yimeng Zhang, Sijia Liu, Qing Qu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een wereld voor waarin computers schilderijen kunnen maken door simpelweg naar je woorden te luisteren. Je zegt: "een kat met een hoed," en poef, er verschijnt een perfecte afbeelding. Dit worden Diffusiemodellen genoemd, en het zijn als digitale kunstenaars die hebben geleerd te creëren door miljoenen foto's te bestuderen. Maar soms worden deze kunstenaars een beetje té goed in het onthouden van dingen die ze niet zouden moeten onthouden. Als je ze vraat om iets gevaarlijks of auteursrechtelijk beschermd te tekenen, doen ze dat misschien toch. Om dit op te lossen, hebben wetenschappers een proces uitgevonden genaamd "Unlearning" (ontleren). Denk aan een leraar die probeet een student een specifiek feit te laten vergeten, zoals de hoofdstad van een land, zonder dat de student vergeet hoe hij moet rekenen of lezen. Het doel is om het "slechte idee" uit het brein van de computer te wissen, terwijl de mogelijkheid om de rest te tekenen behouden blijft. Maar hier komt de lastige kant bij: zelfs nadat de leraar heeft gezegd: "Vergeet dat feit," kan het zijn dat de student nog steeds een geheime manier heeft om het te onthouden, verborgen op een manier die we niet gemakkelijk kunnen zien. Dit paper duikt in dat mysterie en vraagt: Als we denken dat we een slecht idee hebben gewist, waar verbergt het zich dan eigenlijk, en hoe kunnen we het eindelijk definitief verwijderen?

De onderzoekers in dit paper ontdekten dat wanneer een diffusiemodel probeert een schadelijk concept te "ontleren" (zoals naaktheid of de stijl van een specifieke kunstenaar), het dit niet echt verwijdert. In plaats daarvan verbergt het concept zich in een geheime, lineaire subspace binnen het geheugen van de computer. Om een metafoor te gebruiken: stel je voor dat het brein van de computer een enorme bibliotheek vol woorden is. Wanneer we proberen het boek over "Naaktheid" te verwijderen, verbrandt de computer het boek niet. In plaats daarvan versnippert de computer de pagina's en verbergt de snippers in een specifieke, onzichtbare lade in de bibliotheek. Het paper laat zien dat deze snippers nog steeds georganiseerd zijn in een nette, voorspelbare lijn. De auteurs noemen deze verborgen lade een "residual subspace".

Om dit te bewijzen, creëerde het team een nieuwe tool genaamd SubAttack. In plaats van willekeurige woorden te gebruiken om de computer te misleiden (wat is hoe eerdere hackers probeerden), werkt SubAttack als een meesterbibliothecaris die precies weet waar die onzichtbare lade zich bevindt. Het leert een speciale set "magische sleutels" (wat simpelweg combinaties van normale woorden zijn) die de lade openen. Wanneer ze deze sleutels gebruikten, begon de "ontleerde" computer onmiddellijk weer de schadelijke afbeeldingen te tekenen, wat bewees dat het concept nooit echt weg was. Wat fascinerend is, is dat deze sleutels gemaakt zijn van woorden die wij kunnen begrijpen. Om bijvoorbeeld de computer weer een "naakte" persoon te laten tekenen, kunnen de sleutels een mix zijn van woorden als "slaaf", "heupen" en "huid". Dit laat zien dat de computer de slechte gedachte nog steeds verbindt aan deze gerelateerde, verborgen aanwijzingen.

Het paper vond ook dat deze geheime lade niet slechts in één computer zit; het zit in veel verschillende "ontleerde" modellen. Als je de sleutel voor het ene model vindt, werkt deze vaak ook op anderen. Dit suggereert dat de manier waarop deze computers "vergeten" op een zeer vergelijkbare manier gebrekkig is. Ze verwijderen het geheugen niet; ze verbergen het alleen op een manier die een rechte, voorspelbare lijn volgt.

Maar het verhaal eindigt niet met de hack. Omdat de onderzoekers precies begrepen hoe het concept zich verborg, bouwden ze een schild genaamd SubDefense. Als SubAttack de sleutel is die de lade opent, dan is SubDefense een metalen plaat die die lade dichtlast. Het werkt door de volledige bibliotheek van woorden van de computer wiskundig "weg te projecteren" van die geheime lade. Het is alsoast de bibliothecaris vertellen: "Welk woord je ook gebruikt, zorg ervoor dat het nooit richting die specifieke verborgen lade wijst."

De resultaten waren indrukwekkend. Wanneer ze SubDefense gebruikten, werd de computer veel moeilijker te misleiden. Zelfs wanneer hackers probeerden de oude methoden of de nieuwe SubAttack-sleutels te gebruiken, weigerde de computer de schadelijke afbeeldingen te tekenen. Tegelijkertijd verloor de computer niet zijn vermogen om veilige, mooie plaatjes te tekenen. Sterker nog, de afbeeldingen die de computer daarna tekende, waren net zo hoogwaardig als daarvoor. Het paper suggereert dat hoewel we het concept misschien nog niet perfect kunnen wissen, we tenminste het specifieke pad kunnen blokkeren dat het gebruikt om weer naar buiten te glippen. Dit geeft ons een nieuwe, heldere manier om te begrijpen waarom "unlearning" zo moeilijk is en biedt een praktische, plug-and-play oplossing om deze digitale kunstenaars veiliger te maken voor iedereen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →