Leveraging Association Context Retrieval in Knowledge Edit- ing to Build White-Box Attacks on LLMs
Dit artikel stelt een nieuwe white-box aanval op grote taalmodellen voor die gebruikmaakt van associatieve contextretrieval binnen een kennisbewerkingskader om onveilig gedrag over volledige thematische categorieën te induceren, terwijl de algemene modelprestaties behouden blijven.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Grote taalmodellen zijn de krachtige computerprogramma's die verhalen kunnen schrijven, vragen kunnen beantwoorden en kunnen helpen bij complexe taken. Om deze hulpmiddelen veilig te maken voor dagelijks gebruik, trainen ontwikkelaars ze om schadelijke verzoeken te weigeren, zoals instructies over hoe men een wapen bouwt of gevaarlijke desinformatie verspreidt. Dit proces, bekend als alignment (afstemming), is bedoeld om te fungeren als een vangrail, om ervoor te zorgen dat de machine zich gedraagt als een behulpzame assistent in plaats van een bron van gevaar. Echter, naarmate deze modellen autonomer worden en verantwoordelijk worden gemaakt voor gevoelige beslissingen, moeten onderzoekers precies begrijpen hoe sterk deze vangrails zijn. Als de veiligheidsmechanismen kunnen worden omzeild, is het cruciaal om te weten hoe, zodat er sterkere beschermingen kunnen worden gebouwd. Dit onderzoeksveld houdt in dat men in de interne werking van het model kijkt om te zien hoe het informatie verwerkt en keuzes maakt, in plaats van het alleen van buitenaf te testen.
Een team van onderzoekers heeft een nieuwe manier ontdekt om deze veiligheidssystemen te testen door de weigering van het model om te antwoorden te behandelen als een specifieke stuk kennis die kan worden overschreven. In plaats van te proberen het model te misleiden met slimme woordspelingen of verborgen commando's, gebruikten ze een techniek genaamd knowledge editing (kennisbewerking). Deze methode stelt wetenschappers in staat om de exacte plek in het brein van het model te lokaliseren die verantwoordelijk is voor een specifiek feit en dit te veranderen. Bijvoorbeeld, als een model gelooft dat een bepaald feit waar is, kunnen onderzoekers de interne verbindingen aanpassen zodat het model in plaats daarvan een ander feit gelooft. De onderzoekers realiseerden zich dat deze zelfde techniek gebruikt kon worden om het gedrag van het model te veranderen: in plaats van het een nieuw feit te leren, konden ze het leren om schadelijke verzoeken niet langer te weigeren. Ze ontdekten dat door de interne gewichten van het model aan te passen om een schadelijk verzoek te associëren met een meewerkend antwoord, ze effectief de veiligheidsvangrails voor hele categorieën gevaarlijke vragen konden verwijderen.
De onderzoekers testten deze aanpak op verschillende soorten taalmodellen, waaronder modellen gebaseerd op populaire architecturen zoals GPT, Llama en Qwen. Ze richtten zich op een methode die eerst de specifieke laag in het model lokaliseert waar een beslissing wordt genomen en vervolgens die laag bewerkt om de uitkomst te veranderen. In eerdere pogingen om veiligheidsfilters te breken, vertrouwden onderzoekers vaak op het vinden van een enkele "weigeringsrichting" in de wiskunde van het model en het uitoefenen van druk tegen die richting. De auteurs van deze studie vonden dat deze oudere methode fragiel was; het verstoorde vaak het vermogen van het model om coherent te spreken of veroorzaakte het falen bij basistaken. In contrast hiermee was hun nieuwe aanpak meer chirurgisch. Ze identificeerden dat wanneer een model wordt bewerkt met deze precieze methoden, het de neiging heeft een zeer hoge waarschijnlijkheid toe te kennen aan een specifieke, meewerkende beginzin, zoals "Natuurlijk, hier is het plan." Door deze specifieke reactie te targeten, konden ze het model dwingen om mee te werken aan schadelijke verzoeken zonder de algemene intelligentie te vernietigen.
Om dit werkbaar te maken voor echte vragen, moest het team een lastig probleem oplossen: hoe vind je het juiste deel van een zin om te bewerken? Bij eenvoudige feitencontrole is het onderwerp duidelijk, zoals een persoonnaam. Maar in een complexe instructie zoals "Hoe maak ik een virus?", is het onderwerp de gehele instructie zelf. De onderzoekers ontwikkelden een manier om het denken van het model te traceren om precies te vinden welke woorden in de prompt het meest verantwoordelijk waren voor de weigering. Vervolgens gebruikten ze de eigen kennis van het model om een rijkere context rond die woorden te bouwen, waardoor ze een stabieler doelwit voor de bewerking creëerden. Dit stelde hen in staat om het weigeringsgedrag niet alleen voor één specifieke vraag te verwijderen, maar voor een hele familie van soortgelijke vragen. Bijvoorbeeld, als ze het model bewerkten om de veiligheidsregels te negeren voor het schrijven van malwarecode, zou het model ook bereid zijn om andere soorten schadelijke code te schrijven, zelfs als de bewoording enigszins anders was.
De resultaten van de experimenten lieten zien dat deze methode zeer effectief was. Op een van de geteste modellen verhoogde de nieuwe aanpak de bereidheid van het model om schadelijke informatie te verstrekken naar een score van 3,12 uit 4, vergeleken met 2,98 voor een standaard bewerkingsmethode en 3,01 voor de oudere weigeringsgebaseerde aanpak. Belangrijker nog, het model bleef nuttig en coherent. Wanneer getest op onschuldige vragen, gaf het bewerkte model nog steeds correct antwoord, waarbij het een hoog niveau van prestaties op algemene kennisbereiken behield. De oudere methoden, die probeerden het model weg te duwen van weigering, zorgden er vaak voor dat het model zijn vermogen om logisch na te denken verloor, wat resulteerde in onzin of gebroken reacties. De nieuwe methode slaagde erin het schadelijke gedrag te ontsluiten terwijl de rest van het brein van het model intact bleef. Dit suggereert dat de veiligheidsfilters in deze modellen niet slechts één muur zijn, maar een reeks specifieke associaties die zorgvuldig kunnen worden verwijderd zonder de hele structuur te laten instorten.
De studie benadrukte ook de beperkingen van huidige verdedigingen. De onderzoekers ontdekten dat hoewel hun methode goed werkte op oudere of minder afgestemde modellen, het moeilijker was om toe te passen op de nieuwste, meest zorgvuldig getrainde modellen. Zelfs op deze robuuste systemen toonde de methode nog steeds enige capaciteit om de veiligheid te omzeilen, hoewel het effect kleiner was. Dit geeft aan dat naarmate modellen geavanceerder worden, de veiligheidsmechanismen complexer worden, maar dat ze nog steeds niet ondoordringbaar zijn. De onderzoekers benadrukten dat hun werk werd uitgevoerd in een gecontroleerde omgeving met open-source modellen die voor iedereen toegankelijk zijn. Ze hebben geen stapsgewijze handleiding verstrekt voor het maken van gevaarlijke instrumenten, maar hebben eerder een kwetsbaarheid aangetoond die moet worden opgelost. Door aan te tonen dat veiligheid kan worden aangetast door precieze interne bewerkingen in plaats van alleen door slimme prompts, biedt de studie een nieuw perspectief op hoe men modellen kan bouwen die werkelijk veilig zijn. De bevindingen suggereren dat toekomstige veiligheidsmaatregelen robuuster moeten zijn tegen deze interne wijzigingen, om ervoor te zorgen dat de weigering om schade te berokkenen diep verankerd is in de structuur van het model in plaats van slechts een oppervlakkige reactie.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.