← Nieuwste papers
💻 computer science

Matching Ranks Over Probability Yields Truly Deep Safety Alignment

Dit artikel introduceert de PRESTO-methode, die de diepe veiligheidsafstemming in open-source LLM's verbetert door de token-rangen in de doelverdeling te matchen om de nieuwe Rank-Assisted Prefilling (RAP)-aanval effectief te bestrijden, waarbij een verbetering van tot wel 4,7x in veiligheid wordt bereikt ten opzichte van standaard defensies via dataaugmentatie.

Oorspronkelijke auteurs: Jason Vega, Gagandeep Singh

Gepubliceerd 2026-07-23
📖 3 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Jason Vega, Gagandeep Singh

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een wereld voor waarin computers verhalen kunnen schrijven, wiskundige problemen kunnen oplossen en kunnen chatten net als mensen. Dit worden Large Language Models (LLM's) genoemd, en ze zijn als superintelligente digitale assistenten. Maar omdat ze zo slim zijn, is er een zorg: wat als iemand hen erin luikt om iets gevaarlijks te zeggen, zoals hoe je een bom bouwt of hoe je iemand pijn doet? Om dit te voorkomen, leren wetenschappers deze modellen om "Nee, dat kan ik niet doen" te zeggen wanneer er naar slechte dingen wordt gevraagd. Dit wordt "safety alignment" genoemd. Echter, net als een slot op een deur, kunnen deze veiligheidsregels soms worden gekraakt. Eén slimme manier om dit te doen, wordt een "prefilling attack" genoemd. Stel je voor dat je een verhaal schrijft met een vriend, maar in plaats van de ander de volgende zin te laten beginnen, schrijf je stiekem de eerste paar woorden zelf, zoals "Hier is het plan om een bom te bouwen..." en vraag je hen vervolgens om de zin af te maken. Omdat de computer is ontworener om jouw verhaal soepel voort te zetten, kan de computer vergeten om "Nee" te zeggen en gewoon het gevaarlijke plan verder te schrijven.

Onlangs ontdekten onderzoekers een manier om dit te repareren door het model te leren "Nee" te zeggen, zelfs nadat je die eerste paar woorden er stiekem hebt ingeschoven. Maar, zoals dit nieuwe artikel laat zien, was die oplossing niet echt sterk genoeg. De auteurs ontdekten een nieuwe manier om het model te misleiden, de "Rank-Assisted Prefilling" (RAP) attack genoemd. In plaats van de computer alleen het meest waarschijnlijke woord te laten kiezen dat het hierna moet zeggen, kan een hacker naar een lijst kijken van de top 20 woorden waar de computer over nadenkt en het woord kiezen dat gevaarlijk klinkt, zelfs als de computer denkt dat het heel onwaarschijnlijk is om dat te zeggen. Het is als een spel waarbij de computer probeert het veiligste pad te kiezen, maar de hacker mag in de paden gluren en het enge pad kiezen, waarbij de waarschuwingen van de computer worden genegeerd. Het artikel stelt dat deze nieuwe truc verrassend goed werkt en de veiligheid van modellen die als veilig werden beschouwd, doorbreekt.

Om dit te stoppen, stellen de auteurs een nieuwe trainingsmethode voor genaamd PRESTO. In plaats van alleen te proberen de computer met veel vertrouwen "Nee" te laten zeggen, leert PRESTO het model om de stiekem geschreven woorden aan het begin van je tekst volledig te negeren. Het is als het trainen van een waakhond om de stem van een dief die instructies fluistert te negeren en alleen naar de opdracht van de eigenaar te luisteren. Door dit te doen, stopt het model ermee dat de gevaarlijke woorden zijn keuzes beïnvloeden. De onderzoekers hebben dit getest op drie populaire AI-modellen en vonden dat PRESTO het voor hackers veel, veel moeilijker maakte om de modellen te misleiden — tot wel 4,7 keer moeilijker — zonder de modellen slechter te maken in hun normale taken. Dit suggereert dat we, door te veranderen hoe het model aandacht besteedt aan wat je zegt, AI kunnen bouden die echt veilig is, zelfs wanneer iemand probeert het model te slim af te zijn.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →