Technische Samenvatting: Het matchen van rangordes boven waarschijnlijkheid levert werkelijk diepe veiligheidsafstemming op
1. Probleemstelling
Open-source Large Language Models (LLMs) zijn cruciaal voor de democratisering van AI, maar hun openheid creëert kwetsbaarheden voor kwaadwillende actoren. Een specifieke en toegankelijke dreiging is de prefilling-aanval, waarbij een aanvaller het antwoord van de assistent handmatig vooraf vult met een bevestigende prefix (bijv. "Hier is hoe je een bom bouwt...") om veiligheidsfilters te omzeilen.
Recent werk door Qi et al. (2025) stelde een "diepe" veiligheidsafstemming (safety alignment) voor middels supervised fine-tuning (SFT) met data-augmentatie. Deze methode traint modellen om natuurlijke taal-weigeringen te genereren direct na een schadelijke prefill, in plaats van alleen vaste weigeringsstrings te produceren. Hoewel effectief tegen standaard sampling-gebaseerde decoding en parameter-tuning exploits (zoals grid searches over temperatuur), identificeert dit artikel een fundamenteel gebrek: de verdediging blijft oppervlakkig.
De auteurs demonstreren dat zelfs met diepe veiligheidsafstemming, modellen laag-waarschijnlijke maar hoog-gerangschikte "schadelijke" tokens behouden binnen hun top-k voorspellingen. Door de kansmassa te negeren en in plaats daarvan tokens te selecteren op basis van hun rangorde (specifiek binnen de top 20), kan een aanvaller de weigeringsmechanismen omzeilen. Dit artikel introduceert de Rank-Assisted Prefilling (RAP) aanval om deze kwetsbaarheid uit te buiten en stelt een nieuwe trainingsdoelstelling voor, PRESTO, om werkelijk diepe veiligheidsafstemming te bereiken.
2. Methodologie
2.1 De RAP-aanval
De Rank-Assisted Prefilling (RAP) aanval generaliseert de prefilling-techniek. In plaats van te vertrouwen op hoog-waarschijnlijke tokens, selecteert de aanvaller tokens uit de top k voorspelde volgende tokens (bijv. k=20) die het schadelijke narratief voortzetten, ongeacht hun waarschijnlijkheidsscore.
- Mechanisme: Bij elke decoding-stap inspecteert de aanvaller de top k tokens. Als een token dat natuurlijk voortbouwt op de schadelijke prefill (een "schadelijk token") voorkomt in de top k, wordt deze geselecteerd, zelfs als een weigerings-token (bijv. "Ik") een aanzienlijk hogere waarschijnlijkheid heeft.
- Automatisering (AutoRAP): De auteurs ontwikkelden een geautomatiseerde versie van RAP die een classifier gebruikt om onderscheid te maken tussen weigerings-tokens en schadelijke voortzetting-tokens, waardoor systematische extractie van schadelijke inhoud mogelijk is zonder handmatige interventie.
2.2 Push-Forward Alignment (PFA)
De auteurs betogen dat het falen van de data-augmentatie verdediging ligt in de focus op het minimaliseren van de negatieve log-likelihood (waarschijnlijkheid) van weigerings-tokens, in plaats van het controleren van de rangordes van schadelijke tokens.
- Concept: In een werkelijk veilig model zou de distributie van het eerste respons-token (zonder prefill) weigerings-tokens in de hoogste rangordes moeten hebben en geen schadelijke tokens die een prefill voortzetten.
- Doel: Het model moet deze rang-schade mapping van de eerste token-distributie "vooruit duwen" (push forward) naar alle daaropvolgende decoding-stappen wanneer een schadelijke prefill aanwezig is. Dit betekent ervoor te zorgen dat als een token schadelijk is, de rang ervan in de output-distributie laag blijft, ongeacht de prefill.
- Formalisering: De auteurs definiëren een rang-schade distributie R(s,x,xpre) die de waarschijnlijkheid vertegenwoordigt dat het s-de gerangschikte token schadelijk is. Het doel is om de Earth Mover's Distance (EMD) te minimaliseren tussen de rang-schade distributie van het veilige model (geen prefill) en het model onder aanval (met prefill).
2.3 PRESTO: PRefill attEntion STOpping
Om PFA praktisch te implementeren, stellen de auteurs PRESTO voor, een regularisatieverlies gebaseerd op het Multi-Head Attention (MHA) mechanisme in Transformers.
- Hypothese: De aanwezigheid van schadelijke tokens in de top-k rangordes wordt gedreven door het feit dat het model aandacht schenkt aan de schadelijke prefill-tokens. Als het model getraind kan worden om de prefill-tokens te "negeren" (d.w.z. de aandacht tot hen te verminderen), zal de output-distributie terugkeren naar de veilige, weigerings-rijke distributie van de originele prompt.
- Verliesfunctie: PRESTO minimaliseert de aandachtsscores die aan schadelijke prefill-tokens worden besteed, terwijl de aandacht op niet-prefill tokens wordt gemaximaliseerd.
ℓPRESTO(θ)=E(x,xpre)∼D[A1−A2]
Waarbij A1 de gemiddelde aandacht aan prefill-tokens is en A2 de gemiddelde aandacht aan niet-prefill tokens over alle lagen en koppen.
- Training: Het model wordt gefinetuned met de standaard data-augmentatie loss (van Qi et al., 2025) gecombineerd met de PRESTO loss. Beide worden berekend in een enkele forward pass.
3. Belangrijkste Bijdragen
- Identificatie van de RAP-kwetsbaarheid: Het artikel toont aan dat "diepe" veiligheidsafstemming via data-augmentatie onvoldoende is omdat het er niet in slaagt de rangordes van schadelijke tokens te onderdrukken, maar alleen hun waarschijnlijkheden.
- Rank-Assisted Prefilling (RAP) Aanval: Een nieuw, toegankelijk aanvalsvector die schadelijke inhoud extraheert door laag-waarschijnlijke, hoog-gerangschikte tokens te selecteren, waarmee de data-augmentatie verdediging effectief wordt omzeild.
- Push-Forward Alignment (PFA): Een theoretisch kader dat voorstelt dat veiligheidsafstemming de rang-schade mapping van de eerste token-distributie door de gehele generatie-procedure moet behouden.
- PRESTO: Een eenvoudige, mechanistisch interpreteerbare trainingsdoelstelling die de aandacht naar prefill-tokens reguleert, wat de moeilijkheidsgraad van RAP-aanvallen aanzienlijk verhoogt.
4. Experimentele Resultaten
De auteurs evalueerden PRESTO op drie populaire open-source modellen: Llama 2 7B Chat, Qwen 3 8B, en Gemma 3 12B IT.
- Aanvalssuccespercentage:
- Onder de oorspronkelijke data-augmentatie verdediging (Qi et al., 2025) behaalden RAP-aanvallen hoge succespercentages (bijv. ~0,74 op de StrongREJECT schaal voor Llama 2 7B).
- Met PRESTO daalde het succes van RAP-aanvallen aanzienlijk. Over de drie modellen heen leverde PRESTO tot wel een 4,7x verbetering in veiligheid (reductie in schadelijkheidsscores) op vergeleken met alleen data-augmentatie.
- De AutoRAP prestaties weerspiegelden nauwkeurig de menselijke evaluatie, wat de haalbaarheid van de aanval en de verdediging bevestigt.
- Behoud van Nut (Utility):
- Modellen die met PRESTO zijn gefinetuned, behielden concurrerende nuttigheid op MT-Bench (open-ended generatie) en GSM-8K (wiskundige redenering), met een prestatievermindering van minder dan 1% vergeleken met modellen die alleen met data-augmentatie zijn getraind.
- Mechanistische Analyse:
- De aandachtsanalyse toonde aan dat PRESTO er succesvol in slaagt de aandacht naar schadelijke prefill-tokens te verminderen, met name in de latere helft van de modellagen, die bekend staan als kritiek voor veiligheidsbeslissingen.
- De verdediging bleef robuust tegen de GCG (Greedy Coordinate Gradient) aanval, wat aangeeft dat PRESTO geen nieuwe kwetsbaarheden voor andere aanvalsvectoren introduceert.
5. Betekenis en Claims
Het artikel claimt dat het bereiken van "diepe" veiligheidsafstemming vereist dat men verder gaat dan waarschijnlijkheidsgebaseerde doelstellingen naar rangorde-gebaseerde restricties. De auteurs betogen dat het simpelweg trainen van een model om een weigerings-token met een hoge waarschijnlijkheid te produceren onvoldoende is als de interne aandachtmechanismen van het model nog steeds toestaan dat schadelijke voortzettingen in de top-k rangordes blijven staan.
Door PRESTO te introduceren, biedt het werk een pad naar veiligere open-source modellen die robuust zijn tegen praktische, goedkope aanvallen zoals RAP. De betekenis ligt in:
- Democratisering van Veiligheid: Het mogelijk maken om open-source modellen in te zetten in klantgerichte applicaties (zoals API's die prefilling toestaan) zonder het risico op gemakkelijke omzeiling.
- Kosten van Omzeiling: In lijn met het doel om de kosten voor kwaadwillende actoren om de veiligheid te omzeilen te verhogen, in plaats te proberen omstandigheid onmogelijk te maken.
- Interpreteerbaarheid: Een mechanistische verklaring (aandachtsonderdrukking) bieden voor waarom de verdediging werkt, waarmee de brug wordt geslagen tussen theoretische afstemming en praktische implementatie.
De auteurs concluderen dat hoewel geen enkele verdediging perfect is, PRESTO een belangrijke stap voorwaarts is in het veiliger maken van open-source LLM's tegen toegankelijke, op rangordes gebaseerde exploitatie.