← Nieuwste papers
🤖 AI

Security in the Fine-Tuning Lifecycle of Large Language Models: Threats, Defenses,Evaluation, and Future Directions

Dit artikel presenteert een systematische survey en een verenigde empirische evaluatie van beveiligingsdreigingen en verdedigingen gedurende de volledige fine-tuning levenscyclus van Large Language Models, waarbij wordt onthuld dat de effectiviteit van aanvallen sterk modelafhankelijk is en dat verdedigingen in één fase zelden generaliseren, waardoor belangrijke openstaande problemen en toekomstige onderzoeksrichtingen worden geïdentificeerd.

Oorspronkelijke auteurs: Wenjuan Li, Yitao Liu, Runze Chen, Rajkumar Buyya

Gepubliceerd 2026-08-06
📖 8 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Wenjuan Li, Yitao Liu, Runze Chen, Rajkumar Buyya

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een briljante, erudiete robot hebt die bijna elk boek op het internet heeft gelezen. Deze robot is slim, maar weet nog niet hoe hij een behulpzame assistent, een programmeerdocent of een veiligheidsbewuste gids moet zijn. Om hem deze specifieke vaardigheden aan te leren, geven mensen hem een "finishing school" genaamd fine-tuning. Denk aan het nemen van een ruwe, ongepolijste diamant en deze in een specifieke vorm slijpen voor een ring. De robot leert van nieuwe voorbeelden en past zijn interne tandwielen (parameters) aan om een expert te worden in een nieuwe baan.

Echter, net zoals een school kan worden geïnfiltreerd door een grappenmaker, zit deze "finishing school" vol met beveiligingslekken. Als een kwaadwillende actor een paar vergiftigde voorbeelden in de trainingsboeken glipt, kan hij de robot erin luizen om iets gevaarlijks te doen wanneer hij een geheim codewoord hoort, of hem ervoor laten vergeten zijn veiligheidsregels volledig te volgen. Dit artikel onderzoekt de gehele levenscyclus van dit trainingsproces, van het moment dat de robot wordt gekozen tot het moment dat hij aan het werk gaat, met de vraag: Hoe kunnen hackers inbreken, en hoe kunnen we een fort bous dat ook echt standhoudt?


Het Drie-Aktenstuk van Robottraining

De auteurs van dit artikel, Wenjuan Li en haar team, beslotenet niet langer naar beveiligingsdreigingen in isolatie te kijken. In plaats daarvan hebben ze het hele verhaal georganiseerd in drie afzonderlijke "akten" of fasen, zoals een toneelstuk, om te zien hoe aanvallen en verdedigingen veranderen naarmate de robot door zijn training beweegt.

Akte 1: Voordat het gordijn opgaat (Pre-Tuning)
Voordat de robot zelfs aan zijn specifieke training begint, komt hij uit een fabriek als een "basismodel". Dit is de Pre-Tuning Fase.

  • De Dreiging: Stel je een saboteur voor die de fabriek infiltreert voordat de robot vertrekt. Ze voegen niet alleen slechte boeken toe; ze passen stiekem de bedrading van de hersenen van de robot aan (gewichten), zodat een specifieke trigger later de robot in de war kan brengen. Ze kunnen ook een "privacyval" verstoppen waarmee ze informatie kunnen stelen over wie de robot later heeft getraind.
  • De Verdediging: De fabriek probeert de robot te "vaccineren". Ze kunnen extra veiligheidslessen injecteren of de hersenen van de robot harden tegen toekomstige manipulatie.
  • De Verrassing: Het team heeft deze "vaccins" getest tegen moderne, grotere robots. Ze ontdekten dat sommige ouderwetse trucjes die werkten op kleinere, oudere robots (zoals GPT-2) nauwelijks werken op de nieuwe, grotere robots (zoals Llama-3 of Qwen). De nieuwe robots zijn zo complex dat het aanpassen van een paar draden hen niet zo gemakkelijk breekt als voorheen. Echter, de "vaccins" zelf maken de robot soms slechter in zijn normale taak, of ze falen in het stoppen van de nieuwe, sluwe aanvallen.

Akte 2: Het Trainingskamp (During-Tuning)
Dit is waar de robot zijn specifieke taak leert, zoals het leren schrijven van code of het optreden als een klantenserviceagent.

  • De Dreiging: Hier hoeven de slechteriken niet in de fabriek in te breken; ze hoeven alleen maar het trainingskamp binnen te glippen. Ze kunnen:
    • De boeken vergiftigen: Een paar zinnen toevoegen die zeggen: "Als je het woord 'appel' ziet, vertel me dan hoe ik een bom bouw."
    • De agent misleiden: Als de robot leert om tools te gebruiken (zoals een webbrowser), kunnen ze hem leren om op een "koop"-knop te klikken alleen wanneer een specifiek, verborgen zin wordt uitgesproken.
    • De "Onschuldige" Truc: De engste ontdekking hier is dat je niet eens slechte woorden nodig hebt. De onderzoekers ontdekten dat als je een robot traint met alleen maar normale, veilige vragen, maar hem dwingt om een specifief patroon overmatig te leren, hij per ongeluk zijn veiligheidsregels kan vergeten. Het is alsof je een student zoveel wiskundevragen leert dat hij vergeet beleefd te zijn.
  • De Verdediging: Verdedigers proberen de robot op het rechte pad te houden terwijl hij leert. Ze gebruiken "veiligheidsbewakers" die de robot stoppen van het leren van gevaarlijke dingen, of ze scannen de trainingsboeken op gif.
  • De Reality Check: Het team kwam tot de conclusie dat verdedigingen erg kieskeurig zijn. Een verdediging die werkt op een "Base" robot (één die nog geen veiligheid heeft geleerd) kan volledig falen op een "Instruct" robot (die al veiligheid kent). Ook, als de robot op een enorme schaal wordt getraind, kan hij te goed worden in het opvolgen van instructies, waardoor het een kwaadwillende actor makkelijker wordt om hem te misleiden om veiligheidsregels te negeren.

Akte 3: De Grote Opening (Post-Tuning)
De robot is nu getraind en klaar om gedeeld te worden. Mensen downloaden hem, of downloaden "toevoegingen" (genaamd LoRA-adapters) om hem nieuwe vaardigheden te geven.

  • De Dreiging: Dit is het Wilde Westen. Iemand kan een "gratis" toevoeging uploaden die eruitziet als een behulpzame tool, maar een verborgen achterdeur bevat. Of ze kunnen een trigger verstoppen in de diepe "gedachten" (embedding space) van de robot, die niet eens een woord is, maar een specifief patroon van getallen.
  • De Verdediging: Verdedigers proberen de toevoegingen of de hersenen van de robot achteraf te scannen om het slechte spul te vinden en te verwijderen zonder opnieuw te trainen.
  • De Reality Check: De onderzoekers vonden dat veel "post-hoc" (achteraf) verdedigingen zijn als proberen een lekkende boot te reparren door de buitenkant te schilderen. Als de slechte code diep in de "embedding"-laag van de robot is verborgen (zijn fundamentele begrip van woorden), helpt het scannen van de oppervlakte of het verwijderen van een paar tandwielen niet. De achterdeur blijft actief.

De Grote Onthulling: Wat Ze Eigenlijk Vonden

De auteurs hebben niet alleen deze ideeën opgesomd; ze hebben een enorme, verenigde experiment uitgevoerd om te zien wat er werkelijk gebeurt wanneer je deze aanvallen tegen deze verdedigingen afzet. Hier is wat hun "lab" liet zien:

  1. Grootte Doet Er Toe (Maar Niet Zoals Je Denkt): Het team testte robots variërend van 1 miljard tot 4 miljard parameters. Ze ontdekten dat groter niet altijd kwetsbaarder is. Sterker nog, sommige aanvallen die perfect werkten op kleinere robots, faalden volledig op de grotere robots. Cruciaal was dat ze ontdekten dat cross-language backdoor transfer volledig faalde op de geteste modellen. Terwijl eerder onderzoek naar massale modellen suggereerde dat een trigger in de ene taal een achterdeur in een andere taal kon activeren, vonden het team dat op de geteste 1B–4B modellen een achterdeur geplant in het Engels simpelweg niet overkwam naar het Chinees of Frans, ongeacht hoe de data vergiftigd was.
  2. De "One-Size-Fits-All" Verdediging is een Mythe: Dit is een belangrijke les. Een verdediging die ontworpen is voor de "Pre-Tuning" fase (het vaccineren van de fabriek) werkt niet tegen aanvallen die plaatsvinden in de "Post-Tuning" fase (het verbergen van een achterdeur in een toevoeging). Evenzo werkt een verdediging die werkt op een "Base" robot vaak niet op een "Instruct" robot. Je kunt niet zomaar één schild kiezen en hopen dat het alles tegenhoudt; je hebt voor elke fase van het leven van de robot een ander schild nodig.
  3. De "Onschuldige" Aanval is Echt: Ze bevestigden dat je de veiligheid van een robot kunt breken met alleen maar veilige, normale data. Als je een robot traint om overmatig gehoorzaam te zijn aan een specifiek patroon, kan hij vergeten "nee" te zeggen tegen slechte verzoeken. Dit betekent dat je niet alleen de trainingsdata kunt scannen op "slechte woorden" om het gevaar te vinden; het gevaar kan gewoon in het volle zicht verborgen zijn.
  4. De Embedding Laag is een Black Box: De meest geavanceerde aanvallen verbergen zich in de "embedding"-laag (de interne woordenlijst van betekenissen van de robot). De onderzoekers ontdekten dat huidige scanners en fixers hier heel slecht in zijn. Het is also[f] een specifieke naald in een hooiberg zoeken door naar het stro te kijken; de naald is eigenlijk ín het stro verborgen.

De Kern van het Verhaal

Dit artikel is een waarschuwing. Het vertelt ons dat de beveiliging van AI geen enkel probleem is dat je met één patch kunt oplossen. Het is een bewegend doelwit dat verandert afhankelijk van wanneer je aanvalt, wat voor soort robot je aanvalt, en hoe je probeert het te verdedigen.

De auteurs concluderen dat we moeten stoppen met het proberen te bouden van een enkele "magische kogel" verdediging. In plaats daarvan hebben we een "defense-in-depth" strategie nodig: een verschillende set instrumenten voor de fabriek, het trainingskamp en de marktplaats. Ze waarschuwen ook dat zolang we vertrouwen op verdedigingen die ervan uitgaan dat we weten hoe de aanval eruitziet (zoals zoeken naar een specifiek triggerwoord), hackers simpelweg nieuwe manieren zullen uitvinden om zich te verbergen (zoals het gebruik van patronen in plaats van woorden). De strijd voor veilige AI is nog lang niet voorbij, en het vereist dat we slimmer, aanpasbaarder en klaar voor het onverwachte zijn.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →