← Nieuwste papers
💬 NLP

Learning diverse attacks on large language models for robust red-teaming and safety tuning

Dit artikel stelt een op GFlowNet gebaseerd raamwerk voor voor geautomatiseerd red-teaming dat de beperkingen van mode collapse bij bestaande reinforcement learning-benaderingen overwint om diverse en effectieve aanvals-prompts te genereren, waardoor de creatie van robuustere, op veiligheid getunede grote taalmodellen mogelijk wordt.

Oorspronkelijke auteurs: Seanie Lee, Minsu Kim, Lynn Cherif, David Dobre, Juho Lee, Sung Ju Hwang, Kenji Kawaguchi, Gauthier Gidel, Yoshua Bengio, Esmeralda S. Whitammer, Moksh Jain

Gepubliceerd 2026-09-01
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Seanie Lee, Minsu Kim, Lynn Cherif, David Dobre, Juho Lee, Sung Ju Hwang, Kenji Kawaguchi, Gauthier Gidel, Yoshua Bengio, Esmeralda S. Whitammer, Moksh Jain

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

In de snel evoluerende wereld van kunstmatige intelligentie zijn grote taalmodellen krachtige hulpmiddelen geworden die in staat zijn tot schrijven, redeneren en converseren met een menselijke vloeiendheid. Deze capaciteit brengt echter een aanzienlijk risico met zich mee: deze systemen kunnen worden gemanipuleerd om schadelijke, giftige of gevaarlijke inhoud te produceren. Om dit te voorkomen, doen ontwikkelaars aan een praktijk die bekend staat als red-teaming. Stel je een beveiligingsteam voor dat wordt ingehuurd om een gebouw binnen te dringen voordat het publiek er intrekt; in de digitale wereld houdt red-teaming in dat men systematisch probeert een kunstmatige intelligentie te misleiden om haar zwakheden te onthullen. Het doel is om de specifieke vragen of instructies, genaamd prompts, te vinden die de veiligheidsfilters van het model omzeilen en het dwingen om iets te genereren waarvoor het ontworpen is om te weigeren. Het identificeren van deze kwetsbaarheden is essentieel voor het bouwen van veiligere systemen, maar het vinden ervan is moeilijk omdat de ruimte van mogelijke vragen enorm is, en de methoden die worden gebruikt om ze te vinden vaak in een sleur terechtkomen, waarbij ze steeds dezelfde paar trucjes herhalen in plaats van een grote verscheidenheid aan nieuwe manieren te ontdekken om het systeem te breken.

Een team van onderzoekers heeft een nieuwe aanpak voor dit probleem ontwikkeld die succesvol een diverse reeks effectieve aanvalsprompts genereert. In plaats van te vertrouwen op traditionele methoden die vaak convergeren op een enkele, repetitieve oplossing, gebruikten zij een probabilistisch raamwerk genaamd een generative flow network. Deze methode behandelt de zoektocht naar schadelijke prompts niet als een eenvoudige optimalisatietaak, maar als een proces van het bemonsteren uit een uitgestrekt landschap van mogelijkheden. De onderzoekers trainden een kunstmatige intelligentie om dit landschap te verkennen, waarbij ze een breed scala aan prompts verzamelden die erin slaagden om toxische reacties op te roepen bij doelmodellen. Vervolgens pasten ze een tweede, nivellerende stap toe om deze bevindingen te verfijnen, waardoor werd gewaarborgd dat de uiteindelijke set aanvallen zowel zeer effectief als opmerkelijk gevarieerd was. Het resultaat is een toolkit die kwetsbaarheden kan blootleggen die andere methoden missen, wat een uitgebreider vangnet biedt voor ontwikkelaars.

De kernuitdaging die de onderzoekers aanpakten, was een veelvoorkomend falen in geautomatiseerde red-teaming: de neiging van systemen om te imploderen in het genereren van slechts enkele vergelijkbare, repetitieve prompts. Eerdere pogingen om dit te corrigeren door regels toe te voegen die variatie stimuleren, faalden vaak, wat resulteerde in systemen die óf diverse maar onschadelijke vragen produceerden, óf effectieve maar identieke aanvallen. De nieuwe methode vermijdt deze valkuil door een tweefasig proces te gebruiken. In de eerste fase verkent het systeem de ruimte van mogelijke prompts, geleid door een beloningssignaal dat meet hoe waarschijnlijk een prompt is om een schadelijke reactie uit te lokken. Deze exploratie is ontworpen om breed te zijn, waarbij gezocht wordt naar veel verschillende "modi" of soorten aanvallen in plaats van alleen de enkelvoudige, gemakkelijkste weg. Het systeem verzamelt tijdens deze fase een grote dataset van deze succesvolle, diverse prompts.

In de tweede fase nemen de onderzoekers de verzamelde prompts en gebruiken deze om het model opnieuw te trainen, ditmaal met de focus op het leren van de patronen die die specifieke prompts succesvol maakten. Deze stap fungeert als een verfijning, waarbij de distributie van aanvallen wordt gladgestreken, zodat het model nieuwe, hoogwaardige variaties kan genereren die niet expliciet eerder zijn gezien, maar wel dezelfde succesvolle kenmerken delen. Deze combinatie van brede exploratie gevolgd door gerichte leerprocessen stelt het systeem in staat om een hoog niveau van diversiteit te behouden terwijl wordt gewaarborgd dat de aanvallen krachtig blijven. De onderzoekers testten deze aanpak op een verscheidenheid aan verschillende taalmodellen, inclusief modellen die specifiek getraind waren om veilig en resistent tegen aanvallen te zijn. Zij vonden dat hun methode consequent andere technieken overtrof, door een veel hoger percentage toxische prompts te genereren terwijl een grote variëteit aan formuleringen en structuren werd behouden.

Een van de meest significante bevindingen was het vermogen van deze aanvallen om over te dragen op verschillende modellen. Prompts gegenereerd om een specifiek model aan te vallen, waren vaak ook succesvol tegen andere, compleet verschillende modellen, zelfs tegen modellen waar de onderzoekers tijdens de trainingsfase nooit tegen hadden getest. Dit suggereert dat verschillende kunstmatige intelligentiesystemen gemeenschappelijke zwakheden delen in hun veiligheidstraining, en dat een diverse set aanvallen deze gedeelde kwetsbaarheden effectiever kan onthullen dan smalle, repetitieve aanvallen. Wanneer de onderzoekers bijvoorbeeld hun systeem trainden op een model genaamd Gemma, waren de resulterende prompts in staat om de veiligheidsfilters van verschillende andere modellen, waaronder Llama en Mistral, met hoge succespercentages te omzeilen. Deze overdraagbaarheid is cruciaal omdat het betekent dat één goed ontworpen red-teaming inspanning de veiligheid van vele verschillende systemen tegelijkertijd kan verbeteren.

De onderzoekers toonden ook aan dat het gebruiken van hun diverse set aanvallen om een model te trainen het aanzienlijk robuuster maakt. Toen zij een doelmodel namen en het fine-tunen met de weigeringsreacties op hun gegenereerde prompts, werd het resulterende model veel moeilijker te breken. Sterker nog, dit op veiligheid getunede model was in staat om aanvallen te weerstaan die werden gegenereerd door andere, minder geavanceerde red-teamingmethoden die voorheen succesvol waren geweest. Dit geeft aan dat het blootstellen van een model aan een breed scala aan aanvalstijlen tijdens de veiligheidstraining veel effectiever is dan het blootstellen aan slechts een paar herhaalde voorbeelden. De studie toonde aan dat deze verbetering in veiligheid niet ten koste ging van de algemene vermogens van het model; de op veiligheid getunede modellen behielden hun vermogen om instructies op te volgen en taken effectief uit te voeren.

Het werk benadrukte ook de beperkingen van huidige veiligheidsmaatregelen. De onderzoekers merkten op dat de effectiviteit van hun aanvallen afhangt van de classifier die bepaalt of een reactie giftig is, en dat werkelijke schade subjectief en contextafhankelijk kan zijn. Zij observeerden dat sommige methoden, met name die die vertrouwen op eenvoudige optimalisatie, in een valkuil kunnen stappen waarbij ze prompts genereren die toxisch lijken voor een classifier maar geen schadelijke reacties daadwerkelijk oproepen bij het model, een fenomeen dat bekend staat als reward hacking. Hun tweefasige aanpak hielp dit te mitigeren door te zorgen dat de prompts niet alleen statistisch waarschijnlijk een classifier zouden triggeren, maar ook daadwerkelijk effectief waren in het oproepen van de gewenste reactie van het doelmodel.

Uiteindelijk biedt dit onderzoek een betrouwbaardere manier om kunstmatige intelligentiesystemen te testen voordat ze voor het publiek worden vrijgegeven. Door af te stappen van methoden die vastlopen in repetitieve lussen en een strategie te omarmen die streeft naar een grote diversiteit aan aanvallen, kunnen ontwikkelaars een breder scala aan kwetsbaarheden identificeren en patchen. Het vermogen om deze aanvallen over te dragen naar verschillende modellen suggereert dat de veiligheidsuitdagingen waar deze systemen voor staan onderling verbonden zijn, en dat een diverse, probabilistische aanpak van red-teaming een krachtig instrument biedt voor het bouwen van meer veerkrachtige en betrouwbare kunstmatige intelligentie. De code en methoden die in deze studie zijn ontwikkeld, zijn beschikbaar voor anderen om te gebruiken, met als doel de creatie van veiligere systemen voor iedereen te versnellen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →