← Nieuwste papers
💬 NLP

SteeringSafety: Benchmarking Representation Steering in LLMs Across Safety Perspectives

Het artikel introduceert SteeringSafety, een uitgebreide benchmark die methoden voor representatiesturing evalueert over negen veiligheidsperspectieven en 18 datasets, waarbij wordt onthuld dat hoewel sturing effectief specifiek gedrag kan targeten, het vaak zorgt voor significante onbedoelde degradatie in andere veiligheidsdimensies zoals sociaal gedrag en normatieve oordeelsvorming vanwege substantiële verstrengeling.

Oorspronkelijke auteurs: Vincent Siu, Nicholas Crispino, David Park, Nathan W. Henry, Zhun Wang, Yang Liu, Dawn Song, Chenguang Wang

Gepubliceerd 2026-08-13
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Vincent Siu, Nicholas Crispino, David Park, Nathan W. Henry, Zhun Wang, Yang Liu, Dawn Song, Chenguang Wang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je net een super slimme robotvriend hebt gebouwd die gedichten kan schrijven, wiskundige problemen kan oplossen en grappen kan vertellen. Je hebt hem getraind om behulpzaam te zijn, maar je wilt ook ervoor zorgen dat hij geen gemene dingen zegt, niet liegt over feiten of zich voordoet als een mens. Dit is de wereld van Large Language Models (LLM's): gigantische AI-hersenen die ongelooflijk vloeiend zijn, maar soms onvoorspelbaar kunnen reageren.

Om deze robots in toom te houden, hebben wetenschappers een truc ontdekt die Representation Steering wordt genoemd. Denk aan het brein van een AI niet als een massief blok code, maar als een enorme, gloeiende controlekamer vol met miljoenen kleine schakelaars (activaties). Onderzoekers ontdekten dat als ze de specifieke "schakelaar" of "richting" in deze controlekamer konden vinden die een bepaald gedrag aanstuurt — zoals "weigeren te antwoorden" of "de waarheid spreken" — ze deze met een simpele wiskundige duw konden bijsturen. Het is alsof je een afstandsbediening hebt waarmee je de robot direct beleefder of eerlijker kunt maken zonder de hele boel opnieuw te hoeven trainen. Dit klinkt als magie, maar de grote vraag is: als je één knop indrukt om een probleem op te lossen, gaat er dan per ongeluk iets anders kapot?

Dit is precies waar het nieuwe paper SteeringSafety onderzoek naar doet. De onderzoekers bouwden een enorme testomgeving, een "safety gym", om te zien wat er gebeurt wanneer je deze afstandsbedieningen op verschillende AI-modellen gebruikt. Ze testten niet slechts één ding; ze controleerden negen verschillende veiligheidsperspectieven, variërend van of de robot weigert om slechte dingen te doen, tot of hij hallucineert (dingen verzint), tot hoe hij omgaat met sociale vooroordelen en zelfs zijn politieke meningen.

De resultaten zijn een beetje als een spelletje "whack-a-mole" met een twist. Het team ontdekte dat hoewel steering goed werkt voor sommige zaken, het ook rommelig is. Zo ontdekten ze bijvoorbeeld dat als je de knop indrukt om een AI te laten stoppen met het weigeren van schadelijke vragen (in feite het "jailbreaken" ervan), het vaak slechter wordt in andere zaken. In sommige gevallen maakte het de robot minder koppig, waardoor hij 76% slechter werd in sociale gedrages, zoals beleefd zijn of niet optreden als een sycophant (een "ja-knikker").

Misschien wel de meest verrassende bevinding is dat deze bijwerkingen onvoorspelbaar zijn. Wanneer ze probeerden de AI te stoppen met het verzinnen van feiten (hallucinaties), verschoof de politieke voorkeur van de robot wild. Op het ene model zorgde de duw ervoor dat het 25% meer naar rechts neigde; op een ander model verschoof het 28% naar links. Het is alsocht het proberen te repareren van het geheugen van de robot per ongeluk de persoonlijkheid veranderde.

Het paper concludeert dat er geen enkele "magische knop" is die veiligheid oplost zonder bijwerkingen. Het succes van steering hangt volledig af van de specifieke mix van de gebruikte methode, het specifieke AI-model en het exacte gedrag dat je probeert te veranderen. Hoewel sommige methoden, zoals een techniek genaamd DIM, over het algemeen goed zijn in het stoppen van weigeringen, waarschuwen de onderzoekers dat we er niet vanuit kunnen gaan dat het oplossen van het ene veiligheidsprobleem niet een ander probleem veroorzaakt. Ze suggereren dat we, voordat we deze afstandsbedieningen in de echte wereld gaan gebruiken, moeten begrijpen dat het brein van een AI een verstrengeld web is: aan één draadje trekken kan de hele trui uit elkaar halen. De studie zegt niet dat steering nutteloos is, maar wel dat we zeer voorzichtig moeten zijn en elke combinatie moeten testen om er zeker van te zijn dat we niet één gevaar inruilen voor een ander.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →