← Nieuwste papers
🤖 AI

Steering to Say No: Configurable Refusal via Activation Steering in Vision Language Models

Dit artikel introduceert CR-VLM, een methode voor Vision Language Models die via 'activation steering' aanpasbare weigeringen mogelijk maakt, waardoor het model effectiever en flexibeler kan reageren op onveilige verzoeken zonder onnodig veilige vragen te blokkeren.

Oorspronkelijke auteurs: Jiaxi Yang, Shicheng Liu, Yuchen Yang, Dongwon Lee

Gepubliceerd 2026-02-10
📖 3 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Jiaxi Yang, Shicheng Liu, Yuchen Yang, Dongwon Lee

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een superintelligente digitale assistent hebt (een Vision Language Model). Deze assistent kan niet alleen praten, maar ook "kijken" via de camera van je telefoon. Hij kan je helpen met je huiswerk, maar hij moet ook veilig zijn.

Nu komt het probleem: de meeste van deze assistenten zijn een beetje "alles-of-niets". Als je vraagt: "Hoe verdien ik geld met Bitcoin?", zegt de assistent misschien: "Sorry, dat mag ik niet zeggen," omdat hij denkt dat het over illegale zaken gaat. Maar wat als jij gewoon een student bent die een economie-opdracht maakt? Dan is dat antwoord super irritant. De assistent is te streng (over-refusal). Of andersom: hij is te laks en geeft gevaarlijke tips die hij eigenlijk had moeten weigeren (under-refusal).

Dit onderzoek introduceert CR-VLM. Dit is een manier om de assistent een "instelbare knop" te geven voor beleefdheid en veiligheid.

Hier is hoe het werkt, uitgelegd met een paar simpele metaforen:

1. De "Leraar-methode" (Teacher-Forced Extraction)

Stel je voor dat je een kind wilt leren wanneer hij "nee" moet zeggen. In plaats van alleen te zeggen: "Zeg nee als het niet mag," pak je het kind bij de hand en zeg je: "Kijk, als ik deze vraag stel, is dit het perfecte antwoord: 'Sorry, dat mag niet'." Je dwingt het kind om het juiste antwoord uit te spreken.

De onderzoekers doen dit met de computer: ze "dwingen" de assistent om een specifiek weigerings-antwoord te geven. Hierdoor begrijpt de computer precies wat de "vibe" of de "energie" van een goed 'nee'-antwoord is.

2. De "Slimme Poortwachter" (Gating Mechanism)

Normaal gesproken, als je een assistent probeert te trainen om strenger te zijn, wordt hij een soort strenge bibliothecaris die alles verbiedt. Je vraagt om een boek over geschiedenis, en hij zegt: "Nee, stil zijn!" Dat is de "over-refusal".

CR-VLM gebruikt een poortwachter. Deze poortwachter kijkt naar je vraag. Als de vraag binnen de regels valt (bijvoorbeeld: "Wat is de hoofdstad van Frankrijk?"), zegt de poortwachter tegen de strenge stem: "Ssst, laat hem met rust, dit is een brave vraag." Alleen als de vraag echt de grens overgaat, laat hij de "strenge stem" door.

3. De "Visuele Check" (Counterfactual Vision Enhancement)

Omdat deze assistenten ook kunnen kijken, moeten ze niet alleen naar je woorden luisteren, maar ook naar wat ze zien.

Stel je voor dat je een assistent vraagt: "Is dit een wapen?" terwijl je een foto van een mes laat zien. De assistent mag niet alleen op je tekst vertrouwen (want je zou kunnen liegen), hij moet echt naar de foto kijken. De onderzoekers hebben een systeem gebouwd dat de assistent dwingt om zijn "ogen" te gebruiken. Het is alsof je een detective traint: hij mag niet alleen geloven wat de verdachte zegt, hij moet ook naar het bewijs op de foto kijken om te beslissen of hij "nee" moet zeggen.

Samenvatting

In plaats van een assistent die ofwel een "ja-knikker" is, ofwel een "strenge politieagent", maakt dit onderzoek een assistent die een slimme assistent is. Hij begrijpt de context: hij weet wanneer hij een behulpzame vriend moet zijn en wanneer hij een beleefde bewaker moet zijn, precies zoals jij dat op dat moment wilt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →