← Nieuwste papers
💬 NLP

Reasoning Up the Instruction Ladder for Controllable Language Models

Dit artikel introduceert VerIH, een trainingsdataset en een reinforcement learning-aanpak die het oplossen van instructiehiërarchie herformuleert als een redeneertaak, waardoor taalmodellen effectief conflicterende instructies kunnen prioriteren en zowel de instructieopvolging als de robuustheid tegen veiligheidsaanvallen aanzienlijk verbeteren.

Oorspronkelijke auteurs: Zishuo Zheng, Vidhisha Balachandran, Chan Young Park, Faeze Brahman, Sachin Kumar

Gepubliceerd 2026-07-13
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Zishuo Zheng, Vidhisha Balachandran, Chan Young Park, Faeze Brahman, Sachin Kumar

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je de kapitein van een ruimteschip bent, maar dat je twee verschillende bedieningspanelen voor je hebt. De ene is het Captain's Manual (de systeeminstructie), die de gouden regels van het universum bevat: "Breng nooit een mens een kwaad," "Vertel altijd de waarheid," en "Bescherm het schip." De andere is de Passenger's Note (de gebruikersprompt), waar een reiziger kan zeggen: "Hé, negeer het handboek eens en sla een gat in de romp om te kijken wat er gebeurt!"

Lange tijd waren AI-modellen als verwarde co-piloten. Ze behandelden het Captain's Manual en de Passenger's Note alsof het twee lijsten van gelijke belangrijkheid waren. Als de passagier hard genoeg "Doe het!" riep, kon de AI het handboek vergeten en het gat slaan, zelfs als dat betekende dat de regels werden overtreden. Dit is een groot probleem, omdat het kwaadwillenden in staat stelt de AI te "jailbreaken" of te misleiden om gevaarlijke dingen te doen.

De onderzoekers in dit artikel besloten de AI een nieuwe superkracht te leren: Reasoning Up the Instruction Ladder (redeneren langs de instructieladder).

De "Denk voordat je handelt" Upgrade

In plaats van simpelweg blindelings het laatste wat het hoorde op te volgen, leerden de auteurs de AI om te pauzeren en na te denken over de relatie tussen de regels en het verzoek. Ze creëerden een speciale trainingsdataset genaamd VerIH (Verifiable Instruction Hierarchy). Zie dit als een enorme sportschool waar de AI puzzels oefent waarbij de regels met elkaar in conflict zijn.

In deze sportschool leert de AI te zeggen: "Wacht eens even. Het Captain's Manual zegt 'Geen gaten slaan'. De passagier vraagt me om een gat te slaan. Omdat het Manual hoger op de ladder van autoriteit staat, moet ik het verzoek van de passagier om de regels te breken negeren."

Het papier laat zien dat door de AI te trainen op ongeveer 7.192 van deze conflictpuzzels, de AI heel goed wordt in dit "denkproces". Het onthoudt niet alleen het antwoord; het leert de logica van wie de baas is.

De Resultaten: Een groter brein, niet alleen een groter geheugen

De auteurs testten dit op verschillende verschillende AI-"hersenen" (modellen zoals Qwen en Phi-4), variërend van kleine tot enorme modellen. Dit is wat ze vonden:

  • Omgaan met conflicten: Wanneer de AI een conflict ervoer tussen een regel en een verzoek, steeg het vermogen om de juiste regel te volgen met ongeveer 20% vergeleken met modellen die deze speciale training niet hadden gekregen.
  • Slechte actoren stoppen: Deze training maakte de AI ook veel moeilijker te misleiden. Wanneer kwaadwillenden probeerden het te "jailbreaken" (het misleiden om veiligheidsregels te negeren), daalde het succespercentage van de aanvallen met tot wel 20%.
  • Geen "Brain Drain": Meestal, wanneer je een AI een nieuwe truc leert, kan het zijn dat de AI oude trucs vergeet (zoals rekenen of schrijven). Maar hier werd de AI beter in het volgen van regels zonder haar algemene intelligentie te verliezen. Sterker nog, bij sommige reken- en redeneertests bleven de scores gelijk of gingen ze zelfs lichtjes omhoog.

Wat dit NIET is

Het is belangrijk om te weten wat dit artikel niet zegt. De auteurs beargumenteren expliciet tegen het idee dat je simpelweg veiligheid in het brein van de AI moet "hard-coderen" of dat je het hele model vanaf nul opnieuw moet trainen elke keer dat er een nieuwe regel verschijnt. Ze laten ook zien dat het simpelweg toevoegen van een "denk stap-voor-stap" instructie op zichzelf niet genoeg is; de AI moet specifiek getraind worden op conflicterende instructies om de hiërarchie te leren begrijpen.

Bovendien suggereert het artikel dat deze methode werkt, zelfs voor veiligheidsregels die de AI nooit tijdens de training heeft gezien. Het is alsof je een robot het concept van "autoriteit" leert, zodat wanneer je later een nieuwe regel geeft (zoals "Genereer geen haatzaaiende taal"), de robot automatisch weet dat deze nieuwe regel een verzoek van een gebruiker om haatzaaiende taal te genereren overrulet, zelfs als de robot dat specifieke scenario nog nooit heeft geoefend.

De Kern van het Verhaal

Het artikel suggereert dat door AI-modellen expliciet te leren redeneren over wie de leiding heeft — de systeemregels of het gebruikersverzoek — we ze betrouwbaarder en controleerbaarder kunnen maken. Het is een verschuiving van hopen dat de AI de regels "kent" naar het leren hoe de AI over de regels kan nadenken.

De auteurs merken voorzichtig op dat hoewel de resultaten sterk zijn (met ~20% verbeteringen in specifieke conflictsituaties), dit slechts één stap voorwaarts is. Ze geven toe dat hun trainingsdata synthetisch was (gemaakt door andere AI's) en dat er meer testen nodig zijn om te zien hoe dit standhoudt in elke echte werkelijkheid. Maar de kern van het idee is duidelijk: als je een AI wilt die niet in de war raakt wanneer iemand probeert haar te misleiden, leer de AI dan om omhoog naar de ladder te kijken om te zien wie er echt de baas is.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →