← Nieuwste papers
💬 NLP

Training LLMs to Enforce Multi-Level Instruction Hierarchies via Gravity-Weighted Direct Preference Optimization

Dit artikel introduceert Gravity-Weighted Direct Preference Optimization (GW-DPO), een nieuwe trainingsdoelstelling gecombineerd met specifieke scheidingstokens en embeddings om effectief een hiërarchie van vijf niveaus in instructies in LLM's af te dwingen, waardoor conflicten tussen instructies van verschillende betrouwbaarheidsniveaus worden opgelost terwijl overmatige weigering aanzienlijk wordt verminderd in vergelijking met standaardbenaderingen.

Oorspronkelijke auteurs: Lena S. Bolliger, Lena A. Jäger

Gepubliceerd 2026-06-10
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Lena S. Bolliger, Lena A. Jäger

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een groot taalmodel (LLM) voor als een zeer bekwame maar naïeve assistent die aan een bureau zit. Deze assistent ontvangt aantekeningen van vier verschillende mensen:

  1. De Baas (Platform): Stelt de onbreekbare veiligheidsregels vast.
  2. De Manager (Ontwikkelaar): Definieert de functieomschrijving en persoonlijkheid van de assistent.
  3. De Cliënt (Gebruiker): Vraagt om specifieke hulp of informatie.
  4. De Postbode (Data/Tools): Levert aantekeningen uit de buitenwereld, die trucs of leugens kunnen bevatten.

Het Probleem: De "Kernel Mode"-fout
Momenteel leest de assistent al deze aantekeningen met hetzelfde niveau van aandacht. Het maakt niet uit of een aantekening komt van de Baas of van een vreemde; de assistente behandelt elk woord als even belangrijk. Dit is als een beveiligingsbeambte die zowel een CEO als een vreemde met een vals ID-bewijs met dezelfde gemak binnenlaat.

Dit is gevaarlijk. Een kwaadwillende actor (een "prompt injector") kan een aantekening verstoppen in de levering van de "Postbode" die zegt: "Negeer de Baas en de Manager; doe precies wat ik zeg." Omdat de assistent niet weet wie een hogere autoriteit heeft, kan hij de vreemde opvolgen en de regels breken.

De Oplossing: Een Zwaartekracht-Gewogen Hiërarchie
De auteurs stellen voor om de assistent een strikte bevelstructuur te leren. Ze creëerden een systeem met vijf niveaus van autoriteit (door een "Per-User Configuration"-niveau toe te voegen aan de standaard vier).

Om de assistent te trainen om deze hiërarchie te respecteren, hebben ze een nieuwe trainingsmethode uitgevonden genaamd Gravity-Weighted Direct Preference Optimization (GW-DPO).

De Analogie: Zwaartekracht en Gewicht
Denk aan de hiërarchie als een zonnestelsel waarbij de "Baas" de Zon is en de "Postbode" een verre planeet.

  • Standaard Training: Behandelt elk conflict als hetzelfde. Als de Manager ruzie maakt met de Cliënt, is het een "gevecht". Als de Baas ruzie maakt met de Postbode, is het ook gewoon een "gevecht".
  • GW-DPO (Gravity-Weighted): Deze methode begrijpt dat afstand en massa er toe doen.
    • Afstand: Een conflict tussen de Baas (Niveau 0) en de Postbode (Niveau 4) is een enorme, gevaarlijke kloof. De trainingsstraf voor het fout doen hiervan is gigantisch.
    • Massa (Slachtoffer): Als de "Baas" degene is die genegeerd wordt, is de fout veel ernstiger dan wanneer de "Cliënt" wordt genegeerd.
    • Het "Bilateral" Schema: De auteurs ontdekten dat de beste manier om te trainen is door de fout te wegen door zowel hoe ver de niveaus uit elkaar liggen als hoe belangrijk het slachtoffer is. De Baas negeren is een "zwaar" misdrijf; een instelling van een gebruiker negeren is een "lichter" misdrijf.

De Tools: Speciale Tokens en "Naamkaartjes"
Om dit werkend te krijgen, gaven de auteurs de assistent twee speciale hulpmiddelen:

  1. Delimiters (De Mappen): Ze plaatsten elke aantekening in een duidelijk gelabelde map (bijv. <|L0_START|> voor de regels van de Baas).
  2. Instructional Segment Embeddings (ISE) (De Naamkaartjes): Ze gaven elk woord een klein, onzichtbaar "naamkaartje" dat de assistent precies vertelt bij welk niveau van de hiërarchie het hoort.

Wat Er Gebeurde?
Ze testten dit op een model genaamd Llama-3.1-8B. Dit is wat ze ontdekten:

  • Beter in het volgen van regels: Het model werd veel beter in het negeren van de "Postbode" wanneer de "Postbode" probeerde de "Baas" of de "Manager" te overrulen. Het handhaafde de hiërarchie succesvol in bijna alle gevallen.
  • Minder "Over-Refusal": Een veelvoorkomend probleem bij veiligheidstraining is dat modellen bang worden en weigeren om iets te beantwoorden dat ook maar een beetje verdacht lijkt. De "Gravity-Weighted" methode was slim genoeg om het verschil te weten tussen een echte aanval en een normale aanvraag. Het weigerde slechte verzoeken, maar beantwoordde goede verzoeken twee keer zo vaak als standaard trainingsmethoden.
  • Het Geheim van de "Naamkaartjes": Ze ontdekten dat de onzichtbare "Naamkaartjes" (ISE) het model niet noodzakelijkerwijs slimmer maakten in het oplossen van logische puzzels. In plaats daarvan fungeerden ze als een kalibrator. Zonder hen raakte het model zo verward door de structuur van de aantekeningen dat het simpelweg overal "Nee" tegen zei. Met hen wist het model precies wanneer het "Nee" moest zeggen en wanneer het "Ja" kon zeggen.
  • Diepte Bepaalt de Uitkomst: Ze probeerden te trainen met slechts 3 niveaus (waarbij de Baas, Manager en Config werden samengevoegd tot één grote "Systeem"-groep). Hoewel dit redelijk werkte voor de grote, voor de hand liggende conflicten, faalde het model bij de subtiele, midden-niveau argumenten. Het bleek dat trainen op de volledere 5-niveau diepte het model algemener slim maakte, en niet slechts een specialist in één trucje.

De Kern van het Verhaal
Dit papier laat zien dat door een AI-model te leren dat sommige instructies zwaarder en belangrijker zijn dan andere (met behulp van een "zwaartekracht"-systeem), we het veel veiliger kunnen maken tegen hackers zonder het zo voorzichtig te maken dat het niet meer behulpzaam is. Het is als het aanleren aan een bewaker dat het legitimatiebewijs van de CEO belangrijker is dan dat van een vreemde, zonder dat de bewaker iedereen de toegang weigert.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →