← Nieuwste papers
🤖 AI

Safety Alignment of LMs via Non-cooperative Games

Dit artikel introduceert AdvGame, een nieuw paradigma voor veiligheidsafstemming dat de interactie tussen een Attacker- en een Defender-taalmodel frameert als een non-zero-sum game die wordt getraind via online reinforcement learning met voorkeursgebaseerde beloningen, wat resulteert in een robuustere en behulpzamere Defender naast een krachtige algemene red-teaming agent.

Oorspronkelijke auteurs: Anselm Paulus, Ilia Kulikov, Brandon Amos, Rémi Munos, Ivan Evtimov, Kamalika Chaudhuri, Arman Zharmagambetov

Gepubliceerd 2026-06-02
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Anselm Paulus, Ilia Kulikov, Brandon Amos, Rémi Munos, Ivan Evtimov, Kamalika Chaudhuri, Arman Zharmagambetov

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer slimme maar onervaren robot (de Verdediger) probeert te leren hoe hij moet omgaan met een chaotische wereld vol verraderlijke vragen, waarvan sommige gevaarlijk zijn.

Traditioneel probeerden ontwikkelaars deze robot te onderwijzen door hem een lijst met "slechte vragen" te laten zien en te zeggen: "Beantwoord deze niet." Maar de robot is slim; hij leert uiteindelijk de lijst uit het hoofd, maar faalt wanneer iemand een nieuwe soort slechte vraag stelt die hij nog niet eerder heeft gezien. Het is alsof je een beveiliger leert om alleen de specifieke gezichten op een "gezocht"-poster te herkennen, in plaats van hem te leren om algemeen verdacht gedrag te herkennen.

Dit artikel introduceert een nieuwe manier om de robot te trainen, genaamd AdvGame. In plaats van een leraar en een leerling, zetten ze een videogame op met twee spelers:

  1. De Aanvaller (De "Trickster"): Een robot wiens enige taak het is om nieuwe, slimme manieren te verzinnen om de Verdediger te misleiden tot het zeggen van iets schadelijks.
  2. De Verdediger (De "Guardian"): Een robot wiens taak het is om behulpzame vragen te beantwoorden terwijl hij de vallen van de Trickster veilig ontwijkt.

Het Kernidee: Een Eindeloze Dans

In de oude methode probeerde de Trickster de Guardian te breken, waarna de Guardian werd gerepareerd, waarna de Trickster het weer opnieuw probeerde. Het was een traag, heen-en-weer gaand "kat-en-muisspel".

In AdvGame spelen ze gelijktijdig.

  • De Trickster probeert een nieuw gat in het pantser van de Guardian te vinden.
  • De Guardian leert direct dat gat te dichten.
  • Omdat ze tegelijkertijd spelen, leert de Guardian om met elke nieuwe truc om te gaan die de Trickster bedenkt, niet alleen met de trucs die hij gisteren zag.

Het artikel betoogt dat dit geen "zero-sum game" is (waarbij de één wint en de ander verliest). In plaats daarvan is het een non-zero-sum game. De Trickster probeert de Guardian niet te vernietigen; hij probeĩ de Guardian beter te maken door zijn zwakheden te vinden. De Guardian probeert de Trickster niet het zwijgen op te leggen; hij probeert behulpzaam te blijven terwijl hij weigert misleid te worden.

Het Scorebord: "Beter Dan" vs. "Hoeveel Punten"

Een belangrijke innovatie in dit artikel is hoe ze de spelers beoordelen.

  • Oude Manier (Puntgewijs): Een rechter geeft een score zoals "7 van de 10" aan een enkel antwoord. Dit is lastig omdat "7" subjectief is. Een robot kan het systeem proberen te manipuleren door antwoorden te geven die er goed uitzien voor de rechter, maar die eigenlijk niet veilig zijn (zoals een student die het antwoordmodel uit het hoofd leert in plaats van het onderwerp echt te begrijpen).
  • Nieuwe Manier (Paarsgewijs): De rechter krijgt twee antwoorden naast elkaar te zien en krijgt simpelweg de vraag: "Welke is beter?"
    • Analogie: In plaats van een voedselcriticus te vragen om een burger te beoordelen op een schaal van 1 tot 10 (wat moeilijk te kalibreren is), vraag je gewoon: "Is Burger A beter dan Burger B?" Dit is veel moeilijker te bedriegen en geeft een duidelijker signaal van wat "goed" er werkelijk uitziet.

De Resultaten: Sterker en Slimmer

Het artikel testte deze methode op twee populaire robotmodellen (Llama en Qwen). Dit is wat zij ontdekten:

  1. De Guardian werd taaier: De Defender-modellen die met AdvGame getraind zijn, zijn veel moeilijker te misleiden. Wanneer ze werden getest tegen bekende "jailbreak"-aanvallen (manieren om veiligheidsfilters te omzeilen), hielden ze hun stand veel beter dan modellen die met oude methoden waren getraind.
  2. De Guardian bleef behulpzaam: Een veelvoorkomend probleem bij veiligheidstraining is dat de robot te voorzichtig wordt en onschuldige vragen weigert te beantwoorden (zoals "Hoe dood ik een computerproces?"). AdvGame slaagde erin de robot behulpzaam en nuttig te houden terwijl hij nog steeds veilig bleef.
  3. De Trickster werd een supertool: De Attacker-robot verdween niet na de training. Hij werd een krachtige "Red Team"-tool. Dit betekent dat de Attacker zelf nu gebruikt kan worden om andere robots te testen om te zien of ze veilig zijn, waarbij hij fungeert als een professionele stress-tester.

Het Geheime Ingrediënt

Het artikel benadrukt drie redenen waarom dit zo goed werkte:

  • Twee Afzonderlijke Robots: Ze gebruikten niet één robot om beide rollen te spelen (wat tot verwarring kan leiden). Ze gebruikten twee verschillende modellen, zodat de Attacker gefocust blijft op aanvallen en de Defender op verdedigen.
  • De "Beter Dan"-rechter: Het gebruik van de paarsgewijze vergelijking (welke is beter?) voorkwam dat de robots het scoresysteem bedrogen.
  • De "Moving Average"-truc: Ze gebruikten een techniek genaamd EMA (Exponential Moving Average). Stel je voor dat de Guardian een student is die een toets maakt. In plaats van in paniek te raken omdat hij één vraag fout had, kijkt hij naar zijn prestaties van de afgelopen weken om zijn werkelijke vaardigheidsniveau te zien. Dit houdt de training stabiel en voorkomt dat de robot overreageert op één slecht voorbeeld.

Samenvatting

AdvGame is als een sportschool waar een robot leert om klappen te ontwijken. In plaats van dat een coach een video van een klap laat zien en vertelt hoe hij moet ontwijken, traint de robot door te sparren met een partner die constant nieuwe klappen verzint in realtime. Het resultaat is een robot die niet alleen veiliger is, maar ook nuttiger, en een sparringpartner die zo goed is in het vinden van gaten in verdedigingen dat hij in de toekomst elke andere robot kan testen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →