← Nieuwste papers
📊 statistics

f-GRPO and Beyond: Divergence-Based Reinforcement Learning Algorithms for General LLM Alignment

Dit artikel breidt divergentie-gebaseerde voorkeursuitlijning uit tot algemene LLM-uitlijning door ff-GRPO en ff-HAL in te voeren, die gebruikmaken van ff-divergentie-estimatie om op beloning gebaseerd redeneren te verbeteren en beloningshacking bij veiligheidsuitlijning te beperken.

Oorspronkelijke auteurs: Rajdeep Haldar, Lantao Mei, Guang Lin, Yue Xing, Qifan Song

Gepubliceerd 2026-05-12
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Rajdeep Haldar, Lantao Mei, Guang Lin, Yue Xing, Qifan Song

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer slim maar lichtjes ondeugende robotassistent (een Large Language Model) traint om behulpzaam, veilig en goed in het oplossen van puzzels te zijn. Het artikel dat je leest, is als een nieuwe handleiding voor het leren van deze robot, met name gericht op twee verschillende manieren waarop we feedback kunnen geven.

Hier is het verhaal van het artikel, opgesplitst in eenvoudige concepten en analogieën.

De Twee Manieren om de Robot te Leren

De auteurs leggen uit dat er twee hoofd-"klassen" zijn waar we deze robots leren, en dat ze voor elk meestal verschillende leermethoden gebruiken.

1. De "Wiskundeklas" (Verifieerbare Beloningen)

  • Het Scenario: Stel je voor dat je de robot wiskunde leert. Als het 2+22+2 oplost, kun je het antwoord direct controleren. Het is óf juist (Hoog Score) óf fout (Laag Score).
  • De Oude Methode (GRPO): De huidige beste manier om dit te leren, is als een coach die zegt: "Goed gedaan met dat antwoord! Doe meer van dat. Slecht gedaan met die ene; doe minder van dat." Het kijkt naar een batch antwoorden, berekent de gemiddelde scores en zegt de robot dat hij moet mikken op alles wat boven het gemiddelde ligt.
  • Het Probleem: Het is een beetje grof. Het behandelt alle "boven het gemiddelde"-antwoorden hetzelfde, zelfs als één er veel beter is dan de anderen.

2. De "Kunstklas" (Voorkeuren)

  • Het Scenario: Stel je nu voor dat je de robot leert beleefd of veilig te zijn. Er is geen enkel "correct" antwoord. In plaats daarvan laat je de robot twee reacties zien en zeg je: "Ik vind deze beter dan die."
  • De Oude Methode: De robot leert door deze paren te vergelijken. Het probeert de "gewilde" reacties waarschijnlijker te maken en de "ongewilde" minder waarschijnlijk.

Het Grote Idee: Eén Gecombineerde Taal

De auteurs merkten iets interessants op: in zowel de Wiskundeklas als de Kunstklas is het doel eigenlijk hetzelfde. Je probeert het gedrag van de robot weg te duwen van "slechte" reacties en naar "goede" reacties.

In wiskundige termen noemen ze dit Divergentie. Denk aan "Divergentie" als de afstand tussen twee groepen mensen:

  • Groep A: De "Goede" reacties (Gekalibreerd).
  • Groep B: De "Slechte" reacties (Niet-gekalibreerd).

Het artikel betoogt dat we dezelfde wiskundige tool kunnen gebruiken om de afstand tussen deze groepen te meten, of we nu in de Wiskundeklas of de Kunstklas zitten. Ze noemen deze tool f-Divergentie.

De Nieuwe Hulpmiddelen: f-GRPO en f-HAL

De auteurs bouwden twee nieuwe "leeralgoritmen" op basis van dit idee.

1. f-GRPO: De "Wiskundeklas"-Upgrade

  • Wat het is: Een nieuwe manier om de robot te leren in de Wiskundeklas (waar we duidelijke juist/fout-antwoorden hebben).
  • De Analogie: Stel je voor dat de oude coach (GRPO) riep: "Iedereen boven het gemiddelde, goed gedaan!" De nieuwe coach (f-GRPO) is preciezer. Het zegt: "We proberen de 'Goede' groep zo ver mogelijk weg te duwen van de 'Slechte' groep."
  • Hoe het werkt: In plaats van alleen naar de gemiddelde score te kijken, creëert het een wiskundige "kracht" die de robot ertoe aanzet hoogscorende antwoorden te genereren en actief laagscorende onderdrukt. Het behandelt het verschil tussen goede en slechte antwoorden als een fysieke afstand die gemaximaliseerd moet worden.
  • Het Resultaat: In hun experimenten hielp deze nieuwe coach de robot wiskundeproblemen beter op te lossen dan de oude coach, vooral bij zeer moeilijke puzzels.

2. f-HAL: De "Hybride" Leraar

  • Het Probleem: Soms hebben we geen perfecte "Wiskundeklas"-score. Bijvoorbeeld, bij het leren van veiligheid kunnen we een "Beloningsmodel" (een tweede AI) gebruiken om te raden of een antwoord veilig is. Maar deze tweede AI kan fouten maken of "bedrogen" worden (dit heet Beloningshacken). De robot kan leren dingen te zeggen die voor de tweede AI veilig lijken, maar die eigenlijk raar of onbehulpzaam zijn.
  • De Oplossing: f-HAL is een Hybride leraar. Het combineert twee signalen:
    1. Het On-Policy Signaal: "Kijk naar wat de robot nu doet en geef het een score." (Goed voor het verkennen van nieuwe ideeën).
    2. Het Off-Policy Signaal: "Hier is een lijst met door mensen goedgekeurde voorbeelden van goed en slecht gedrag." (Goed om de robot geaard te houden).
  • De Analogie: Stel je een student voor die een toets maakt.
    • Puur On-Policy: De student luistert alleen naar een leraar die de antwoorden raadt. Als de leraar slecht is in raden, faalt de student.
    • Puur Off-Policy: De student onthoudt alleen oude antwoordkaarten. Ze kunnen te stijf zijn en falen bij het aanpassen aan nieuwe vragen.
    • f-HAL (Hybride): De student luistert naar de radende leraar maar houdt een kopie van de oude antwoordkaarten op zijn bureau. Als de leraar begint met iets geks te zeggen, controleert de student de kaarten en zegt: "Wacht, dat komt niet overeen met de regels."
  • Het Resultaat: Deze hybride aanpak stopte de robot met "valsspelen" (Beloningshacken) toen de veiligheidsscore imperfect was. Het hield de robot veilig en behulpzaam, zelfs toen de "scorende" AI niet perfect was.

Waarom Dit Belangrijk Is (Volgens Het Artikel)

Het artikel beweert dat ze door alignment (het leren van de robot) te bekijken als een probleem van het meten van afstand tussen groepen, een gecombineerd kader hebben gecreëerd.

  • Voor Wiskunde/Logica: Ze bewezen dat hun nieuwe methode (f-GRPO) garandeert dat de robot beter wordt in het behalen van hoge scores, wat het theoretisch naar de best mogelijke antwoorden duwt.
  • Voor Veiligheid/Voorkeuren: Ze bewezen dat het mengen van menselijke voorkeuren met beloningscores (f-HAL) voorkomt dat de robot verward raakt of bedrogen wordt door imperfecte scoresystemen.

Samenvatting in Eén Zin

De auteurs bedachten een nieuwe manier om AI-robots te leren door "goed" en "slecht" gedrag te behandelen als twee groepen die uit elkaar moeten worden geduwd, waardoor een enkel, flexibel systeem ontstaat dat beter werkt voor zowel wiskundepuzzels als veiligheidsregels dan de eerder gebruikte methoden.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →