← Nieuwste papers
🤖 AI

Cross-Entropy Games and Frost Training

Dit artikel introduceert Frost Training, een nieuwe methode die gebruikmaakt van gradiënten van de beloningsfunctie in de inbeddingsruimte—voorheen toegepast voor jailbreaking—om Monte Carlo-gebaseerde beleidsoptimalisatie voor LLM-as-a-judge-taken te versnellen en te verbeteren, wat leidt tot output met hogere scores en snellere trainingsconvergentie.

Oorspronkelijke auteurs: Arthur Renard, Franck Gabriel, Valentin Hartmann, Clément Hongler

Gepubliceerd 2026-05-28
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Arthur Renard, Franck Gabriel, Valentin Hartmann, Clément Hongler

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robot leert een verhaal te schrijven. Je geeft het het begin van een zin en het einde, en vraagt het om het midden in te vullen. Dit wordt een "infilling"-taak genoemd.

Meestal gebruik je om de robot te leren een methode die Monte Carlo heet. Denk hierbij aan een spel van "gissen en controleren".

  1. De robot gist een middengedeelte.
  2. Een strenge leraar (de "Rechter") leest het en geeft een score.
  3. Als de score goed is, leert de robot; als het slecht is, probeert het opnieuw.
  4. De robot blijft willekeurig gissen tot het genoeg geluk heeft om een goed antwoord te vinden.

Het probleem is dat dit traag en verspillend is. De robot kan een vreselijke zin raden, een lage score krijgen, en vervolgens nog een andere vreselijke zin raden, zonder ooit te beseffen waarom het slecht was of hoe het op te lossen, enkel door naar de score te kijken.

Het Nieuwe Idee: "Frost Training"

De auteurs van dit artikel, van Xent Labs, stellen een nieuwe methode voor die Frost Training heet. Ze noemen het "Frost" als eerbetoon aan de dichter Robert Frost en zijn gedicht The Road Not Taken. Het idee is om de "wegen die niet werden genomen" door de robot te verkennen.

In plaats van alleen te wachten tot de robot een goed antwoord gist, gebruikt Frost Training een wiskundige truc om naar de "buurt" van elke gok te kijken die de robot maakt.

De Analogie: De Blinde Wandeltoerist versus de Gids met een Kompas

  • Standaard Training (GRPO): Stel je een blinde wandelaar voor die probeert de top van een berg te vinden. Ze zetten een stap, voelen of de grond hoger is, en als dat zo is, gaan ze door. Als ze in een gat stappen, gaan ze terug. Ze weten alleen van de plek waar ze staan.
  • Frost Training: Stel je dezelfde wandelaar voor, maar nu hebben ze een kompas dat in elke richting om hen heen een beetje omhoog wijst. Zelfs als de wandelaar in een vallei staat, zegt het kompas: "Hé, als je gewoon één stap naar links zou zetten, zou je hoger zijn."

In de taal van het artikel is dit "kompas" de gradient. Omdat de "Rechter" (het scoresysteem) een type AI is die wiskunde gebruikt (cross-entropy), heeft het een verborgen, gladde structuur. De onderzoekers realiseerden zich dat ze dit "kompas"-signaal konden berekenen om te zien hoe de score zou veranderen als de robot slechts één woord in zijn zin zou vervangen door een ander woord.

Hoe Het Werkt (Het "Frost-GRPO"-Algoritme)

Hier is het stap-voor-stap proces dat ze gebruiken, vereenvoudigd:

  1. De Gist: De robot (de "Speler") schrijft een paar verschillende middengedeelten voor het verhaal.
  2. De "Wat-Zou-Het-Zijn"-Scan: Voordat de leraar de antwoorden van de robot zelfs maar beoordeelt, scant het Frost-systeem elk enkel woord in die antwoorden snel. Het vraagt: "Wat als we dit woord vervangen door dat woord?"
    • Het gebruikt een snelle wiskundige afkorting (een Taylor-ontwikkeling) om de score van deze nieuwe, "wat-zou-het-zijn"-versies te schatten zonder ze volledig uit te schrijven.
  3. De Vervanging: Als de wiskunde zegt: "Het vervangen van dit woord zou het verhaal veel beter maken", kiest het systeem die nieuwe versie.
  4. De Echte Test: Het systeem vraagt vervolgens de strenge Leraar om deze "wat-zou-het-zijn"-versies te beoordelen om zeker te zijn dat de wiskunde klopte.
  5. De Upgrade: Als een "wat-zou-het-zijn"-versie eigenlijk beter is dan de oorspronkelijke gok van de robot, vervangt het systeem de oorspronkelijke gok van de robot door deze betere versie.
  6. Leren: De robot leert vervolgens van deze opgewaardeerde, betere versie.

Waarom Het Beter Is (De Resultaten)

Het artikel testte dit op een specifieke taak: ontbrekende tekst in verhalen invullen. Ze vergeleken hun nieuwe "Frost"-methode met de standaard "GRPO"-methode.

  • Sneller De Beste Top Vinden: In een "Best-of-K"-instelling (waar je het beste antwoord uit veel pogingen bekijkt), vond Frost Training veel sneller antwoorden met veel hogere scores. Het was alsof de wandelaar met het kompas de bergtop in de helft van de tijd vond.
  • Creativiteit Behouden: Standaard training laat de robot vaak "instorten". Het krijgt angst om fouten te maken en begint dezelfde veilige, saaie zinnen te herhalen. Frost Training hield de antwoorden van de robot divers en creatief (hoge "entropie") terwijl ze toch van hoge kwaliteit bleven.
  • Efficiëntie: Ze toonden aan dat Frost Training dezelfde resultaten kon bereiken als de standaardmethode, maar met minder "forward passes" (rekenstappen), of betere resultaten met dezelfde hoeveelheid rekenkracht.

De Conclusie

Het artikel beweert dat voor een specifieke familie van taken die Cross-Entropy Games worden genoemd (waarbij de beloning gebaseerd is op hoe waarschijnlijk een zin correct is), we niet hoeven te vertrouwen op blind gissen. Door het gebruik van het verborgen "gradient"-signaal (het kompas) om slimme, kleine veranderingen in de gissen van de robot voor te stellen voordat we ze zelfs beoordelen, kunnen we de robot trainen om veel sneller betere, creatievere verhalen te schrijven.

Ze valideerden dit door te tonen dat hun methode, Frost-GRPO, consequent beter presteerde dan de standaardmethode bij het vinden van tekstcompleties met de hoogste scores, terwijl de schrijfstijl van de robot gevarieerd en natuurlijk bleef.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →