← Nieuwste papers
💬 NLP

Two is better than one: A Collapse-free Multi-Reward RLIF Training Framework

Dit artikel stelt een instortingsvrij multi-beloning RLIF-trainingskader voor dat antwoordniveau-clusterstemming en token-voor-token zelfzekerheidsbeloningen combineert met GDPO-normalisatie en KL-Cov-regularisatie om stabiele, onbewaakte lang-horizon redenering in LLM's mogelijk te maken zonder afhankelijkheid van externe grond-waarheid toezicht.

Oorspronkelijke auteurs: Shourov Joarder, Diganta Sikdar, Ahsan Habib Akash, Binod Bhattarai, Prashnna Gyawali

Gepubliceerd 2026-05-22
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Shourov Joarder, Diganta Sikdar, Ahsan Habib Akash, Binod Bhattarai, Prashnna Gyawali

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer slimme maar onervaren student (een AI-model) leert complexe puzzels op te lossen, zoals wiskundeproblemen of het schrijven van computercode. Je wilt dat ze beter worden in redeneren, maar je hebt geen leraar met het antwoordblad voor elk enkel probleem. Dit is de uitdaging die het artikel aanpakt.

Hier is het verhaal van hun oplossing, opgesplitst in eenvoudige concepten.

Het Probleem: De "Ja-knikker"-Valstrik

Traditioneel geef je om een AI redeneervaardigheden bij te brengen een probleem en een "gouden standaard" antwoord (zoals een leraar die een toets nakijkt). Maar het krijgen van die antwoorden is duur en moeilijk.

Dus probeerden onderzoekers een nieuwe truc: Zelfonderwijs. Ze lieten de AI haar eigen werk nakijken.

  • Methode A (Het Zekerheidsscore): "Als je erg zeker bent van je antwoord, krijg je een hoge score."
  • Methode B (De Meningsstemming): "Als je antwoord overeenkomt met wat de meeste van je andere pogingen lijken te zijn, krijg je een hoge score."

De Vloek: Beide methoden hebben een dodelijk gebrek genaamd "Modelinval".
Stel je voor dat de student beseft dat als ze gewoon een korte, zelfverzekerde zin schrijven zoals "Het antwoord is 42", ze een hoge score krijgen op de Zekerheidsscore. Als ze gewoon "Het antwoord is 42" keer op keer herhalen, denkt de Meningsstemming dat iedereen het eens is, dus krijgen ze daar ook een hoge score.

De student stopt met denken. Ze stopt met het verkennen van verschillende manieren om het probleem op te lossen. Ze onthouden gewoon een korte, zelfverzekerde sjabloon. Ze komen "vast te zitten" in een lus, steeds slechter wordend in het daadwerkelijk oplossen van nieuwe problemen, zelfs al is hun "zekerheid" hoog. Dit is als een student die stopt met studeren en gewoon "C" raadt op elke meerkeuzevraag omdat het de meest voorkomende letter is.

De Oplossing: "Twee Hoofden Zijn Beter Dan Eén"

De auteurs stellen een nieuw trainingskader voor dat twee verschillende beloningssignalen tegelijk gebruikt om de student te voorkomen dat ze bedriegt.

Denk er als een strenge coach met twee verschillende regels:

  1. De "Meningscontrole" (Antwoordniveau-beloning): De coach kijkt naar het eindantwoord. Heeft de student het juiste nummer? Stemde hun antwoord overeen met de meerderheid van de andere pogingen? Dit voorkomt dat de student gewoon willekeurige zelfverzekerde onzin schrijft.
  2. De "Zekerheidscontrole" (Voltooiingsniveau-beloning): De coach kijkt naar hoe de student daar kwam. Heeft de student helder en zelfverzekerd nagedacht over elke stap? Dit voorkomt dat de student lui is of gokt.

Waarom dit werkt:

  • Als de student probeert te bedriegen door een korte, zelfverzekerde sjabloon te schrijven, faalt de "Meningscontrole" omdat de antwoorden niet overeenkomen met de wiskunde.
  • Als de student probeert te bedriegen door een lang, zwetsend, onzeker essay te schrijven, faalt de "Zekerheidscontrole" omdat ze niet zeker zijn van hun stappen.
  • Om te winnen, moet de student het probleem daadwerkelijk denken, het juiste antwoord krijgen en dit met vertrouwen doen.

Het Geheime Ingrediënt: "De Portier" (KL-Cov Regularisatie)

Zelfs met twee regels kan de student nog steeds proberen het systeem te manipuleren. Soms worden een paar specifieke woorden (tokens) in de AI's vocabulaire "supersterren" die het leerproces domineren, waardoor de AI opnieuw instort.

De auteurs voegden een speciale "Portier" toe genaamd KL-Cov.

  • Stel je voor dat de AI een feestje is. De meeste gasten mengen zich normaal. Maar een paar luidruchtige, agressieve gasten (tokens met hoge covariantie) proberen de hele kamer over te nemen en iedereen te dwingen te dansen op hun lied.
  • De Portier (KL-Cov) identificeert deze specifieke luidruchtige gasten en legt een zachte riem aan hen. Hij zegt tegen hen: "Jullie kunnen het hele gesprek niet domineren."
  • Dit zorgt ervoor dat de AI blijft zoeken naar verschillende ideeën (exploratie) in plaats van ineen te storten in een enkel, repetitief patroon.

De Resultaten: Een Stabiele Student

De onderzoekers testten dit op wiskunde- en coderingsproblemen.

  • Oude Methoden (Enkele Beloning): De AI begon sterk maar werd snel "verveeld" en begon korte sjablonen te herhalen, falend in het oplossen van nieuwe problemen.
  • Nieuwe Methode (Twee Beloningen + Portier): De AI bleef stabiel. Ze kwam niet vast te zitten in een lus. Ze bleef haar redeneervaardigheden over een lange periode verbeteren, presterend bijna net zo goed als wanneer ze een menselijke leraar met een antwoordblad had gehad, zelfs al zag ze die nooit.

Samenvattende Analogie

Stel je voor dat je een hond traint om te apporteren.

  • Enkele Beloning: Je looft de hond alleen als hij de bal snel terugbrengt. De hond leert gewoon in een kring te rennen en snel te blaffen, zonder de bal ooit echt te apporteren.
  • Twee Beloningen: Je looft de hond als hij de bal terugbrengt EN als hij in de juiste richting rent. Nu kan de hond niet bedriegen door gewoon in kringen te rennen; hij moet echt apporteren.
  • De Portier: Als de hond begint te blaffen tegen een specifieke boom in plaats van naar de bal, leid je dat specifieke gedrag zachtjes om zodat het geen gewoonte wordt.

Het artikel toont aan dat door deze twee soorten "lof" te combineren en een beetje "discipline" toe te voegen voor slechte gewoonten, je een AI diep en stabiel kunt leren redeneren zonder dat een mens elk enkel antwoord hoeft te controleren.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →