← Nieuwste papers
📊 statistics

Uniform-Correct Policy Optimization: Breaking RLVR's Indifference to Diversity

Dit artikel identificeert dat standaard Reinforcement Learning met Verifieerbare Beloningen (RLVR)-doelstellingen leiden tot diversiteitsinstorting doordat ze onverschillig zijn voor de verdeling van waarschijnlijkheidsmassa onder correcte oplossingen, en stelt Uniform-Correct Policy Optimization (UCPO) voor om uniformiteit over geldige outputs af te dwingen, waardoor de diversiteit en dekking bij meerdere steekproeven aanzienlijk worden verbeterd terwijl de nauwkeurigheid bij één poging behouden blijft.

Oorspronkelijke auteurs: Anamika Lochab, Bolian Li, Ruqi Zhang

Gepubliceerd 2026-05-04
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Anamika Lochab, Bolian Li, Ruqi Zhang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Probleem: De "Eén Maat Past Alles"-Valstrik

Stel je voor dat je een briljante student traint om wiskundeproblemen op te lossen. Je zegt tegen hen: "Jouw doel is het juiste antwoord te krijgen."

In de wereld van AI heet dit RLVR (Reinforcement Learning with Verifiable Rewards). De AI probeert een probleem op te lossen en als het antwoord correct is, krijgt het een "gouden ster".

Het Probleem:
Het paper stelt dat standaard trainingsmethoden (zoals GRPO) te gefocust zijn op het krijgen van de gouden ster en niet om hoe de student het doet.

Stel je een wiskundeprobleem voor dat drie verschillende geldige oplossingsmethoden heeft (Methode A, Methode B en Methode C).

  • De Oude Manier (GRPO): De AI probeert alle drie. Door pure geluk lost het één probleem op met Methode A. Het krijgt een gouden ster. Omdat het een ster kreeg, denkt de AI: "Methode A is de beste! Ik zal die volgende keer doen." Het stopt met het proberen van Methode B en C.
  • Het Resultaat: De AI wordt een meester in Methode A. Het krijgt bijna elke keer het juiste antwoord als het het één keer probeert (Pass@1). Maar als je vraagt om het 64 keer te proberen om te zien of het een oplossing kan vinden, faalt het. Waarom? Omdat het Methoden B en C is vergeten. Het is ingestort tot één enkel, smal gewoonte.

Het paper noemt dit "Diversiteitsinstructie". De AI wordt een ééndimensionaal paard.

De Diagnose: Waarom Gebeurt Dit?

De auteurs vonden twee hoofdredenen waarom dit gebeurt:

  1. Het Doel is Te Vage: De trainingsregel zegt: "Maximaliseer correcte antwoorden." Het zegt niet: "Maximaliseer correcte antwoorden en probeer elke mogelijke methode te gebruiken." Dus is de AI onverschillig. Het weet niet dat het gevarieerd moet zijn.
  2. De "Rijke Worden Rijker"-Cyclus:
    • Stel je voor dat de AI een beetje meer kans heeft om Methode A te kiezen, puur door toeval.
    • Omdat het Methode A vaker kiest, krijgt het meer oefening ermee.
    • De trainingsupdates maken Methode A nog sterker.
    • Nu kiest het Methode A nog vaker.
    • Uiteindelijk worden Methoden B en C nooit gekozen, dus krijgt de AI nooit de kans om ze opnieuw te leren. Ze sterven uit.

De Oplossing: Het "Uniform-Correct" Beleid

De auteurs vroegen zich af: "Wat is de perfecte manier voor een AI om zich te gedragen wanneer er meerdere correcte antwoorden zijn?"

Ze concludeerden dat de AI Uniform-Correct moet zijn.

  • Uniform: Het moet elke geldige oplossing (Methode A, B en C) exact hetzelfde behandelen. Het moet ze een gelijke kans geven (33% elk).
  • Correct: Het mag geen tijd verspillen aan foute antwoorden.

Denk er als een chef-kok die drie verschillende manieren kent om een perfecte omelet te maken. De "Uniform-Correct" chef-kok blijft niet vastzitten aan de manier die hij het eerst maakte; hij draait door alle drie de methoden heen, zodat hij nooit vergeet hoe hij de anderen moet maken.

Het Nieuwe Hulpmiddel: UCPO

Om de "Eén Maat Past Alles"-valstrik te verhelpen, creëerden de auteurs een nieuwe trainingsmethode genaamd UCPO (Uniform-Correct Policy Optimization).

Hoe het werkt (De Analogie):
Stel je voor dat de AI een leraar is die een klas leerlingen (de verschillende oplossingen) beoordeelt.

  • Oude Methode (GRPO): De leraar prijst alleen de leerling die het eerst zijn hand opstak. De andere leerlingen blijven stil en stoppen uiteindelijk met het opsteken van hun handen.
  • Nieuwe Methode (UCPO): De leraar kijkt naar de hele klas. Als Leerling A vaak zijn hand opstak, zegt de leraar: "Goed gedaan, maar laten we een speciale bonus geven aan Leerling B en Leerling C die nog niet vaak hun handen hebben opgestoken."

UCPO voegt een "straf" toe aan de training. Als de AI begint om één oplossing te veel te bevoordelen, duwt de training terug en zegt: "Nee, je moet je aandacht meer gelijkmatig verdelen over alle correcte antwoorden."

De Resultaten: Wat Gebeurde Er?

Het team testte dit op drie verschillende AI-modellen (variërend van klein tot groot) met behulp van moeilijke wiskundebenchmarks (zoals de AIME-wiskundewedstrijd).

  1. Nauwkeurigheid bleef hoog: De AI was nog steeds even goed in het krijgen van het juiste antwoord op de eerste keer (Pass@1) als de oude methoden.
  2. Diversiteit schoot omhoog: Toen ze de AI vroegen om 64 verschillende pogingen te genereren, vond het veel meer unieke, correcte oplossingen.
    • Op de moeilijkste test (AIME24) verbeterde de nieuwe methode het vermogen om een correcte oplossing te vinden onder 64 pogingen met 10%.
    • De variatie in de wiskundige vergelijkingen die in de antwoorden werden gebruikt, steeg met 45%.

Samenvatting

Het paper toont aan dat standaard AI-training modellen te star maakt: ze vinden één manier om gelijk te krijgen en blijven daarbij hangen, waardoor ze alle andere geldige manieren vergeten. De nieuwe methode, UCPO, dwingt de AI om al zijn opties open te houden en behandelt elke juiste weg als even waardevol. Dit maakt de AI robuuster en creatiever zonder zijn nauwkeurigheid te offeren.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →