← Nieuwste papers
💬 NLP

Enhanced LLM Reasoning by Optimizing Reward Functions with Search-Driven Reinforcement Learning

Dit artikel stelt een zoekgestuurd versterkingsleerframework voor dat iteratief beloningsfunctiespecificaties optimaliseert via geautomatiseerde generatie, validatie en GRPO-gebaseerde screening, en aantoont dat een gerangschikt feedbackcircuit de prestaties van wiskundig redeneren op GSM8K aanzienlijk verbetert ten opzichte van statische of willekeurige beloningsensemble's.

Oorspronkelijke auteurs: Arash Ahmadi (Mike), Sarah Sharif (Mike), Yaser (Mike), Banad

Gepubliceerd 2026-05-05
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Arash Ahmadi (Mike), Sarah Sharif (Mike), Yaser (Mike), Banad

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een zeer slimme student voor (een Large Language Model) die uitstekend kan praten, maar soms moeite heeft met wiskunde. Je wilt hem leren om wiskundeproblemen beter op te lossen. Normaal gesproken zou je een leraar inhuren om zijn huiswerk te beoordelen. Maar in dit artikel stellen de auteurs een andere vraag: "Wat als we niet precies weten hoe we het huiswerk perfect moeten beoordelen? Wat als we een AI laten helpen om de beste beoordelingsregels te bedenken?"

Hier is het verhaal van hoe ze dat deden, eenvoudig uitgelegd.

1. Het Probleem: Het Mysterie van de "Beoordelingsrubriek"

In de wereld van AI gebruik je, om een model te leren beter na te denken, een systeem genaamd Versterkend Leren (Reinforcement Learning). Denk hierbij aan het trainen van een hond.

  • De Hond: Het AI-model.
  • De Traktatie: Een "beloning" (een positieve score).
  • De Kunststukje: Een wiskundeprobleem correct oplossen.

Het probleem is dat het ontwerpen van de "traktatie" (de beloningsfunctie) moeilijk is. Als je de AI vertelt: "Goed gedaan als je het juiste antwoord krijgt", kan het bedriegen door te gokken of patronen te kopiëren zonder echt na te denken. Als je probeert de stappen die het zet te belonen, moet je complexe regels schrijven, en het is makkelijk om een fout te maken in die regels.

2. De Oplossing: De "Beoordelingsregel-Fabriek"

De auteurs bouwden een systeem dat de beoordelingsregels zelf behandelt als iets dat geoptimaliseerd moet worden. Ze schreven de regels niet handmatig; ze richtten een fabriek op waar een AI (een "frontier"-model genaamd Kimi K2) optreedt als een Regeluitvinder.

Zo werkt de fabriek, stap voor stap:

  • Ronde 1: De Regeluitvinder-AI krijgt 20 wiskundeproblemen en wordt gevraagd 10 nieuwe manieren te bedenken om ze te beoordelen. Het schrijft deze regels als eenvoudige computercode (zoals een recept).
  • De Veiligheidscontrole: Voordat deze regels worden gebruikt, gaan ze door een "veiligheidsscanner" om te controleren of ze niet gevaarlijk of defect zijn.
  • De Proefrit: De onderzoekers nemen een kleine wiskundestudent (een AI-model met 3 miljard parameters) en laten deze korte tijd (500 stappen) oefenen met het oplossen van problemen met behulp van een van deze nieuwe regels.
  • Het Scorebord: Ze kijken hoe goed de student het deed op een test. Als de nieuwe regel de student hielp om betere scores te behalen, krijgt de regel een hoge ranking. Als de regel de student in de war bracht, krijgt het een lage ranking.
  • De Feedback-lus: De best presterende regels worden samengevat en teruggevoerd naar de Regeluitvinder-AI. De AI krijgt te horen: "Hé, regels die het aantal denkstappen telden, werkten goed. Regels die alleen naar het eindantwoord keken, werkten minder goed. Probeer nieuwe regels te bedenken op basis daarvan."

Ze herhaalden deze cyclus 5 keer, waarbij 50 verschillende kandidaat-regels werden gegenereerd.

3. De Resultaten: De "Gouden Regels" Vinden

Na 5 rondes vonden ze enkele winnaars.

  • De Beste Enkele Regel: Eén regel, genaamd thinking_steps_count, was een kampioen. Het gaf extra punten als de AI zijn denkproces in ten minste drie verschillende regels uitschreef. Het controleerde niet of het antwoord goed was (dat deed het basissysteem); het moedigde de AI alleen aan om zijn werk te tonen.
  • De Kracht van Samenwerking (Ensembles): Ze realiseerden zich dat één regel niet genoeg is. Dus namen ze de beste 5 regels en combineerden ze tot een "super-beoordelingsteam".
    • Het Resultaat: Dit team van regels hielp de AI om te springen van een succespercentage van 60% (met alleen basisregels) naar een succespercentage van 79,5%.
    • De "Magische" Controle: Om te bewijzen dat het niet alleen geluk was of het pure aantal regels, probeerden ze een "willekeurig team" van 5 regels die uit de stapel werden gekozen. Dat willekeurige team crashte, waarbij de AI bijna alles faalde. Dit bewees dat de feedback-lus (leren welke regels werkten en dat terugvoeren naar de uitvinder) de geheime saus was, niet alleen het hebben van meer regels.

4. Bedroog de AI? (De "Beloningshack"-Audit)

Een veel voorkomende angst is dat als je een AI vertelt "geef me meer regels met denkwerk", het gewoon de pagina vol zal vullen met onzin om punten te krijgen.

  • De Audit: De auteurs controleerden de antwoorden van de AI. Ze ontdekten dat wanneer de AI het antwoord goed had, het inderdaad meer regels schreef en meer wiskundige symbolen gebruikte dan wanneer het het fout had.
  • De Conclusie: De AI bedroeg niet door lege ruimte op te vullen; het dacht echt harder na, omdat de regels het daarvoor aanmoedigden.

5. Waarom Dit Belangrijk Is

  • Het is Toegankelijk: Je hebt geen supercomputer nodig. Ze draaiden dit hele experiment op één high-end consumentengrafische kaart (zoals die gamers gebruiken) in ongeveer 40 uur.
  • Het is Geautomatiseerd: In plaats van dat een menselijke expert wekenlang moet gissen naar hoe de perfecte beoordelingsrubriek eruitziet, automatiseert dit systeem het ontdekken van die regels.
  • Het is Transparant: De regels zijn geen zwarte doos; het is eenvoudige Python-code die mensen kunnen lezen, begrijpen en aanpassen.

In het kort: Het artikel toont aan dat als je een AI laat helpen bij het ontwerpen van het beoordelingssysteem voor een andere AI, en je die regels blijft verfijnen op basis van hoe goed de student presteert, je de student kunt leren veel beter na te denken dan wanneer je het gewoon een statische, door mensen geschreven set regels gaf.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →