← Nieuwste papers
🤖 machine learning

Klear-Reasoner: Advancing Reasoning Capability via Gradient-Preserving Clipping Policy Optimization

Dit paper introduceert Klear-Reasoner, een model met geavanceerde redeneervermogens dat wordt bereikt door een volledig post-training workflow te analyseren en een nieuwe Gradient-Preserving Clipping Policy Optimization (GPPO) methode te introduceren die de exploratie en het leren van suboptimale trajecten verbetert, wat resulteert in toonaangevende prestaties op wiskunde- en programmeerbenchmarks.

Oorspronkelijke auteurs: Zhenpeng Su, Leiyu Pan, Xue Bai, Dening Liu, Guanting Dong, Jiaming Huang, Minxuan Lv, Wenping Hu, Fuzheng Zhang, Kun Gai, Guorui Zhou

Gepubliceerd 2026-04-02
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Zhenpeng Su, Leiyu Pan, Xue Bai, Dening Liu, Guanting Dong, Jiaming Huang, Minxuan Lv, Wenping Hu, Fuzheng Zhang, Kun Gai, Guorui Zhou

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Klear-Reasoner: De Slimme Student die Leer van Fouten en Zelfvertrouwen

Stel je voor dat je een zeer intelligente, maar nog wat onervaren student hebt (een kunstmatige intelligentie) die uitblinkt in wiskunde en programmeren. De onderzoekers van Kuaishou Technology hebben deze student, Klear-Reasoner, getraind om niet alleen snelle antwoorden te geven, maar om echt na te denken, net als een mens die een lastig raadsel oplost.

Hier is hoe ze dat deden, vertaald in begrijpelijke taal:

1. De Leerboeken: Kwaliteit boven Aantal

Stel je voor dat je moet leren voor een examen. Je kunt duizenden boeken kopen met willekeurige informatie, of je kunt een paar zeer goed geschreven, nauwkeurige boeken kiezen.

  • Het oude idee: "Hoe meer boeken, hoe beter."
  • De Klear-Reasoner-methode: Ze ontdekten dat een kleine verzameling van de allerbeste, moeilijkste voorbeelden veel effectiever is dan een grote hoop gemiddelde boeken.
  • De verrassing: Ze lieten zelfs de "foutieve" antwoorden in de lesboeken staan, maar alleen voor de moeilijke vragen. Waarom? Omdat het zien van een verkeerde oplossing op een lastig probleem de student helpt om te begrijpen waarom iets niet werkt. Het is als een sportcoach die je niet alleen laat winnen, maar ook laat zien hoe je een valpartij moet voorkomen. Voor makkelijke vragen wilden ze alleen perfecte antwoorden, maar voor moeilijke puzzels is het zien van fouten juist leerzaam.

2. De Trainer: GPPO (De "Zachte" Trainer)

Tijdens het trainen gebruiken ze een methode genaamd Reinforcement Learning (versterkend leren). Stel je voor dat de student een spelletje speelt en een trainer (de computer) geeft feedback.

  • Het probleem met oude trainers: Als de student iets heel creatiefs probeert (een "hoge entropie" stap) en het lukt niet direct, of als de student een fout maakt die ver weg is van het juiste antwoord, scholden de oude trainers de student direct uit en zeiden: "Dit is fout, doe het niet meer!" Hierdoor durfde de student niet meer te experimenteren.
  • De nieuwe trainer (GPPO): Deze trainer is slimmer. Hij zegt: "Oké, die stap was misschien te ver weg, maar ik heb nog steeds iets geleerd van je poging." Hij geeft de feedback niet volledig af, maar bewaart de leerkracht van die stap, zelfs als hij de stap corrigeert.
    • De metafoor: Het is alsof je een kind leert fietsen. Als het kind een rare beweging maakt die bijna een val is, duw je het niet weg (wat de kans op leren verkleint), maar je grijpt zachtjes in en laat het kind voelen wat er misging, zodat het de volgende keer beter weet wat het moet doen. Dit zorgt ervoor dat de student durft te experimenteren en sneller leert van zijn fouten.

3. De Beloningen: Geen "Alles-of-Niets"

Bij het programmeren is het vaak zo dat een stukje code 90% goed werkt, maar faalt op één klein detail.

  • Oude methode: "Ofwel werkt het perfect (beloning), ofwel faalt het (straf)." Dit is frustrerend voor de student.
  • Nieuwe methode (Soft Reward): Als de code 10 van de 16 tests haalt, krijgt de student 10/16 punten. Dit is als een cijfer geven in plaats van alleen "geslaagd" of "gezakt". Hierdoor ziet de student precies waar hij moet verbeteren en blijft hij gemotiveerd om stap voor stap beter te worden.

4. De Resultaten: Een Topprestatie

Door deze slimme combinatie van goede leerboeken, een zachte trainer die fouten accepteert als leermomenten, en eerlijke puntenverdeling, is Klear-Reasoner een wereldtopper geworden.

  • In wiskundewedstrijden (zoals AIME) en programmeerwedstrijden (LiveCodeBench) scoort hij extreem hoog, vaak beter dan andere bekende modellen van vergelijkbare grootte.
  • Zelfs als je hem meer tijd geeft om na te denken (meer "rekenkracht"), wordt hij nog slimmer, wat bewijst dat hij echt redeneert en niet alleen antwoorden uit zijn hoofd leert.

Kortom: Klear-Reasoner is de bewijs dat je een AI niet hoeft te dwingen om perfect te zijn, maar dat je hem juist moet leren om van zijn twijfels en fouten te groeien, met de juiste hoeveelheid goede voorbeelden en een trainer die geduldig is.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →