← Nieuwste papers
💬 NLP

PCL-Reasoner-V1.5: Advancing Math Reasoning with Offline Reinforcement Learning

PCL-Reasoner-V1.5 is een wiskundig redeneermodel met 32 miljard parameters gebouwd op Qwen2.5-32B dat een nieuwe offline reinforcement learning-methode benut om state-of-the-art prestaties te behalen op AIME-benchmarks met een superieure trainingsstabiliteit en efficiëntie vergeleken met online RL-benaderingen.

Oorspronkelijke auteurs: Yao Lu, Dengdong Fan, Jianzheng Nie, Fan Xu, Jie Chen, Bin Zhou, Yonghong Tian

Gepubliceerd 2026-01-22
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Yao Lu, Dengdong Fan, Jianzheng Nie, Fan Xu, Jie Chen, Bin Zhou, Yonghong Tian

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Plaatje: Een Wiskundig Genie op een Dieet

Stel je voor dat je een zeer slimme student hebt (het AI-model) die al goed is in wiskunde, maar een wereldkampioen wil worden. De onderzoekers van Peng Cheng Laboratory en Peking University hebben een krachtige student genaamd Qwen2.5-32B genomen en deze een speciaal trainingskamp gegeven om PCL-Reasoner-V1.5 te creëren.

Het resultaat? Dit nieuwe model is momenteel de beste in het oplossen van moeilijke wiskundige problemen onder de modellen die gebouwd zijn op deze specifieke "student"-basis. Het scoorde 90,9% op een wiskundewedstrijd uit 2024 en 85,6% op een versie uit 2025.

Het Geheime Ingrediënt: Twee-staps Training

De onderzoekers hebben het model niet zomaar in een willekeurige oefensessie gegooid. Ze gebruikten een tweestaps-proces:

  1. Supervised Fine-Tuning (SFT) – "De Textboekenfase":
    Eerst hebben ze het model onderwezen met behulp van een enorme bibliotheek aan hoogwaardige wiskundige problemen en hun stapsgewijze oplossingen (genaamd Chain-of-Thought). Denk hierbij aan de student die de beste tekstboeken leest en onthoudt hoe je problemen correct oplost. Dit creëerde een tussenliggend model genaamd PCL-Reasoner-V1.

  2. Offline Reinforcement Learning (RL) – "De Oefenexamenfase":
    Dit is waar het paper innovatief is. Normaal gesproken leren AI-modellen door een toets af te leggen, direct beoordeeld te worden en het dan opnieuw te proberen terwijl de leraar toekijkt (dit wordt Online RL genoemd). Het is als een student die een toets maakt, een cijfer krijgt, en direct zijn brein aanpast om de fout te herstellen, allemaal in real-time. Dit kan chaotisch en traag zijn.

    PCL-Reasoner-V1.5 gebruikte Offline RL in plaats daarvan. Hier is de analogie:

    • De Oude Manier (Online RL): De student maakt een toets, de leraar geeft een cijfer, de student past zijn brein aan, en neemt dan direct de volgende toets af. Als de leraar moe wordt of het beoordelingssysteem een fout maakt, crasht het hele proces.
    • De Nieuwe Manier (Offline RL): De student maakt in één keer een enorme stapel oefentoetsen en schrijft al deze antwoorden op. De leraar beoordeelt de hele stapel achteraf en maakt een enkel, perfect "Antwoordboek". De student bestudeert vervolgens alleen vanuit dit statische boek. Ze maken geen nieuwe toetsen terwijl ze studeren; ze leren alleen van de vaste data.

Waarom is "Offline" Beter?

Het paper beargumenteert dat deze "Antwoordboek"-aanpak (Offline RL) superieur is om drie belangrijke redenen:

  • Stabiliteit (Geen Achtbanen): Online leren is als een auto rijden terwijl de motor wordt herbouwd. Het is onstabiel en kan crashen. Offline leren is als studeren in een stille bibliotheek; de data verandert niet, dus het leerproces is vloeiend en voorspelbaar.
  • Efficiëntie (De Lopende Band): Bij de online methode moet de computer constant stoppen, nadenken, beoordelen en updaten. Bij de offline methode kan de computer in één enorme, efficiënte burst alle antwoorden genereren (zoals een fabriekslopende band), en vindt de training daarna apart plaats. Dit bespaart veel tijd en rekenkracht.
  • Eenvoud: Het is makkelijker te beheren. Je hebt geen complex systeem nodig om real-time beoordeling en leren te coördineren. Je genereert de data, slaat het op en traint er later op.

Wat heeft het model eigenlijk geleerd?

De onderzoekers merkten iets interessants op over hoe het model verbeterde.

  • Voorheen (PCL-Reasoner-V1): Het model probeerde problemen snel op te lossen. Als een probleem een zeer lange, complexe keten van redenering vereiste (zoals een denkproces van 30.000 woorden), gaf het model vaak op of maakte het fouten.
  • Nadat (PCL-Reasoner-V1.5): Het model leerde om langer na te denken. Het begon veel langere, gedetailleerdere redeneerstappen te schrijven. Het leerde dat je bij moeilijke problemen niet kunt haasten; je moet elk pad zorgvuldig verkennen.

De Kernboodschap

Het paper beweert dat je niet de complexe, onstabiele, real-time "online" trainingsmethoden nodig hebt die iedereen anders gebruikt om geweldige resultaten te behalen. Door een simpelere, stabielere "offline" methode te gebruiken — waarbij je een vaste dataset van antwoorden genereert en daar vervolgens op traint — werd het model een wiskundig kampioen.

Belangrijkste les: Soms is de beste manier om te leren niet door constant toetsen te maken terwijl de leraar toekijkt. Het is door een enorme batch oefentoetsen te maken, een perfect antwoordboek te krijgen en dat antwoordboek grondig te bestuderen. Deze aanpak maakte PCL-Reasoner-V1.5 de nieuwe topspeler in zijn klasse.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →