← Nieuwste papers
💬 NLP

Plan Then Action:High-Level Planning Guidance Reinforcement Learning for LLM Reasoning

Het artikel stelt PTA-GRPO voor, een tweestapskader dat toezichtgestuurd fijnafstemmen voor hoogwaardige planningsrichtlijnen combineert met richtlijnbewust versterkend leren om de globale redeneercapaciteiten van grote taalmodellen op diverse wiskundige en wetenschappelijke benchmarks aanzienlijk te verbeteren.

Oorspronkelijke auteurs: Zhihao Dou, Qinjian Zhao, Zhongwei Wan, Dinggen Zhang, Weida Wang, Towsif Raiyan, Benteng Chen, Qingtao Pan, Yang Ouyang, Chaoda Song, Zhiqiang Gao, Shufei Zhang, Sumon Biswas

Gepubliceerd 2026-05-27
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Zhihao Dou, Qinjian Zhao, Zhongwei Wan, Dinggen Zhang, Weida Wang, Towsif Raiyan, Benteng Chen, Qingtao Pan, Yang Ouyang, Chaoda Song, Zhiqiang Gao, Shufei Zhang, Sumon Biswas

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Probleem: De "Run-and-Guess" (Lopen-en-Gissen) Valstrik

Stel je voor dat je probeert een zeer moeilijk doolhof op te lossen. De meeste huidige AI-modellen (Grote Taalmodellen) gedragen zich als iemand die direct een pad inloopt. Ze zetten één stap, dan de volgende, dan weer de volgende, en kijken altijd alleen naar de stap direct voor hen.

Het artikel noemt dit Chain-of-Thought (CoT). Dit werkt prima voor eenvoudige doolhoven, maar voor complexe doolhoven raakt de AI vaak verdwaald. Het kan een verkeerde afslag nemen, in cirkels blijven lopen omdat het te gefocust is op de volgende stap om het grote plaatje te zien, of te laat beseffen dat het in het allerbegin al een fout heeft gemaakt. Tegen de tijd dat het het einde bereikt, is het vaak in de war of heeft het het verkeerde antwoord gegeven.

Andere methoden proberen dit op te lossen door de AI te laten "nadenken" over veel verschillende paden tegelijk (zoals een boomzoektocht), maar dit is ongelooflijk traag en duur, alsof je honderd mensen huurt om elk mogelijk pad in het doolhof gelijktijdig te rennen.

De Oplossing: "Plan Then Action" (PTA-GRPO)

De auteurs stellen een nieuwe manier voor om AI te trainen, genaamd PTA-GRPO. Denk hierbij aan het leren aan de AI om te stoppen en een kaart te tekenen voordat het begint met rennen.

Het proces verloopt in twee hoofdfasen:

Fase 1: De "Kaartmaker" (Supervised Fine-Tuning)

Eerst leren de onderzoekers de AI hoe het een kaart moet maken. Ze nemen bestaande voorbeelden van goed probleemoplossen en vragen een slimme AI om de lange, gedetailleerde stappen samen te vatten tot een korte, hoogwaardige "planning" of "schets".

  • Analogie: Stel je een chef-kok voor. In plaats van alleen iemand te laten zien hoe die groenten snijdt en een pot roert, wordt de AI geleerd eerst een receptkaart te schrijven: "1. Uien snijden. 2. Knoflook fruiten. 3. Saus laten pruttelen."
  • De AI leert om deze korte planning (binnen <plan> tags) uit te geven voordat het begint met het daadwerkelijke werk (de gedetailleerde redenering binnen <thought> tags).

Fase 2: De "Coach" (Reinforcement Learning)

Dit is het slimme deel. Normaal gesproken geeft een coach bij het trainen van een AI alleen punten als het uiteindelijke antwoord goed of fout is. Als de AI het juiste antwoord krijgt maar een vreemd, verwarrend pad heeft bewandeld, krijgt het een "goed gedaan". Als het het verkeerd heeft, krijgt het een "probeer het opnieuw".

De auteurs hebben de regels veranderd. Nu geeft de coach punten voor twee dingen:

  1. Heb je het juiste antwoord? (Het Resultaat)
  2. Was je kaart (planning) eigenlijk goed? (De Gids)
  • Analogie: Stel je een student voor die een wiskundetoets maakt.
    • Oude manier: De leraar controleert alleen het eindgetal. Als de student het juiste getal heeft geraden maar onzin heeft geschreven, krijgt hij een A.
    • PTA-GRPO manier: De leraar controleert ook de schets van de student. Als de student een duidelijke, logische planning schreef voordat hij de wiskunde deed, krijgt hij extra punten. Als hun planning rommelig of fout was, verliezen ze punten, zelfs als ze op de een of andere manier het juiste antwoord hebben geraden.

Dit dwingt de AI om te leren dat een goede planning leidt tot een goed antwoord. Het leert duidelijke, hoogwaardige strategieën te creëren die zijn denken sturen, waardoor het niet van de weg raakt.

Waarom Het Werkt

Het artikel toont aan dat wanneer je de AI op deze manier traint:

  • Het stopt met het maken van "lokale" fouten (vastlopen op één stap).
  • Het creëert een "globaal" beeld van het probleem (het hele doolhof zien).
  • Het wordt veel beter in wiskunde- en wetenschapsproblemen, zelfs op kleinere, goedkopere computermodellen.

De Resultaten

De onderzoekers testten dit op tien verschillende moeilijke wiskunde- en wetenschapsbenchmarks. Ze ontdekten dat:

  • Modellen die met deze "Plan Then Action"-methode zijn getraind, consequent beter presteerden dan modellen die met standaardmethoden waren getraind.
  • Het goed werkte bij verschillende maten van AI-modellen (van klein tot groot).
  • De AI werd niet alleen beter in het eindantwoord; het werd ook beter in het nadenken op een gestructureerde, georganiseerde manier.

Samenvatting

Kortom, het artikel leert AI om te stoppen, nadenken en een plan te maken voordat het begint met het oplossen van een probleem. Door de AI niet alleen te belonen voor het eindresultaat, maar ook voor de kwaliteit van zijn planning, leert de AI complexere problemen betrouwbaarder te navigeren en de "lopen-en-gissen"-fouten te vermijden die huidige systemen plagen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →