← Nieuwste papers
🤖 machine learning

Complementing reinforcement learning with SFT through logit averaging in the post training of LLMs

Dit artikel introduceert een nieuwe post-training methode voor grote taalmodellen die Group Relative Policy Optimization (GRPO) verbetert door de logits van een bevroren SFT-referentiebeleid en een trainbaar beleid te middelen, waardoor de noodzaak van KL-regularisatie of een criticus wordt weggenomen terwijl de redeneercapaciteiten van RL effectief worden gecombineerd met de opmaakstabiliteit van SFT.

Oorspronkelijke auteurs: Xingwei Gan, Ying Zhu

Gepubliceerd 2026-05-21
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Xingwei Gan, Ying Zhu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Plaatje: Twee Leraren, Één Student

Stel je voor dat je een groot taalmodel (een AI) traint om wiskundeproblemen op te lossen. Je hebt twee verschillende "leraren" die proberen het te onderwijzen:

  1. De Opmaakleraar (SFT): Deze leraar is uitstekend in het leren van de AI hoe antwoorden netjes te schrijven, de juiste symbolen te gebruiken en strikte regels te volgen (zoals het antwoord in een kader zetten). Deze leraar maakt echter soms fouten in de daadwerkelijke wiskundige logica.
  2. De Redeneringsleraar (RL): Deze leraar is een wiskundegenie dat complexe vergelijkingen perfect kan oplossen. Maar deze leraar is slordig; ze vergeten vaak het antwoord in een kader te zetten, stappen over, of schrijven in een vreemd formaat dat niet overeenkomt met wat het examen vereist.

Het Probleem:
Traditioneel gebruik je, wanneer je deze twee probeert te combineren, een methode genaamd "KL Regularisatie". Denk hierbij aan een rubberen band die de Redeneringsleraar aan de Opmaakleraar vastbindt. De rubberen band dwingt de Redeneringsleraar om dicht bij de stijl van de Opmaakleraar te blijven.

  • De Vangst: Als de Opmaakleraar een wiskundefout maakt, trekt de rubberen band de Redeneringsleraar mee in diezelfde fout. De AI blijft steken in het proberen om "netjes" te zijn, maar faalt om "slim" te zijn.

De Nieuwe Oplossing: Logit-gemiddelde
De auteurs van dit artikel stellen een nieuwe manier voor om deze leraren te combineren. In plaats van ze met een rubberen band aan elkaar te binden, creëren ze een Geblend Stemgeluid.

Stel je voor dat de AI een koor is. In plaats van de zangers te dwingen perfect in unisono te blijven (wat hun bereik beperkt), mengt de nieuwe methode hun stemmen voordat ze zingen.

  • Als de Opmaakleraar zegt: "Zet het antwoord in een kader", en de Redeneringsleraar zegt: "Het antwoord is 5", dan zegt het Geblend Stemgeluid: "Zet het antwoord in een kader: 5."
  • Als de Opmaakleraar een wiskundefout maakt (en zegt dat het antwoord 6 is), maar de Redeneringsleraar weet dat het 5 is, leunt het Geblend Stemgeluid zwaar op de wiskunde van de Redeneringsleraar, terwijl het de instructie van de Opmaakleraar om het "in een kader te zetten" behoudt.

Hoe Het Werkt (De "Logit"-Magie)

In AI-termen bestaat het "stemgeluid" van het model uit getallen die logits worden genoemd (die aangeven hoe waarschijnlijk het is dat het model het volgende woord of getal kiest).

  1. De Mix: De onderzoekers nemen de getallen van de Opmaakleraar en de Redeneringsleraar en middelen ze wiskundig samen.
  2. Het Resultaat: Dit creëert een nieuwe, tijdelijke "Geblend Beleid".
  3. De Training: De AI leert door te oefenen op dit Geblend Beleid. Het krijgt de beloning (punten) als het uiteindelijke antwoord correct is.
    • Omdat de Opmaakleraar deel uitmaakt van de mix, vergeet de AI nooit hoe het netjes moet schrijven.
    • Omdat de Redeneringsleraar deel uitmaakt van de mix, heeft de AI de vrijheid om de wiskundefouten van de Opmaakleraar te corrigeren.

Waarom Dit Beter Is (Het "Product van Experts")

Het artikel gebruikt een concept dat een "Product van Experts" wordt genoemd. Denk hierbij aan een comitébesluit:

  • Als Expert A (Opmaak) zeker is over de stijl, en Expert B (Redenering) zeker is over de wiskunde, dan is het uiteindelijke besluit sterk op beide gebieden.
  • Als Expert A fout is over de wiskunde, weegt Expert B's vertrouwen zwaarder, maar Expert A's vertrouwen over de stijl blijft behouden.

Het artikel vond dat deze aanpak met het "Geblend Stemgeluid" beter werkt dan de oude "rubberen band"-methode. De AI leerde wiskundeproblemen correct op te lossen en behield zijn nette opmaak, terwijl de oude methode de AI vaak liet vergeten hoe het correct moest formatteren, of de AI liet steken in de wiskundefouten van de Opmaakleraar.

De Experimenten

De onderzoekers testten dit op drie verschillende "examens" (datasets):

  1. MATH: Moeilijke wiskundeproblemen.
  2. cn-k12: Chinese middelbare/havo-wiskunde.
  3. MMLU: Algemene kennis en redenering.

Ze testten het op drie verschillende maten van AI-modellen (klein, medium en groot).

De Resultaten:

  • In bijna alle gevallen behaalde de nieuwe "Geblend Stemgeluid"-methode hogere scores dan de traditionele methode.
  • Het was vooral goed in het oplossen van een specifiek probleem: de traditionele methode liet de AI vaak "vergeten" hoe het antwoorden moest formatteren naarmate het leerde moeilijkere wiskunde op te lossen. De nieuwe methode hield de formatteringsvaardigheden intact terwijl het de wiskundvaardigheden verbeterde.

Een Concreet Voorbeeld uit het Artikel

Het artikel geeft een specifiek voorbeeld van een meetkundeprobleem:

  • De Opmaakleraar (SFT): Stelt de vergelijking correct op, maar maakt een wiskundefout, en concludeert dat de straal 6 is. Het zet het antwoord netjes in een kader.
  • De Redeneringsleraar (RL): Berekent de wiskunde correct, en vindt dat de straal 5 is, maar vergeet het antwoord in een kader te zetten of in het definitieve formaat te schrijven.
  • Het Geblend Stemgeluid: Het neemt de correcte wiskunde (5) van de Redeneringsleraar en de nette kaderinstructie van de Opmaakleraar. De uiteindelijke output is een netjes in een kader gezet 5.

Samenvatting

Het artikel introduceert een manier om AI-modellen te trainen die werkt als een samenwerkend team in plaats van een strikte hiërarchie. Door wiskundig de "gedachten" (logits) te middelen van een nette maar slordige leraar en een slimme maar slordige leraar, leert de AI om zowel slim als netjes te zijn, en vermijdt het de valkuilen van het dwingen van de ene om de andere strikt te volgen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →