← Nieuwste papers
🤖 machine learning

The Mirage of Optimizing Training Policies: Monotonic Inference Policies as the Real Objective for LLM Reinforcement Learning

Dit artikel identificeert de mismatch tussen training en inferentie in reinforcement learning voor LLM's als een kritieke oorzaak van instabiliteit en stelt een nieuw framework voor genaamd Monotonic Inference Policy Update (MIPU) om ervoor te zorgen dat verbeteringen tijdens de training direct vertalen naar betere inferentieprestaties via een monotone optimalisatie-doelstelling.

Oorspronkelijke auteurs: Jing Liang, Hongyao Tang, Yi Ma, Yancheng He, Weixun Wang, Xiaoyang Li, Ju Huang, Wenbo Su, Jinyi Liu, Yan Zheng, Jianye Hao, Bo Zheng

Gepubliceerd 2026-06-30
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Jing Liang, Hongyao Tang, Yi Ma, Yancheng He, Weixun Wang, Xiaoyang Li, Ju Huang, Wenbo Su, Jinyi Liu, Yan Zheng, Jianye Hao, Bo Zheng

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een briljante student (het AI-model) traint om complexe wiskundige problemen op te lossen. Je hebt hiervoor twee verschillende omgevingen:

  1. De Klasomgeving (Training Engine): Dit is waar de student oefent. Het is een hightech laboratorium met perfecte verlichting, supersnelle computers en een leraar die elke gedachte van de student kan zien.
  2. De Examenzaal (Inference Engine): Dit is waar de student daadwerkelijk de toets maakt in de echte wereld. De computers zijn iets langzamer, de verlichting is anders en het is een beetje chaotischer.

Het Probleem: De "Twee Werelden" Disconnect

Het artikel stelt dat we in de moderne AI-training deze twee werelden vaak behandelen alsof ze identiek zijn. We zeggen tegen de student: "Goed gedaan in de klas! Je score is met 10% verbeterd!" en we gaan er vervolgens vanuit dat ze in de Examenzaal ook 10% hoger zullen scoren.

Maar hier zit de crux: De Klasomgeving en de Examenzaal zijn eigenlijk verschillend.

Vanwege technische verschillen (zoals hoe de computer getallen verwerkt), kan de student zich in de Examenzaal net iets anders gedragen dan in de klas, zelfs als ze precies hetzelfde brein gebruiken (modelparameters).

  • In de Klasomgeving zegt de student misschien: "Ik ben voor 90% zeker dat dit antwoord juist is."
  • In de Examenzaal is diezelfde student misschien eigenlijk maar voor 70% zeker, of maakt hij een kleine rekenfout die hij in het lab niet maakte.

Het artikel noemt dit de "Training-Inference Mismatch."

Het gevaar is dat de AI updates blijft ontvangen op basis van hoe goed het presteerde in de Klasomgeving. Maar als die updates niet vertalen naar de Examenzaal, kan de AI in de echte wereld zelfs slechtere beslissingen gaan nemen, ook al zien de trainingscijfers er perfect uit. Het is also kind dat in een perfecte simulator oefent, maar in het echte vliegtuig crasht omdat de windomstandigheden anders waren.

De Oplossing: De "Monotonic Inference Policy Improvement" (MIPI)

De auteurs stellen een nieuwe regel voor bij de training: Vraag niet alleen: "Is de student verbeterd in de klas?" Vraag: "Is de student daadwerkelijk verbeterd voor het examen?"

Ze noemen dit principe MIPI (Monotonic Inference Policy Improvement). Dit betekent dat we een trainingsupdate alleen accepteren als we zeker weten dat deze de prestaties in de echte wereld verbetert, en niet alleen de prestaties in de klas.

Hoe ze het doen: Het "MIPU" Tweestappenproces

Om dit mogelijk te maken, hebben ze een nieuw trainingsframework gebouwd genaamd MIPU (Monotonic Inference Policy Update). Zie dit als een tweestaps kwaliteitscontrole van de nieuwe kennis van de student:

Stap 1: De "Oefenronde" (Sampler-Referenced Update)
In plaats van de student simpelweg te laten verbeteren op basis van de regels van de Klas, vraagt de leraar eerst: "Als je het examen nu meteen zou maken met je huidige brein, hoe zou je presteren?"

  • Ze passen de leerwijze van de student zo aan dat de "Klas"-oefening beter aansluit bij de realiteit van de "Examenzaal".
  • Dit creëert een kandidaat-update — een nieuwe versie van de student die zou moeten verbeteren.

Stap 2: De "Realiteitscheck" (Inference-Gap-Aware Acceptance)
Voordat de student deze nieuwe kennis mee naar de echte wereld mag nemen, voert de leraar een snelle test uit.

  • Ze simuleren de student die het examen maakt met de nieuwe kennis.
  • Ze vergelijken het resultaat met wat de student eerder deed.
  • De Beslissing:
    • Als de nieuwe kennis daadwerkelijk helpt in de Examenzaal-simulatie? Accepteer het. De student gaat naar het volgende niveau.
    • Als de nieuwe kennis er goed uitziet in de Klas, maar zorgt voor verwarring of fouten in de Examenzaal-simulatie? Verwerp het. De student keert terug naar de vorige versie.

Waarom dit belangrijk is

Het artikel heeft dit getest op wiskundige problemen met een "lage precisie"-instelling (wat het verschil tussen de Klas en de Examenzaal heel duidelijk maakt, zoals proberen wiskunde op te lossen op een rekenmachine met kapotte knoppen).

  • Oude methoden: De AI raakte enthousiast over een hoge score in de Klas, paste de update toe, en presteerde vervolgens plotseling slecht of crashte in de echte wereld omdat de score in de Klas een "fata morgana" was.
  • MIPU-methode: De AI blijft stabiel. Het leert misschien iets langzamer omdat het slechte updates verwerpt, maar het wordt consequent beter in de werkelijke taak. Het vermijdt de "crash" en blijft gestaag klimmen.

De Kernboodschap

Het artikel beweert dat we het verkeerde ding aan het optimaliseren zijn. We hebben geprobeerd de AI beter te maken in het trainen, terwijl we hem beter moeten maken in het implementeren.

Door een simpele "Realiteitscheck" toe te voegen (Stap 2) en de trainingsregels af te stemmen op de regels van de echte wereld (Stap 1), wordt de AI betrouwbaarder. De AI stopt met het najagen van hoge scores in een neppomgeving en begint met het maken van echte, stabiele verbeteringen voor de echte wereld.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →