← Nieuwste papers
🤖 machine learning

Kalman Meets Curriculum: Efficient Dynamic Prompt Selection for Adaptive RL Finetuning

Dit artikel introduceert Kalman-Guided Prompt Selection (KGPS), een efficiënte methode die de moeilijkheidsgraad van prompts modelleert als een dynamisch toestandsschattingprobleem met behulp van een Kalman-filter om adaptief optimale prompts te selecteren voor RL-fijninstelling, waardoor de trainingsefficiëntie en de uiteindelijke modelprestaties aanzienlijk worden verbeterd zonder dat daarvoor extra rollouts vereist zijn.

Oorspronkelijke auteurs: Haodong Zhu, Yangyang Ren, Yanjing Li, Sheng Xu, Haiguang Liu, Linlin Yang, Baochang Zhang

Gepubliceerd 2026-07-31
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Haodong Zhu, Yangyang Ren, Yanjing Li, Sheng Xu, Haiguang Liu, Linlin Yang, Baochang Zhang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een briljante maar licht eigenwijze robot probeert te leren hoe hij complexe puzzels moet oplossen. Je hebt een enorme bibliotheek met puzzels, variërend van "zoek de kat in de afbeelding" tot "los een natuurkundeprobleem op waar Einstein al over staakte". Als je de robot een puzzel geeft die hij al duizend keer heeft opgelost, raakt hij verveeld en leert hij niets. Als je hem een onmogelijk moeilijke puzzel geeft, raakt hij gefrustreerd en geeft hij het op, waardoor hij ook niets leert. Het ideale punt is een puzzel die net moeilijk genoeg is om de robot aan het denken te zetten, maar makkelijk genoeg zodat hij hem uiteindelijk kan oplossen. Dit is de kernuitdaging van Reinforcement Learning (RL) voor Large Language Models (LLMs): het vinden van het "Goldilocks"-moeilijkheidsniveau voor de huidige vaardigheden van de robot.

Het probleem is dat de robot leert terwijl jij hem onderwijst. Een puzzel die gisteren moeilijk was, kan vandaag makkelijk zijn, en een puzzel die makkelijk was, kan te simpel zijn geworden. Traditionele methoden om puzzels te selecteren zijn als het gebruik van een statische kaart: ze schatten de moeilijkheid één keer in en houden zich er dan aan vast (wat snel veroudert) of ze testen elke puzzel om te zien hoe moeilijk deze is (wat eeuwen duurt en tijd verspilt). Dit artikel introduceert een nieuwe, slimmere manier om de robot betrokken te houden zonder een seconde van zijn tijd te verspillen.


Het Probleen: Het Bewegende Doelwit

Denk aan het trainen van een AI als het coachen van een voetbalteam. Aan het begin van het seizoen zijn je spelers verschrikkelijk in strafschoppen. Je wilt oefenen met de doelpalen dichtbij. Maar naarmate ze beter worden, worden die nabijgelegen doelpalen te makkelijk. Als je ze daar blijft houden, verbeteren ze niet meer. Als je de doelpalen plotseling naar de andere kant van het veld verplaatst, missen ze elke schot en raken ze ontmoedigd.

De coaches (de onderzoekers) hebben een manier nodig om de afstand van de doelpalen constant aan te passen op basis van hoe het team er nu voor staat. Sommige coaches proberen de vaardigheid van elke speler te meten door hen voor elke wedstrijd een oefenshoot te laten nemen (dit wordt "evaluatie-gebaseerde" selectie genoemd). Dit is accuraat, maar het kost zoveel tijd dat het team nauwelijks aan de echte wedstrijd kan deelnemen. Andere coaches gokken de vaardigheidsgraad op basis van een gevoel of een simpele formule (dit is "voorspellings-gebaseerde" selectie). Dit is snel, maar hun gokken zijn vaak fout omdat ze ervan uitgaan dat de vaardigheden van de spelers gelijk blijven, terwijl de spelers eigenlijk elke dag beter worden.

De Oplossing: De Kalman Coach

De auteurs van dit artikel, onder leiding van Haodong Zhu en collega's, stellen een nieuwe methode voor genaamd KGPS (Kalman-Guided Prompt Selection). In plaats van te gokken of alles te testen, behandelen zij de moeilijkheid van elke puzzel als een bewegend doelwit dat voortdurend verschuift.

Ze gebruiken een wiskundig hulpmiddel genaamd een Kalman Filter. Om dit te begrijpen: stel je voor dat je een vogel probeert te volgen die door een mistig bos vliegt. Je kunt de vogel niet perfect zien, maar je weet hoe snel hij meestal vliegt en hoeveel hij de ene kant op of de andere kant op zwiept.

  1. De Voorspelling: Voordat je de vogel ziet, gok je waar hij zal zijn op basis van waar hij een moment geleden was.
  2. De Update: Wanneer je eindelijk een glimp van de vogel opvangt (een "rollout" of een testronde), pas je je gok aan.
  3. De Onzekerheid: Hier komt het slimme deel. Als de vogel plotseling wild heen en weer zwiept (wat gebeurt wanneer de AI's brein snel verandert), wordt je gok minder zeker. Je realiseert je: "Wauw, de vogel doet iets onvoorspelbaars!" Dus verbreed je het zoekgebied.

In de AI-wereld is de "vogel" de moeilijkheidsgraad van een specifieke prompt (een vraag of taak). De "zwiep" vindt plaats wanneer het AI-model iets nieuws leert en zijn interne hersenstructuur verandert. KGPS realiseert zich dat wanneer de AI veel verandert, onze oude gokken over hoe moeilijk een vraag is, misschien niet meer kloppen. Daarom voegt het automatisch "onzekerheid" toe aan zijn geheugen van die vraag.

Hoe het in de praktijk werkt

Het systeem houdt een "overtuiging" (belief) bij over elke vraag in de bibliotheek. Deze overtuiging is niet alleen een enkel getal (zoals "dit is 50% moeilijk"); het is een wolk van mogelijkheden.

  • Als de AI een vraag een tijdje niet heeft gezien: De wolk van onzekerheid wordt groter. Het systeem denkt: "Ik heb deze al een tijdje niet gecontroleerd, en de AI is veel veranderd. Misschien is deze vraag nu juist perfect voor de AI!" Dit brengt oude, vergeten vragen op een natuurlijke manier terug in de trainingsmix.
  • Als de AI een vraag net heeft opgelost: De wolk krimpt. Het systeem weet precies hoe moeilijk die vraag is voor de huidige versie van de AI.
  • De Selectie: Het systeem kiest de vragen waarbij de "wolk" suggereert dat de AI waarschijnlijk iets nieuws kan leren — meestal de vragen die zich net in het midden van het moeilijkheidsspectrum bevinden.

De Resultaten: Sneller en Slimmer

De onderzoekers testten deze methode op enkele zeer uitdagende taken, waaronder wiskundeproblemen, planningsopdrachten (zoals aftellen) en geometische puzzels. Ze vergeleken KGPS met de "gokkende" coaches en de "alles-testen" coaches.

De resultaten waren indrukwekkend. Op een specifieke wiskundige benchmark met behulp van een model genaamd DeepSeek-R1-Distill-7B, slaagde KGPS erin om dezelfde (of zelfs iets betere) uiteindelijke prestaties te behalen als de "alles-testen" methode, maar gebruikte het 83% minder rollouts. In gewone mensentaal: de AI leerde net zo goed terwijl hij slechts een fractie van het werk deed.

Bovendien laat het artikel zien dat KGPS veel beter is in het voorspellen van de moeilijkheidsgraad van vragen dan eerdere "gokkende" methoden. Terwijl andere methoden grote fouten maakten in hun voorspellingen (met een foutmarge rond de 0,40), hield KGPS de voorspellingen veel nauwer (rond de 0,15 fout). Dit betekent dat de AI consequent oefende op het juiste moeilijkheidsniveau, in plaats van tijd te verspillen aan zaken die te makkelijk of te moeilijk waren.

Waarom het ertoe doet

Dit artikel suggereert dat we geen enorme hoeveelheden computerkracht nodig hebben om te bepalen wat we een AI het volgende moeten leren. Door de moeilijkheid van een taak te behandelen als een dynamische, bewegende staat die verandert met het leerproces van de AI, fungeert KGPS als een uiterst efficiënte coach. Het weet wanneer het de AI moet pushen, wanneer het moet terugdeinen en wanneer het oude onderwerpen opnieuw moet bezoeken, en dat allemaal zonder extra tests uit te voeren. Het verandert het chaotische proces van AI-training in een vloeiende, adaptieve reis, en bewijst dat een beetje slimme wiskunde een lange weg kan afleggen in het slimmer, sneller en efficiënter maken van AI.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →