← Nieuwste papers
💬 NLP

Pass the Baton: Trajectory-Relayed On-Policy Distillation

Het artikel introduceert Relay-OPD, een nieuwe on-policy distillatiemethode die prefix-falen mitigeert door teacher-interventies dynamisch te triggeren om afwijkingen in de student-trajecten te corrigeren, waarmee state-of-the-art prestaties wordt behaald op benchmarks voor wiskundig redeneren terwijl de trainings-trajectlengte aanzienlijk wordt verminderd.

Oorspronkelijke auteurs: Haolei Xu, Xiaowen Xu, Haiwen Hong, Zixuan Ni, Hongxing Li, Yiwen Qiu, Weiming Lu, Yongliang Shen

Gepubliceerd 2026-07-29
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Haolei Xu, Xiaowen Xu, Haiwen Hong, Zixuan Ni, Hongxing Li, Yiwen Qiu, Weiming Lu, Yongliang Shen

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een wereld voor waarin gigantische, superintelligente computers (Large Language Models genoemd) leren om complexe puzzels op te lossen, zoals wiskundeproblemen of logische raadsels. Om hen te onderwijzen, gebruiken we vaak een "leraar-leerling"-opstelling. De leraar is een enorm, krachtig model dat de antwoorden kent, en de leerling is een kleiner, sneller model dat van de leraar probeert te leren. Meestal schrijft de leraar gewoon de perfecte oplossing uit, en de leerling kopieert deze. Maar er is een slimmere manier genaamd On-Policy Distillation. In plaats van alleen een voltooid essay te kopiëren, probeert de leerling de oplossing zelf te schrijven. Als de leerling vastloopt of een verkeerd pad inslaat, grijpt de leraar in om het volgende woord, op dat exacte moment, te begeleiden. Dit is geweldig omdat het de leerling leert hoe hij moet denken, niet alleen wat hij moet onthouden.

Deze methode heeft echter een lastige fout. Als de leerling vroegtijdig een fout maakt — zoals een verkeerde afslag nemen in een doolhof — probeert de leraar de rest van de reis te begeleiden. Maar omdat de leerling al verdwaald is, wordt de begeleiding van de leraar vaak verwarrend of onbetrouwbaar, en blijft de leerling steeds verder van het juiste pad afdwalen. Het is alsoal iemand de weg wijzen terwijl diegene al de verkeerde kant op rijdt; hoe verder men rijdt, hoe verwarder men wordt. Dit artikel pakt dit specifieke probleem aan: hoe voorkomen we dat de leerling hopeloos verdwaalt voordat de hulp van de leraar nutteloos wordt?

De Estafette van het Redeneren

De auteurs van dit artikel, werkend met modellen uit de Qwen-familie, realiseerden zich dat wanneer een leerlingmodel uit koers raakt, de leraar en de leerling daadwerkelijk van mening gaan verschillen over wat de volgende stap moet zijn. De leerling, koppig vasthoudend aan zijn foute idee, wil rechtdoor blijven gaan. De leraar, die de fout ziet, wil stoppen, nadenken en van richting veranderen.

Ze noemen dit moment van onenigheid een "handoff trigger" (overdrachtstrigger). Denk aan een estafette. In een normale race, als de hardloper (de leerling) struikelt en de verkeerde kant op begint te rennen, kan de coach (de leraar) vanaf de zijlijn instructies roepen, maar de hardloper blijft struikelen. In deze nieuwe methode, genaamd Relay-OPD, springt de coach in op het moment dat hij ziet dat de hardloper naar een klif rent; de coach pakt het stokje over, rent een paar stappen in de juiste richting om het pad van de hardloper te resetten. Daarna geeft de coach het stokje weer terug en de leerling vervolgt de race, nu weer op het juiste spoor.

Hoe het werkt: De "Maar" en "Wacht" Tokens

Het systeem is slim omdat het geen mens nodig heeft om te vertellen wanneer er een fout wordt gemaakt. Het houdt de waarschijnlijkheden in de gaten. Als de leraar zeer waarschijnlijk een "reflectiewoord" zal zeggen zoals "Maar" (But), "Wacht" (Wait) of "Echter" (However) (die een verandering in gedachte signaleren), terwijl de leerling waarschijnlijk "Dus" (So) of "Nu" (Now) zal zeggen (die een voortzetting van de huidige gedachte signaleren), dan weet het systeem: We zijn uit koers!

Op dat exacte moment neemt de leraar het voor een korte "etappe" van de reis over. De leraar schrijft een korte paragraaf om het redeneren te corrigeren, en geeft vervolgens de controle terug aan de leerling. De leerling voltooit vervolgens de rest van het probleem en leert van het gecorrigeerde pad.

De onderzoekers ontdekten dat deze interventie niet lang hoeft te zijn. Sterker nog, de leraar hoeft slechts ongeveer 0,35% van de totale woorden te schrijven om een enorm verschil te maken. Het is alsof een coach een enkele, scherpe duw geeft om de vorm van een hardloper te verbeteren, in plaats van de hele race voor hem te rennen.

De Resultaten: Slimmer en Sneller

Het team heeft dit getest op acht verschillende wiskundige benchmarks, waarbij gebruik werd gemaakt van studentenmodellen van verschillende groottes (0,6 miljard en 1,7 miljard parameters) en een leraar van 4 miljard parameters. De resultaten waren indrukwekkend:

  • Betere Scores: De Relay-OPD leerlingen scoorden aanzienlijk hoger dan die met standaardmethoden. Voor het 1,7 miljard parameter model verbeterde de gemiddelde score met 5,73% ten opzichte van de standaardmethode en versloeg het de eerstvolgende beste concurrent met 1,49%.
  • Minder Verspilde Tijd: Omdat het systeem de leerling ervan weerhoudt om doodlopende wegen in te slaan, werd het trainingsproces veel efficiënter. De gemiddelde lengte van de trainingspaden werd met meer dan 50% verkort. De leerlingen leerden evenveel in de helft van de tijd.
  • De "Etappe" is Belangrijk: De onderzoekers bewezen dat de korte correctie van de leraar (de "teacher leg") cruciaal was. Het simpelweg stoppen van de leerling wanneer deze een fout maakte (zonder dat de leraar het eerst herstelde) werkte niet zo goed. De leraar moest de leerling laten zien hoe hij weer op het juiste spoor kwam.

Wat het Niet Is

Het artikel is zorgvuldig in het laten zien wat deze methode niet is. Het is niet alleen het vroegtijdig afkappen van lange antwoorden (wat andere methoden probeerden), noch is het het herschrijven van het hele essay van de leerling nadat het voltooid is. Het is een real-time, "in het moment"-correctie. Het gaat er ook niet om dat de leraar de hele race overneemt; de leerling doet nog steeds het grootste deel van het werk. De leraar grijpt alleen in tijdens die kritieke, korte uitbarstingen wanneer de leerling een permanente fout dreigt te maken.

Kortom, Relay-OPD is als een vangnet dat een vallende leerling opvangt net voordat deze de grond raakt, hem voorzichtig een nieuwe richting geeft, en hem dan weer laat doorrennen. Het verandert een potentieel drama in een leermoment, waardoor AI-modellen slimmer, sneller en minder geneigd worden om verdwaald te raken in hun eigen gedachten.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →