← Nieuwste papers
💬 NLP

SimpleOPD: Simple Tokenizer-Agnostic On-Policy Distillation for Long-Context Reasoning

Het artikel introduceert SimpleOPD, een tokenizer-agnostisch on-policy distillatiekader dat gedeelde tekstsegmenten uitlijnt en een student-referentie KL-verlies gebruikt om effectief de long-context bewijsredeneercapaciteiten van sterke docenten over te dragen naar short-context studenten, waarbij significante prestatiewinsten worden behaald op wiskundige en wetenschappelijke benchmarks.

Oorspronkelijke auteurs: Haonan He, Haodi Lei, Yun Luo, Haoran Zhang, Shunkai Zhang, Yizhuo Li, Shengji Tang, Zhilin Wang, Runzhe Zhan, Lei Bai, Ganqu Cui, Fangchen Yu, Yafu Li, Peng Ye, Ning Ding, Yu Cheng

Gepubliceerd 2026-08-17
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Haonan He, Haodi Lei, Yun Luo, Haoran Zhang, Shunkai Zhang, Yizhuo Li, Shengji Tang, Zhilin Wang, Runzhe Zhan, Lei Bai, Ganqu Cui, Fangchen Yu, Yafu Li, Peng Ye, Ning Ding, Yu Cheng

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een briljante, langwindige professor probeert te leren hoe hij een complex idee moet uitleggen aan een snelle student die slechts een klein notitieboekje heeft. Dit is de wereld van Kunstmatige Intelligentie, specif으로 de discipline "Large Language Models" (LLM's). Dit zijn computerprogramma's die getraind zijn om menselijke taal te begrijpen en te genereren. Soms hebben we een "leraar"-model dat ongelooflijk slim is in het oplossen van moeilijke problemen, zoals wiskundige bewijzen, maar dat denkt in enorme, uitgestrekte zinnen. Dan hebben we een "student"-model dat kleiner, sneller en met een korter geheugen is. Het doel is om de slimheid van de leraar over te dragen op de student.

Lange tijd probeerden wetenschappers dit te doen door de leraar antwoorden te laten opschrijven en de student simpelweg te laten kopiëren. Maar dit is alsof je een student vraagt om een woordenboek uit het hoofd te leren zonder de woorden te begrijpen; dat leert hen niet altijd hoe ze moeten denken. Een nieuwere, slimmere methode genaamd "On-Policy Distillation" (OPD) veranderde het spel. In plaats van alleen te kopiëren, probeert de student een probleem op te lossen, terwijl de leraar het denkproces van de student in realtime volgt, waarbij hij bij elke stap correcties en begeleiding biedt. Het is als een coach die direct naast een atleet staat en de vorm corrigeert terwijl hij rent, in plaats van later alleen een video van een perfecte loop te laten zien. Echter, er is een addertje onder het gras: als de leraar en de student verschillende "talen" spreken (verschillende manieren om woorden in stukjes te breken, ook wel "tokenizers" genoemd) of als de leraar gewend is romans te schrijven terwijl de student slechts ruimte heeft voor een tweet, kan de coaching misgaan. De student kan in de war raken, eindeloos beginnen te babbelen, of crashen omdat de instructies niet passen.

Dit paper, getiteld SimpleOPD, pakt precies deze rommelige situatie aan. De onderzoekers wilden een superintelligente, context-rijke leraar-model (genaamd SU-01) die uitblinkt in wiskundige bewijzen, gebruiken om diverse kleinere student-modellen te onderwijzen, zelfs de modellen die een totaal andere interne "taal" (tokenizer) en veel kortere geheugenlimieten hebben. Ze ontdekten dat het simpelweg laten kopiëren door de leraar vaak averechts werkte. De student raakte overweldigd, begon reacties te schrijven die ongecontroleerd lang werden (een "lengte-explosie") en liep uiteindelijk tekort aan ruimte, waardoor de eigen antwoorden werden afgekapt voordat ze klaar waren.

Om dit op te lossen, hebben het team een slimme, "tokenizer-agnostische" aanpak uitgevonden. In plaats van de leraar en de student te dwingen het eens te worden over welk specifiek stukje van een woord ze bekijken, kwamen ze overeen om naar de werkelijke tekst op de pagina te kijken. Als de leraar "math" zegt en de student zegt "mat" en "h", realiseerden zij zich dat dit slechts verschillende manieren zijn om hetzelfde geluid te schrijven. Ze stemden de instructies af op basis van de gedeelde tekst, waarbij de technische verschillen in hoe de computers de woorden hakten, werden genegeerd. Maar ze stopten daar niet; ze introduceerden twee veiligheidsnetten om te voorkomen dat de studenten zouden gaan babbelen. Ten eerste vertelden ze de leraar om de student niet te blijven lastigvallen over wanneer hij moest stoppen met praten (het negeren van specifieke "stop"-tokens), zodat de student niet in de war zou raken over wanneer hij moest eindigen. Ten tweede voegden ze een milde "reality check" toe (een KL-loss) die de student eraan herinnerde dicht bij zijn oorspronkelijke, redelijke zelf te blijven, om te voorkomen dat hij te ver zou afdrijven in wilde, eindeloze lussen.

De resultaten waren indrukwekkend. Door deze methode te gebruiken, leerden de student-modellen niet alleen te kopiëren; ze leerden te redeneren. Bijvoorbeeld, een student-model, Intern-S2-Preview, zag zijn score op een moeilijke wiskundige bewijstest (ProofBench) met 22,8 punten stijgen, van 21,70 naar 44,50 in de primaire experimenten. In een specifieke evaluatiesetting waarbij Gemini-2.5-Pro als rechter werd gebruikt, was de verbetering zelfs nog groter, met een stijging van 34,0 naar 55,2. Deze verbetering was zo significant dat het de prestaties van andere zeer krachtige, gesloten bron-modellen zoals Gemini-2.5-Pro overtrof. Het paper suggereert dat deze techniek niet alleen goed werkt voor wiskunde, maar ook helpt om de nieuwe vaardigheden van de studenten te generaliseren naar wetenschappelijke problemen die ze nog niet eerder hebben gezien. In essentie bewees SimpleOPD dat je een klein brein met een kort geheugen kunt leren om te denken als een gigantische, langwindige genie, zelfs als ze verschillende technische talen spreken, zolang je ze maar een gedeelde tekstruimte geeft en een paar regels om te voorkomen dat ze voor eeuwig blijven praten.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →