← Nieuwste papers
🤖 machine learning

Knowledge Distillation from Large Reasoning Models to Compact Student Models: A Case Study on the John O Bryan Mathematics Competition

Dit artikel toont aan dat het finetunen van een compact Qwen2.5-7B studentmodel met Chain-of-Thought-data gedestilleerd van de DeepSeek-R1 leraar via een dual-agent framework en early stopping de nauwkeurigheid op de John O'Bryan Mathematics Competition en MATH-500 benchmarks aanzienlijk verbetert, terwijl het ook onthult dat kortere responslengtes correleren met een verminderde kwaliteit van de redenering.

Oorspronkelijke auteurs: Gaurab Baral, Aaditya Khanal, Yangyang Tao, Junxiu Zhou

Gepubliceerd 2026-07-01
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Gaurab Baral, Aaditya Khanal, Yangyang Tao, Junxiu Zhou

Oorspronkelijk artikel vrijgegeven aan het publieke domein onder CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een briljante, wereldklasse wiskundeleraar hebt (laten we hem Professor DeepSeek noemen) die ongelooflijk moeilijke competitieproblemen kan oplossen. Hij is geweldig, maar hij is ook enorm, traag en vereist een massale supercomputer om te draaien. Je wilt een kleinere, snellere en goedkopere student leren (laten we haar Student Qwen noemen) om als de professor te denken, zodat zij hetzelfde werk kan doen op een gewone laptop.

Dit artikel is het verhaal van hoe de onderzoekers probeerden de student te onderwijzen met behulp van een specifieke set wiskundeproblemen van de John O'Bryan Mathematics Competition (een echte wedstrijd die van 2011 tot 2025 werd gehouden aan Northern Kentucky University).

Hier is het verhaal van hun experiment, eenvoudig uitgelegd:

1. De Trainingsmethode: "Laat je berekening zien"

De onderzoekers gaven de student niet alleen de eindantwoorden. Ze gebruikten een speciale techniek genaamd Chain-of-Thought (CoT) Distillation.

  • De Leraar: Eerst loste de "Professor DeepSeek" 671 problemen uit eerdere competities op. Maar in plaats van alleen het antwoord te schrijven, schreef hij elke stap van zijn denkproces uit, zoals een leerling die zijn berekeningen laat zien bij een toets.
  • De Verificateur: Een tweede AI controleerde het werk van de Professor om te controleren of de stappen daadwerkelijk correct waren. Alleen de perfecte oplossingen werden bewaard.
  • De Student: De "Student Qwen" (een kleiner model) werd vervolgens getraind om deze stapsgewijze oplossingen na te bootsen.

2. De "Over-oefen" Valstrik

De onderzoekers stuitten op een klassiek probleem: Overfitting.
Stel je voor dat een student de exacte antwoorden op een oefentoets uit het hoofd leert in plaats van de wiskundige concepten te begrijpen. Als je haar een iets andere vraag geeft, faalt ze.

  • De onderzoekers lieten de student aanvankelijk trainen voor 1.000 "rondes" (iteraties).
  • Het Resultaat: De student begon de specifieke woorden van de trainingsproblemen te memoriseren in plaats van de logica te leren. Haar prestaties werden op nieuwe problemen zelfs slechter.
  • De Oplossing: Ze realiseerden zich dat de student haar piek bereikte bij 200 rondes. Daarna was ze alleen nog maar aan het kopiëren. Dus stopten ze de training vroegtijdig (bij 200 rondes) om haar "vers" en in staat tot generaliseren te houden.

3. De Resultaten: Een Solide Verbetering

Door vroegtijdig te stoppen, verbeterde de student aanzienlijk:

  • Vóór de Training: De student kreeg ongeveer 65% van de competitieproblemen goed.
  • Na de Training: Zij sprong naar ongeveer 69,4%.
  • De Bonus: Ze werd niet alleen beter in deze specifieke problemen; ze werd ook beter in een ander, beroemd wiskundig benchmark genaamd MATH-500, wat bewees dat ze daadwerkelijk de vaardigheid van redeneren had geleerd, en niet alleen de antwoorden.

4. Het "Woordtelling" Experiment

De onderzoekers wilden weten: Hoeveel "denkruimte" heeft de student nodig?
Ze dwongen de student om problemen op te lossen met strikte limieten op het aantal woorden dat ze mocht schrijven (zoals een strikte woordtelling bij een toets).

  • Geen Limiet (R1): Ze schreef ongeveer 220 woorden en kreeg 69% goed.
  • Matige Limiet (R2): Ze schreef ongeveer 120 woorden en zakte naar 62%.
  • Strakke Limiet (R6): Ze werd gedwongen om slechts ongeveer 31 woorden te schrijven. Haar nauwkeurigheid stortte in naar 42%.

De Analogie: Het is alsof je iemand vraagt een complexe puzzel op te lossen. Als je hen een klein notitieblok geeft (weinig woorden), moeten ze stappen overslaan en gokken. Als ze een volledig schrift hebben (veel woorden), kunnen ze de logica opschrijven en het goed doen. De studie vond dat je voor deze moeilijke problemen ongeveer 50 tot 100 woorden aan "denkruimte" nodig hebt om een goed antwoord te krijgen.

5. Waar Zij Moeite Mee Had

  • Snelheid vs. Logica: De student was het zwakst in de sectie "Two-Person Speed" van de competitie. Deze problemen vereisten snelle, meerstapsberekeningen. Wanneer de woordtelling krap was, kon ze de noodzakelijke berekeningsstappen niet passen, en haar nauwkeurigheid daalde harder dan in andere secties.
  • Opmaakfouten: Interessant genoeg vonden de onderzoekers dat ongeveer 40% van de fouten van de student niet kwam doordat ze slecht was in wiskunde. Ze had het juiste getal eigenlijk wel goed, maar schreef het op een slordige manier (zoals het onveranderd laten van een breuk of het vergeten om het antwoord in een kader te zetten). Als een mens of een simpel script haar handschrift had opgeschoond, zou haar score nog hoger zijn geweest.

De Kern van het Verhaal

Dit artikel bewijst dat je een gigantische, krachtige AI kunt nemen en een kleinere, goedkopere AI kunt leren om effectief door wiskundeproblemen te redeneren, maar alleen als je de training stopt voordat ze begint met het uit het hoofd leren.

Er is echter een addertje onder het gras: Denken kost ruimte. Als je de AI dwingt om te beknopt te zijn (te weinig woorden), verliest ze het vermogen om moeilijke problemen op te lossen. De "sweet spot" voor dit soort wiskundecompetities lijkt het toestaan van genoeg ruimte om ongeveer 50 tot 100 woorden aan redenering op te schrijven te zijn.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →