← Nieuwste papers
💻 computer science

Fine-Tuning Large Language Models for Codebook-Guided Coding of Students' Mathematics Metaphor Responses

Deze studie toont aan dat het fine-tunen van compacte, open-weight large language models met LoRA de nauwkeurigheid en betrouwbaarheid van het coderen van wiskundige metaforen van studenten aanzienlijk verbetert, waardoor ze propriëtaire modellen kunnen evenaren of overtreffen terwijl ze een schaalbaar, privacybewust alternatief bieden voor educatieve beoordeling.

Oorspronkelijke auteurs: Liang Zhang, Stephen Hwang, Yue Ma, Jinfa Cai

Gepubliceerd 2026-08-12
📖 8 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Liang Zhang, Stephen Hwang, Yue Ma, Jinfa Cai

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een detective bent die een mysterie probeert op te lossen, maar in plaats van vingerafdrukken zoek je naar aanwijzingen in de manier waarop mensen over hun gevoelens praten. In de wereld van het onderwijs vragen onderzoekers leerlingen vaak om hun gedachten in hun eigen woorden op te schrijven — zoals: "Als wiskunde een voedselmiddel zou zijn, wat zou het dan zijn?" Deze open eind antwoorden zijn goudmijnen voor het begrijpen van hoe kinderen over school denken, maar ze zijn een nachtmerrie om één voor één door te lezen. Het kost menselijke experts veel tijd om duizenden van deze verhalen te lezen en ze in categorieën in te delen, zoals "blij", "gefrustreerd" of "verward". Dit is waar Kunstmatige Intelligentie (AI) in beeld komt. Specifiek zijn Large Language Models (LLMs) als superintelligente robots die menselijke taal kunnen lezen en begrijpen. De grote vraag die onderzoekers zich hebben gesteld is: Kunnen we deze robots leren om te handelen als deskundige menselijke detectives? En als we dat doen, kunnen we ze dan op onze eigen computers laten werken om de geheimen van leerlingen veilig te houden, in plaats van privédata naar grote technologiebedrijven te sturen?

Deze studie duikt in precies die vraag. De onderzoekers namen een collectie van 2.265 echte reacties van leerlingen over wiskunde-metaforen en leerden twee kleinere, open-source AI-modellen om ze te coderen precies zoals een menselijke expert dat zou doen. Ze gebruikten een speciale trainingsmethode genaamd "fine-tuning", wat lijkt op het geven van een spoedcursus aan de robot met behulp van de antwoordsleutels van de menselijke experts. De resultaten waren verrassend: na deze training werden de kleinere, goedkopere AI-modellen zo goed in de taak dat ze de enorme, dure "black-box" AI-modellen die bedrijven gewoonlijk verkopen, vaak versloegen. De studie suggereert dat we, met de juiste training, krachtige, privé en nauwkeurige AI-tools in onze eigen klaslokalen kunnen hebben om te begrijpen hoe leerlingen over wiskunde denken, zonder dat we hun data ergens anders naartoe hoeven te sturen.

Het Dilemma van de Detective: Tussen de Regels Lezen

Beschouw de metafoor van een leerling als een geheime code. Wanneer een leerling zegt: "Wiskunde is als een hond omdat het een trouwe vriend is," praten ze niet alleen over huisdieren; ze vertellen ons dat ze zich veilig en gelukkig voelen bij wiskunde. Maar als ze zeggen: "Wiskunde is als een mug omdat het me niet met rust laat," zeggen ze dat wiskunde irritant en onontkomelijk is. Dit zijn complexe gevoelens gehuld in eenvoudige woorden.

Decennialang hebben onderzoekers vertrouwd op menselijke experts om deze boodschappen te ontcijferen. Het is een beetje als het hebben van een team vertalers dat probeert een bibliotheek aan boeken handmatig te vertalen. Het is traag, duur en moeilijk op te schalen. Als je 100 leerlingen hebt, kan een mens het aan. Als je er 100.000 hebt, worden de mensen moe en komt het proces tot stilstand.

Hier komt de Large Language Model (LLM) in beeld. Je kunt een LLM zien als een robot die bijna alles op het internet heeft gelezen. Het is ongelooflijk goed in het voorspellen van wat volgt in een zin en het begrijpen van context. Maar, net als een slimme leerling die de specifieke les die jij geeft nog niet heeft gevolgd, begrijpt een generieke robot misschien niet precies hoe je wilt dat hij deze metaforen sorteert. Hij kan "blij" raden terwijl je "neutraal" wilde, of hij kan het subtiele verschil missen tussen "uitdagend" en "bedreigend".

Bovendien is er een privacyprobleem. De meeste superkrachtige robots (zoals die van grote technologiebedrijven) leven op hun servers. Om ze te gebruiken, moet je de privégeschriften van je leerlingen naar hen sturen. Voor scholen is dit als het overhandigen van een dagboek vol geheimen aan een vreemde. De onderzoekers wilden weten of ze een robot konden bouwen die op hun eigen computer leeft, specifiek voor de taak is getraind en de geheimen veilig houdt.

Het Experiment: De Robot de Regels Leren

De onderzoekers organiseerden een race. Aan de ene kant hadden ze de "Big Tech"-kampioenen: twee krachtige, propriëtaire modellen (GPT-4o mini en GPT-5 mini) die "as is" werden gebruikt. Ze kregen een set regels (een codeboek) en de opdracht om de wiskunde-metaforen van leerlingen te sorteren. Ze kregen geen speciale training; ze moesten het gewoon uitzoeken op basis van de instructies.

Aan de andere kant hadden ze twee "Open-Weight" modellen (DeepSeek-R1 1.5B en Mistral 7B). Dit zijn kleinere, goedkopere modellen die iedereen kan downloaden en op zijn eigen servers kan draaien. De onderzoekers namen deze modellen en gaven ze een "spoedcursus" met behulp van een techniek genaamd LoRA-gebaseerde supervised fine-tuning.

Stel je voor dat je een hond leert om te apporteren. De "prompt-only" methode is als het steeds tegen de hond zeggen: "Ga halen de bal!" De "fine-tuning" methode is als het meenemen van de hond naar een trainingskamp waar je hem precies laat zien hoe hij de bal moet grijpen, terug moet brengen en in je hand moet leggen, met behulp van duizenden voorbeelden van een mens die het perfect doet. De onderzoekers voerden de open-weight modellen 2.265 voorbeelden van metaforen van leerlingen die al correct waren gesorteerd door menselijke experts. De modellen leerden de beslissingen van de menselijke experts na te bootsen.

De taak bestond uit twee delen:

  1. Valentie-Intensiteit Codering: Hoe sterk is het gevoel? Is het zeer negatief (1), neutraal (3), of zeer positief (5)?
  2. Thematische Codering: Wat is het verhaal? Is wiskunde een "instrument", een "bedreiging", een "reis" of een "saaie taak"?

De Resultaten: De Underdogs Winnen

De resultaten van de race waren duidelijk en opwindend. Voordat de training begon, waren de kleinere open-weight modellen slecht in de taak. Ze gokten maar wat. Maar na de "spoedcursus" (fine-tuning), transformeerden ze.

De Prestatiesprong:
De getrainde modellen werden niet alleen een beetje beter; ze werden veel beter.

  • Voor de "voedsel" metaforen sprong de nauwkeurigheid van het DeepSeek-model van 0,369 naar 0,787.
  • De nauwkeurigheid van het Mistral-model op voedselmetaforen ging van 0,207 naar 0,778.
  • Op de "dier" metaforen verbeterde het Mistral-model van 0,267 naar 0,766.

In de wereld van AI zijn deze cijfers enorm. Het betekent dat de getrainde robots nu bijna net zo vaak overeenstemming vertonen met de menselijke experts als twee menselijke experts met elkaar.

De Reuzen Verslaan:
Hier is de wending: de getrainde, kleinere modellen versloegen de grote, dure, "prompt-only" modellen in veel categorieën.

  • Het getrainde Mistral 7B-model presteerde op bijna elke metriek beter dan zowel GPT-4o mini als GPT-5 mini voor zowel voedsel- als dier-metaforen.
  • De enige keer dat de grote modellen wonnen, was bij zeer zeldzame, specifieke thema's waar de kleinere modellen nog een beetje mee worstelden, maar zelfs dan was het gat klein.

De "Stabiliteitstest":
Een van de grootste problemen met AI is dat als je het twee keer dezelfde vraag stelt, het je twee verschillende antwoorden kan geven. Dat is slecht voor de wetenschap. De onderzoekers testten dit door de modellen drie keer te draaien.

  • Het ongetrainde DeepSeek-model was alle kanten op, met een stabiliteitsscore van slechts 0,592.
  • Maar na de training schoot de stabiliteit van de DeepSeek omhoog naar 0,992.
  • Het getrainde Mistral-model was perfect en scoorde 1,000.
  • Zelfs de grote commerciële modellen waren niet zo stabiel als de getrainde open modellen (GPT-5 mini scoorde 0,644 op thematische stabiliteit).

Dit suggereert dat het trainen van het model op specifieke voorbeelden het niet alleen slimmer maakt, maar ook consistenter en betrouwbaarder.

Wat Dit Betekent voor de Toekomst

De studie suggereert dat we geen enorme, dure en privacygevoelige AI-systemen nodig hebben om de gevoelens van leerlingen te analyseren. Door kleinere, open modellen te nemen en ze met menselijke voorbeelden te trainen, kunnen we tools creëren die:

  1. Nauwkeurig zijn: Ze komen overeen met menselijke experts.
  2. Privé zijn: Ze kunnen op de eigen computer van een school draaien, waardoor de data van leerlingen veilig blijft.
  3. Schaalbaar zijn: Ze kunnen duizenden reacties in seconden verwerken.

De onderzoekers merken echter voorzichtig op dat dit geen toverstaf is voor alles. De modellen hadden nog steeds wat moeite met zeer zeldzame thema's (zoals specifieke maatschappelijke opvattingen over wiskunde), wat suggereert dat als een onderwerp zeer ongebruikelijk is, de robot zelfs meer voorbeelden nodig heeft om te leren. Ook keek de studie alleen naar leerlingen uit groep 6 tot en met 8 die over voedsel en dieren praatten, dus we weten nog niet of het ook werkt voor middelbare scholieren die over algebra praten of studenten die over calculus praten.

Maar de belangrijkste boodschap is een hoopvolle: we kunnen onze eigen "detectiverobots" bouwen die slim, veilig en klaar zijn om leraren te helpen de verborgen gevoelens in de woorden van hun leerlingen te begrijpen. De toekomst van onderwijsmeting ligt misschien niet in de cloud, maar daar op de server van de school, getraind door de experts die de leerlingen het beste kennen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →