Temporal Stability and Few-Shot Prompting in Math Task Assessment
Deze longitudinale studie toont aan dat, hoewel updates van modelversies op zichzelf inconsistent resultaten opleveren bij het classificeren van de cognitieve vraagstelling van wiskundetaakjes, few-shot prompting de prestaties van zowel algemene als onderwijsgerichte AI-tools significant en betrouwbaar verbetert, wat erop wijst dat prompt engineering een effectievere strategie is voor het verbeteren van AI in educatieve contexten dan het uitsluitend vertrouwen op passieve modelverbeteringen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je twee verschillende "AI-onderwijsassistenten" inhuurt om je te helpen een stapel wiskundehuiswerkproblemen te sorteren. Je doel is om ze in twee stapels te verdelen: "Eenvoudige, routinematige oefeningen" en "Moeilijke, denkintensieve uitdagingen". Je geeft ze een regelboek (de Task Analysis Guide) om hen te helpen beslissen.
Dit onderzoek is als een langdurige controle van deze twee assistenten om te zien of ze consistent blijven in de tijd en of het geven van een "spiekbriefje" met voorbeelden hen helpt hun werk beter te doen.
Hier is wat er gebeurde, eenvoudig uitgelegd:
De Twee Assistenten
De onderzoekers testten twee verschillende AI-tools:
- Gemini: Een "algemene" assistent. Denk hierbij aan een zeer slim, goed gelezen bibliothecaris die iets weet van alles, inclusief wiskunde.
- Coteach: Een "onderwijs-specifieke" assistent. Denk hierbij aan een veteraan wiskundeleraar die jarenlang examens heeft nagekeken en de specifieke eigenaardigheden van schoolwiskunde kent.
Deel 1: De "Tijdsreis"-test (Temporele stabiliteit)
De onderzoekers vroegen beide assistenten om op Dag 1 de wiskundeproblemen te sorteren. Daarna wachtten ze zeven weken en vroegen ze hen om precies dezelfde problemen opnieuw te sorteren.
In de echte wereld gebeuren software-updates constant. Het is alsof je favoriete videospel een patch-update krijgt; soms wordt het spel beter, maar soms beweegt een personage dat je leuk vond plotseling anders of wordt het zwakker.
Wat gebeurde er met de Algemene Assistent (Gemini)?
Zijn algemene score bleef exact hetzelfde (58% correct). Als je echter goed keek, had hij van gedachten veranderd over specifieke problemen. Hij kreeg drie nieuwe problemen goed die hij eerder had gemist, maar hij kreeg drie oude problemen fout die hij eerder had opgelost.- De Analogie: Stel je een rechter voor die gemiddeld dezelfde straf geeft, maar wel uitwisselt welke specifieke misdaden de doodstraf krijgen en welke levenslang. Het "gemiddelde" lijkt hetzelfde, maar de specifieke uitkomst voor jouw zaak is onvoorspelbaar veranderd. Dit heet "prompt drift".
Wat gebeurde er met de Leraar-Assistent (Coteach)?
Deze werd slechter. Zijn score daalde significant van 75% correct naar 50%.- De Analogie: Stel je een veteraanleraar voor die plotseling begint te vergeten hoe hij basisproeven moet nakijken. Ze hebben niet alleen hun antwoorden verwisseld; ze hebben daadwerkelijk een deel van hun vermogen verloren om het werk correct te doen.
De Grote Les: Alleen omdat een AI-tool een "nieuwe versie" krijgt of op de achtergrond updates, betekent niet dat het beter wordt in jouw specifieke taak. Soms blijft het hetzelfde maar gedraagt het zich anders, en soms wordt het zelfs slechter.
Deel 2: De "Spiekbriefje"-test (Few-Shot Prompting)
Na de zeven weken wachttijd probeerden de onderzoekers een nieuwe truc. In plaats van de assistenten alleen maar de problemen te laten sorteren, gaven ze hen een "spiekbriefje". Dit blad toonde hen twee perfecte voorbeelden van een "Eenvoudig" probleem en twee perfecte voorbeelden van een "Moeilijk" probleem, samen met de juiste labels voor elk.
Dit heet Few-Shot Prompting. Het is alsof je tegen een nieuwe werknemer zegt: "Hier is een voorbeeld van een goed verslag en een voorbeeld van een slecht verslag. Kijk nu naar deze nieuwe stapel en sorteer ze zoals deze."
- De Resultaten:
- Gemini (De Bibliothecaris): Wordt beter! Zijn score steeg van 58% naar 67%.
- Coteach (De Leraar): Wordt veel beter! Hij herstelde zich van zijn lage score van 50% helemaal naar 75%, terugkerend naar zijn oorspronkelijke "expert"-niveau.
De Grote Les: Het geven van de AI een paar duidelijke voorbeelden (het spiekbriefje) hielp hem beter te presteren dan wachten tot het softwarebedrijf een nieuwe versie uitbrengt. Sterker nog, het "spiekbriefje" repareerde de fouten van de leraar-assistent volledig.
Het Probleem met "Het Moeilijke"
Er was één addertje onder het gras. De AI-tools waren uitstekend in het sorteren van de "Eenvoudige" routinematige problemen. Maar ze hadden het echt moeilijk met de "Moeilijke, denkintensieve" problemen (genaamd "Wiskunde doen").
Zelfs met het spiekbriefje bleef de AI de moeilijkste problemen verkeerd classificeren.
- De Analogie: Het is als een student die geweldig is in het memoriseren van vermenigvuldigingstabellen, maar in de war raakt wanneer hem wordt gevraagd een woordprobleem op te lossen waarbij hij een nieuwe manier van denken moet uitvinden. De AI neigt naar de oppervlakkige woorden te kijken (zoals "bereken" of "toon je werk") in plaats van het diepe denken te begrijpen dat vereist is. Het probeert een kortere weg te vinden in plaats van het zware mentale werk te doen.
Samenvatting van de Beweringen van het Artikel
- AI is onstabiel: Zelfs over een korte periode (7 weken) kunnen AI-tools veranderen hoe ze vragen beantwoorden, soms slechter wordend, soms gewoon onvoorspelbaar gedragend.
- Updates zijn geen magie: Nieuwere versies van AI betekenen niet automatisch betere prestaties op specifieke schooltaken.
- Voorbeelden helpen: Het geven van de AI een paar duidelijke voorbeelden (Few-Shot Prompting) is een krachtige manier om fouten te herstellen en de nauwkeurigheid te verbeteren, vaak effectiever dan wachten op software-updates.
- Gespecialiseerde tools hebben hulp nodig: De onderwijs-specifieke tool (Coteach) was gevoeliger voor veranderingen (het werd sneller slechter), maar reageerde ook beter op het "spiekbriefje" dan de algemene tool.
- Moeilijk denken is nog steeds moeilijk: AI heeft het nog steeds moeilijk om de meest complexe wiskundetaak te identificeren, en verward ze vaak met eenvoudigere, zelfs wanneer voorbeelden worden gegeven.
Het artikel concludeert dat als je een leraar of onderzoeker bent die AI gebruikt, je niet zomaar moet vertrouwen op het feit dat de tool "nieuw" is. Je moet actief controleren of het nog steeds goed werkt en klaar zijn om duidelijke voorbeelden te geven om zijn denken te sturen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.