Elementary Math Word Problem Generation using Large Language Models
Dit paper introduceert MathWiz, een systeem op basis van Large Language Models dat automatisch wiskundetoepassingsproblemen genereert op basis van alleen het aantal, het niveau en het type vraag, waarbij experimenten aantonen dat de gegenereerde problemen van hoge kwaliteit zijn maar nog moeite hebben met het strikt naleven van de specifieke niveau- en typevereisten.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
🧠 De Grote Droom: Een Wiskundeleraar die nooit moe wordt
Stel je voor dat wiskundeleraars een enorme berg werk hebben. Ze moeten elke dag nieuwe, leuke en uitdagende woordproblemen bedenken voor hun leerlingen. Denk aan: "Als Lisa 5 appels heeft en er nog 3 koopt..." Dit is belangrijk, maar het is ook tijdrovend werk. Je moet nadenken over de grammatica, de spelling, en of het probleem echt oplosbaar is voor een kind van bijvoorbeeld 7 jaar.
De auteurs van dit paper wilden een robot-assistent bouwen die dit werk voor hen doet. Ze noemen hun systeem MathWiz.
🤖 De Probleemstelling: De "Slimme" Robot die soms dwaalt
Vroeger waren computers niet slim genoeg om zomaar een wiskundevraag te verzinnen. Je moest ze vaak een begin geven (een "zaadje") of een formule geven, en dan probeerde de computer het verhaal eromheen te bouwen. Dat was als een kok die alleen maar kan koken als jij al de ingrediënten hebt gesneden.
Vandaag de dag hebben we Grote Taalmodellen (LLMs). Dit zijn super-slimme AI's die alles hebben gelezen op internet. Ze kunnen als een echte schrijver werken. Je zegt gewoon: "Maak 5 sommen voor een kind van 10 jaar over optellen," en de AI schrijft ze.
Maar hier zit de haken en ogen:
Deze slimme robots zijn soms te slim voor hun eigen bestwil.
- Ze maken soms grammaticafouten (alsof ze vergeten zijn hoe je "appels" schrijft).
- Ze bedenken soms onoplosbare sommen (bijvoorbeeld: "Tom heeft 5 appels, zijn vriend geeft er nog wat bij. Hoeveel heeft hij nu?" – De AI vergeet te zeggen hoeveel de vriend gaf!).
- Ze vergeten de leeftijd: Ze geven een som over breuken aan een kind dat nog maar net kan tellen.
🛠️ De Oplossing: Het Bouwen van MathWiz
De onderzoekers hebben een systeem gebouwd dat werkt als een meester-kok met een strenge keurmeester. Hier is hoe ze dat deden, stap voor stap:
1. De Beste Kok kiezen (LLM Selectie)
Ze testten verschillende AI-robots (zoals Llama-2 en Zephyr) om te zien wie de beste wiskundevragen kon bedenken. Het was alsof ze verschillende koks uitnodigden voor een proeverij. Ze kozen Llama-2 omdat deze de beste balans had tussen slimheid en snelheid.
2. De Recepten Verbeteren (Prompt Engineering)
Een AI is als een hond: als je niet duidelijk zegt wat je wilt, doet hij wat hij zelf wil. De onderzoekers bedachten speciale opdrachten (prompts).
- Slecht: "Maak een som."
- Goed: "Je bent een wiskundeleraar. Maak 5 sommen over optellen voor kinderen van 7 jaar. Zorg dat de zinnen kloppen."
Ze ontdekten dat het helpen om de AI een rol te geven (een "persona") en een voorbeeld te tonen, de resultaten enorm verbeterde.
3. Variatie toevoegen (Diversiteit)
Stel je voor dat een AI 100 keer dezelfde zin bedenkt: "Jan heeft 1 appel..." Dat is saai! De onderzoekers stelden de "temperatuur" van de AI in.
- Te koud: De AI is saai en herhaalt zich.
- Te heet: De AI wordt gek en bedenkt onzin.
Ze vonden de perfecte temperatuur zodat elke som net even anders is, maar nog steeds logisch blijft.
4. Leren van Mensen (Human Feedback)
Dit is misschien wel het coolste deel. De AI maakte nog steeds fouten, vooral over de juiste leeftijd en het juiste onderwerp. Dus, de onderzoekers lieten echte mensen (leraren en studenten) de antwoorden beoordelen.
- De AI probeerde een som.
- De mens zei: "Goed!" of "Nee, dit is te moeilijk."
- De AI leerde van deze feedback en werd slimmer. Dit noemen ze RLHF (Reinforcement Learning from Human Feedback). Het is alsof je een puppy traint: als hij goed doet, krijgt hij een snoepje; als hij fout doet, krijgt hij een zachte "nee".
5. De "Controleur" (Solvability Check)
Omdat de AI soms onoplosbare sommen bedacht, bouwden ze een tweede AI die fungeerde als een strenge keurmeester.
- De eerste AI bedacht een som.
- De tweede AI keek er direct naar en vroeg: "Is dit oplosbaar? Klopt de logica?"
- Als het antwoord "Nee" was, werd de som weggegooid en vroeg de eerste AI om een nieuwe. Dit is als een poortwachter die alleen de goede gasten binnenlaat.
🏆 Het Resultaat: Een Beter, Maar Nog Niet Perfect Systeem
Het systeem MathWiz is nu in staat om duizenden wiskundevragen te maken die:
- Geen spelfouten hebben.
- Logisch oplosbaar zijn.
- Veilig zijn voor kinderen.
Maar...
De AI heeft nog steeds moeite om precies te weten welke som bij welke schoolklas hoort. Het is alsof de AI een boek kan schrijven, maar soms vergeet hij of het boek voor een kleuter of voor een tiener is bedoeld. De onderzoekers hopen in de toekomst dit op te lossen door de AI te koppelen aan een digitale bibliotheek met de officiële leerplannen (RAG-techniek).
🎁 De Gouden Schat: De Dataset
Naast de robot hebben de onderzoekers een groot boek met fouten gemaakt. Ze hebben duizenden door AI gegenereerde sommen verzameld en elke fout (spelling, logica, leeftijd) handmatig gemarkeerd. Deze "schat" is nu openbaar beschikbaar voor iedereen die aan dit soort onderzoek doet.
Samenvattend
De onderzoekers hebben een AI-assistent gebouwd die wiskundevragen schrijft. Ze hebben hem getraind met voorbeelden, getest met verschillende instellingen, getraind door mensen, en een controleur erbij gehaald. Het resultaat is een systeem dat veel beter is dan wat er eerder bestond, maar het is nog steeds een werk in uitvoering. Het is als een jonge leerling die al veel kan, maar nog steeds een beetje hulp nodig heeft om precies te weten wat de leraar precies wil.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.