← Nieuwste papers
💬 NLP

Toward a Benchmark for Controllable Simulation of Imperfect Students with Large Language Models

Dit artikel introduceert een op benchmarks gerichte raamwerk voor het gebruik van grote taalmodellen om studenten te simuleren met beheersbare, gedeeltelijke vaardigheidsbeheersing ter ondersteuning van lerarenopleidingen, waarbij wordt aangetoond dat hoewel selectieve retentie en onderdrukking van competenties haalbaar zijn, de mate van controle afhankelijk blijft van het specifieke gebruikte model.

Oorspronkelijke auteurs: Alexander Apartsin, Omri Sason, Yehudit Aperstein

Gepubliceerd 2026-05-26
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Alexander Apartsin, Omri Sason, Yehudit Aperstein

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een nieuwe leraar traint. Om goed in zijn of haar werk te worden, moet deze oefenen met leerlingen die specifieke fouten maken, specifieke dingen vergeten en moeite hebben met bepaalde concepten. Ze kunnen niet gewoon oefenen met perfecte genieën; ze moeten zien hoe ze een leerling moeten behandelen die wel weet hoe je optelt, maar vergeten is hoe je aftrekt.

Dit artikel stelt een grote vraag: Kunnen we een superintelligente AI (een Large Language Model) op commando laten doen alsof het een "gebrekkige" student is?

Hier is de uiteenzetting van wat de onderzoekers deden, met behulp van enkele eenvoudige analogieën.

Het Doel: De "Chamelenon"-student

Normaal gesproken willen we dat een AI wiskundeproblemen oplost, willen we dat deze perfect is. We willen dat het een A+ haalt. Maar voor lerarenopleiding hebben we een AI nodig die een "C-min" student is die specifiek vergeten is hoe het om te gaan met breuken, maar nog steeds weet hoe het meetkunde moet doen.

De onderzoekers wilden zien of ze een AI konden zeggen: "Doen alsof je een student bent die Vaardigheid A en Vaardigheid B kent, maar Vaardigheid C volledig bent vergeten."

De Uitdaging: Waarom het Moeilijk is

Stel je een AI voor als een bibliotheek die elk wiskundeboek dat ooit is geschreven, heeft gelezen. Het weet alles.

  • Het Probleem: Als je de bibliotheek vraagt om te "vergeten" hoe je breuken moet doen, is het moeilijk om het te laten stoppen met het gebruik van die kennis. Het is als proberen iemand die van chocolade houdt, plotseling te laten haten, alleen maar omdat je het beleefd hebt gevraagd. De kennis zit diep "ingeburgerd".
  • De Vrees: Als je de AI vraagt om breuken te vergeten, vergeet het dan per ongeluk ook hoe het meetkunde moet doen? Of begint het gewoon willekeurig te gokken? De onderzoekers wilden weten of ze chirurgisch alleen de specifieke vaardigheid konden verwijderen die ze wilden dat de AI zou "vergeten".

Het Experiment: Het "Menu" van Vaardigheden

De onderzoekers bouwden een test met wiskundeproblemen voor leerlingen in het vierde en vijfde leerjaar. Ze behandelden wiskundethema's (zoals "Breuken" of "Meetkunde") als items op een menu.

  1. Het Profiel: Ze creëerden een "studentprofiel" voor de AI. Dit was een lijst waar ze "Ja" aankruisten voor vaardigheden die de AI moest behouden en "Nee" voor vaardigheden die de AI moest vergeten.
  2. De Instructies: Ze probeerden drie manieren om de AI te vertellen wat het moest doen:
    • Alleen Zeggen: "Je bent een student die breuken is vergeten."
    • Alleen Tonen: De AI voorbeelden geven van een student die fouten maakt.
    • De Hybride (De Winnaar): De AI vertellen wat het moet vergeten EN het laten zien hoe het die specifieke fouten moet maken.

De Resultaten: Wat Werkte?

De onderzoekers ontdekten dat de AI inderdaad kon doen alsof het een gebrekkige student was, maar dit hing sterk af van hoe ze het vroegen en welke AI ze gebruikten.

  • De "Hybride" Aanpak Won: De AI alleen maar vertellen iets te vergeten was niet genoeg. Alleen voorbeelden tonen was niet genoeg. Maar toen ze beide deden (de Hybride methode), kwam de AI veel dichter bij de rol van "gebrekkige student". Het was alsof je een methodacteur zowel een script als een achtergrondgeschiedenis gaf; de uitvoering werd veel overtuigender.
  • Niet Alle AI's Zijn Gelijk: Ze testten drie verschillende AI-modellen (Claude, DeepSeek en GPT-4o).
    • Claude was de beste "acteur". Het kon de instructies om specifieke vaardigheden te vergeten zeer goed volgen, zonder de vaardigheden die het moest behouden in de war te sturen.
    • DeepSeek was zeer goed in wiskunde maar moeilijker te controleren. Het bleef proberen de problemen correct op te lossen, zelfs toen het werd verteld om te falen.
    • GPT-4o zat ergens in het midden.
  • Geen "Bijwerkingen": Goed nieuws! Toen de AI werd verteld om "Breuken" te vergeten, vergat het niet per ongeluk "Meetkunde". Het vergeten was lokaal. Het was alsof je het licht in de keuken uitschakelt zonder het licht in de slaapkamer uit te doen.

De Conclusie

Dit artikel zegt niet dat we al een perfecte virtuele student voor een klaslokaal hebben gebouwd. Het zegt iets specifieker: We hebben bewezen dat we een "benchmark" kunnen bouwen om te testen of een AI selectief dingen kan vergeten.

Ze creëerden een manier om te meten of een AI op een gecontroleerde manier "onvolmaakt" kan worden gestuurd. Dit is een cruciale eerste stap. Voordat we AI kunnen gebruiken om leraren te trainen, moeten we eerst bewijzen dat de AI inderdaad kan doen alsof het een student is met specifieke zwaktes, in plaats van gewoon een perfecte robot te zijn die weigert fouten te maken.

Kortom: De onderzoekers bouwden een test om te zien of ze een AI konden leren om op specifieke onderwerpen "dom te spelen". Ze ontdekten dat met de juiste instructies de AI dit kan, maar dat het een lastige rol is die afhangt van welke AI je gebruikt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →