How effective are VLMs in assisting humans in inferring the quality of mental models from Multimodal short answers?
De studie introduceert MMGrader, een aanpak die multimodale antwoorden van studenten analyseert om hun mentale STEM-modellen te beoordelen, maar concludeert dat de huidige visuele taalmodellen met een nauwkeurigheid van ongeveer 40% nog niet op menselijk niveau presteren, hoewel verbeterde systemen leraren kunnen helpen bij het efficiënt opsporen van conceptuele tekortkomingen in de klas.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat een leraar een klas heeft vol met leerlingen die net hebben geleerd over vectoren (zoals krachten die in een bepaalde richting trekken). De leerlingen schrijven hun antwoorden op: soms met woorden, soms met tekeningen, en vaak een mix van beide.
Normaal gesproken kijkt de leraar naar het antwoord en zegt: "Goed gedaan" of "Niet helemaal juist". Maar dit onderzoek vraagt zich af: Kunnen we niet gewoon kijken hoe een leerling denkt?
In de wereld van onderwijs noemen we dit een mentaal model. Het is als een onzichtbare bouwtekening in het hoofd van de leerling. Als die tekening klopt, begrijpt de leerling het onderwerp echt. Als de tekening scheef staat, heeft de leerling misschien woorden geleerd, maar niet begrepen hoe het werkt.
Het probleem? Het is heel moeilijk om die onzichtbare tekening te zien, vooral als het antwoord vol staat met handgeschreven krabbels en formules. Mensen kunnen dit wel, maar het kost veel tijd.
De Oplossing: MMGrader (De "Mental Model Detectie")
De onderzoekers hebben een nieuwe manier bedacht, genaamd MMGrader. Denk hierbij aan een soort detective-tool die werkt met een "concept-kaart".
- De Concept-kaart: Stel je voor dat het onderwerp (bijvoorbeeld vectoren) een grote stad is. De hoofdwegen zijn de grote ideeën, en de steegjes zijn de kleine details. De onderzoekers hebben een kaart gemaakt van deze stad.
- De Analyse: Wanneer een leerling een antwoord geeft, probeert MMGrader te kijken: "Welke straten heeft deze leerling bezocht? Heeft hij de hoofdwegen begrepen of is hij vastgelopen in een steegje?"
- De Score: In plaats van een cijfer te geven, krijgt de leerling een "sterkte-score" voor elk stukje van zijn mentale bouwtekening.
De Hulp van AI (De "Super-Detectives")
Omdat mensen dit niet voor elke leerling in de hele wereld kunnen doen, vroegen de onderzoekers: Kunnen computers (specifiek Vision-Language Models of VLMs) dit ook?
Ze hebben 9 verschillende AI-modellen getest. Het zijn slimme systemen die zowel tekst als plaatjes kunnen lezen. Ze kregen de taak om te kijken naar de handgeschreven antwoorden van leerlingen en te zeggen: "Hoe goed is het begrip van deze leerling?"
Wat bleek er? (De Resultaten)
Hier komt het interessante deel, vertaald naar een analogie:
Stel je voor dat je een groep van 9 detectives (de AI-modellen) vraagt om een moordzaak op te lossen, terwijl een ervaren rechercheur (de menselijke leraar) het al heeft opgelost.
- De beste detective (Molmo): Deze AI deed het het beste. Hij had ongeveer 40% van de antwoorden precies goed. Dat klinkt misschien niet als 100%, maar in de wereld van complexe, handgeschreven wiskunde is dat al een enorme prestatie! Hij maakte gemiddeld een fout van ongeveer 1 punt op een schaal van 1 tot 5.
- De andere detectives: Sommige AI's waren wat slordig. Ze gaven soms een 1 of een 5, zonder echt na te denken (alsof ze gissen). Andere AI's dachten te veel na en raakten in de war over hun eigen redenering ("Misschien is dit een vector... nee wacht, misschien is het een component...").
- De kleine detectives: De kleinere modellen (zoals Granite) waren vaak te simpel. Ze konden de handgeschreven krabbels niet eens goed lezen en gaven willekeurige antwoorden.
Waarom is dit belangrijk?
Op dit moment zijn deze AI's nog niet perfect genoeg om de leraar volledig te vervangen. Ze zijn nog niet zo slim als een ervaren mens.
Maar, als we ze nog wat verder trainen, worden ze superkrachtige assistenten.
Stel je voor dat een leraar in 5 minuten de antwoorden van een heel schooljaar kan laten analyseren. De AI zegt dan: "Kijk, 80% van de klas begrijpt niet hoe je krachten moet optellen, maar ze snappen wel wat een vector is."
Dan kan de leraar zijn lesplan aanpassen: "Oké, morgen geen nieuwe theorie, maar een speciale oefensessie over krachten optellen." Dit heet gepersonaliseerd onderwijs.
Conclusie
Deze paper zegt eigenlijk: "We hebben een nieuwe manier bedacht om te kijken hoe leerlingen denken, niet alleen wat ze weten. Computers kunnen hier nu al een beetje bij helpen, maar ze moeten nog wat meer oefenen om net zo goed te worden als mensen. Als ze dat eenmaal zijn, kunnen ze leraren helpen om elke leerling beter te begrijpen en te helpen."
Het is alsof we een bril hebben gevonden die ons laat zien wat er in het hoofd van een leerling gebeurt, en AI is de eerste die probeert door die bril te kijken. Het is nog een beetje wazig, maar het belooft veel goeds voor de toekomst van onderwijs.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.