← Nieuwste papers
🧬 biology

AI-Assisted Grading in Biochemistry: Automated Long Answer Question Scoring with Expert-Level Accuracy

Deze studie toont aan dat een door AI aangedreven hulpmiddel dat gebruikmaakt van GPT-4 een expert-niveau nauwkeurigheid kan bereiken en consistente, op een rubric gebaseerde feedback kan bieden voor het scoren van open vragen bij biochemie op bacheloruur, waarmee effectief de uitdagingen worden aangepakt die worden veroorzaakt door grote klassengroottes en een tekort aan docenten.

Oorspronkelijke auteurs: Rupesh kumar, Sairoz sairoz

Gepubliceerd 2026-09-28
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Rupesh kumar, Sairoz sairoz

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ⚕️ Dit is een AI-gegenereerde uitleg van een preprint die niet peer-reviewed is. Dit is geen medisch advies. Neem geen gezondheidsbeslissingen op basis van deze inhoud. Lees de volledige disclaimer

In de wereld van het medisch onderwijs houdt het doceren van biochemie meer in dan alleen het onthouden van feiten over hoe het lichaam energie verwerkt. Het vereist dat studenten diep nadenken en complexe processen in hun eigen woorden uitleggen. Om dit begrip te meten, gebruiken instructeurs vaak open vragen, waarbij een student een gedetailleerde uitleg van een biologisch mechanisme moet opschrijven. Deze vragen zijn krachtige hulpmiddelen voor het leren, omdat ze studenten dwingen hun gedachten te ordenen en werkelijke beheersing aan te tonen. Het nakijken ervan vormt echter een zware last. Wanneer een klas groot wordt, kan een enkele docent niet de nodige tijd besteden aan het zorgvuldig lezen van elke essay, het geven van persoonlijke feedback en het waarborgen dat elke student eerlijk wordt beoordeeld tegen dezelfde standaarden. De uitdaging is niet alleen de hoeveelheid werk, maar ook de noodzaak van consistentie; de ene docent kan een specifiek detail waarderen dat een ander over het hoofd ziet, wat leidt tot ongelijkmatige resultaten.

Een team van onderzoekers van medische hogescholen in India besloot te kijken of een nieuw soort computerprogramma dit probleem kon oplossen. Ze wilden weten of een systeem van kunstmatige intelligentie deze lange essays kon lezen, ze met dezelfde vaardigheid als een ervaren menselijke professor kon beoordelen, en precies kon uitleggen waarom een student een bepaalde score kreeg. De onderzoekers bouwden een hulpmiddel dat fungeert als een digitale examinator. In plaats van alleen woorden te tellen of op zoek te gaan naar trefwoorden, kreeg dit systeem een specifieke set regels mee, een zogenaamd rubric, die een perfect antwoord opdeelt in kleinere onderdelen. De computer kreeg de instructie om naar die specifieke onderdelen te zoeken in het geschreven werk van een student, punten toe te kennen voor wat er werd gevonden, en vervolgens te suggereren hoe het antwoord verbeterd kon worden. Het systeem gebruikte een geavanceerd taalmodel, een type computerprogramma dat getraind is op enorme hoeveelheden tekst om menselijke taal te begrijpen, om deze taak uit te voeren.

De studie omvatte driehonderd studenten die antwoorden hadden geschreven op twee verschillende biochemische vragen. De onderzoekers verzamelden deze zeshonderd reacties en lieten ze tweemaal beoordelen: één keer door de computer en één keer door twee menselijke experts met jarenlange ervaring in het onderwijzen van het vak. De menselijke docenten gebruikten dezelfde set regels om de werkstukken te scoren. Om te garanderen dat de computer niet simpelweg gokte, vroegen de onderzoekers de computer om elk werkstuk vijf keer te beoordelen met lichte variaties en vervolgens de middelste score als het definitieve resultaat te nemen. Deze methode hielp willekeurige fouten die de computer zou kunnen maken glad te strijken. Het team vergeleek vervolgens de scores die de machine gaf met de scores die de twee menselijke docenten gaven om te zien hoe nauw deze overeenkwamen.

De resultaten toonden een opmerkelijk niveau van overeenstemming tussen de machine en de mensen. De scores die de kunstmatige intelligentie gaf, kwamen bijna perfect overeen met de scores van de menselijke experts. Wanneer de onderzoekers maten hoe nauw de cijfers van de computer de cijfers van de docenten volgden, gaven de getallen een uitstekende match aan, veel beter dan wat gewoon is wanneer twee verschillende mensen dezelfde werkstukken beoordelen. De computer gaf niet consequent hogere of lagere cijfers dan de docenten; de gemiddelde score was bijna identiek aan het menselijke gemiddelde. Sterker nog, de beoordeling van de computer was zo consistent met die van de experts dat het als een betrouwbare partner in het klaslokaal kan worden beschouwd. Het systeem leverde ook specifieke opmerkingen over waar het antwoord van een student zwak was, en bood een niveau van detail dat helpt studenten te leren van hun fouten.

Dit werk suggereert dat kunstmatige intelligentie de moeilijke taak kan afhandelen van het beoordelen van complexe geschreven antwoorden in de wetenschap zonder de nuance te verliezen die menselijke docenten bieden. De onderzoekers ontdekten dat door de computer een duidelijke set instructies te geven over waar naar gezocht moet worden, deze het werk van studenten kon evalueren met de nauwkeurigheid van een expert. Dit betekent niet dat de computer de docent vervangt, maar eerder dat het het zware werk van het nakijken kan overnemen, waardoor menselijke onderwijzers vrijkomen voor het richten op lesgeven en mentorschap. De studie geeft aan dat deze aanpak klaar is voor gebruik in echte klaslokalen om beoordelingen eerlijker en efficiënter te maken, waardoor wordt gewaarborgd dat elke student een cijfer krijgt dat werkelijk hun begrip van de stof weerspiegelt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →