← Nieuwste papers
💻 computer science

Calibrating Gemini to Human Raters in Spoken Language Assessment for EFL Learners in Asia

Deze studie toont aan dat hoewel Gemini 2.5 Flash via 10-shot prompting een menselijk niveau van overeenstemming kan bereiken bij het beoordelen van de gesproken Engelse vaardigheden van EFL-lezers wanneer menselijke beoordelaars een matige consistentie vertonen, de prestaties verslechteren wanneer de menselijke overeenstemming uitstekend is, wat de noodzaak benadrukt van zorgvuldige kalibratie en menselijk toezicht ondanks de bekwaamheid om verder te gaan dan louter woordnauwkeurigheid bij het evalueren.

Oorspronkelijke auteurs: Christopher Robert Cooper, John Maurice Gayed

Gepubliceerd 2026-08-07
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Christopher Robert Cooper, John Maurice Gayed

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een docent bent die honderden essays nakijkt. Het is een berg werk, en hoewel je de geschreven woorden van een student gemakkelijk kunt lezen, is het beoordelen van hun gesproken stem een heel ander beest. Spraak is "luid en vluchtig"—het gebeurt in een flits en verdwijnt dan weer, wat het moeilijk maakt om het eerlijk vast te leggen en te beoordelen. Jarenlang waren computers geweldig in het lezen van tekst, maar hadden ze moeite met het "luisteren" naar menselijke gesprekken, omdat ze vaak vertrouwden op geschreven transcripties die de nuance van toon, pauzes en accent missen. Nu is er een nieuwe generatie "generatieve AI" gearriveerd. Denk aan deze AI's als superintelligente digitale assistenten die niet alleen kunnen lezen, maar ook kunnen horen en context kunnen begrijpen. De grote vraag die bij iedereen opkomt is: Kunnen we deze digitale assistenten trainen om het gesproken Engels even eerlijk en nauwkeurig te beoordelen als een menselijke docent? Dit gaat niet alleen over het besparen van tijd voor docenten; het gaat over het waarborgen dat studenten de juiste feedback krijgen om te verbeteren, ongeacht waar ze vandaan komen of hoe ze klinken.

Dit artikel duikt diep in die vraag en test een specifiek AI-model genaamd Gemini 2.5 Flash. De onderzoekers wilden zien of ze deze AI konden "kalibreren"—het kan in essentie leren hoe het moet beoordelen door het voorbeelden te tonen van hoe menselijke docenten gesproken dialogen scoren. Ze voerden de AI niet alleen geschreven tekst; ze gaven de AI de werkelijke audiobestanden van studenten die spraken, wat een grote stap voorwaarts is omdat het de AI de echte stem laat horen, in plaats van alleen een transcriptie.

De onderzoekers zetten een slim experiment op met 129 opgenomen gesprekken tussen Aziatische Engelse leerlingen en hun docenten. Ze vroegen de AI om deze spraak te beoordelen met behulp van drie verschillende methoden:

  1. Zero-shot: De AI krijgt alleen de regels en beoordeelt direct, zonder voorbeelden.
  2. 5-shot: De AI zag vijf voorbeelden van hoe een menselijke docent een beoordeling gaf voordat hij begon.
  3. 10-shot: De AI zag tien voorbeelden.

Ze vergeleken de scores van de AI met twee paren docenten. Eén paar docenten was matig goed met elkaar eens (hun scores waren vergelijkbaar, maar niet identiek), terwijl een ander paar bijna perfect met elkaar overeenstemde (ze waren als tweelingen in hun beoordeling).

Hier komt de wending: de AI presteerde het best wanneer deze leerde van de docenten die een matige overeenstemming hadden. Wanneer de AI voorbeelden kreeg van het "perfect overeenstemmende" docentpaar, deed het zelfs slechter en slaagde het er niet in om hun scores te evenaren. Het is alsoंक dat de AI een beetje menselijke onenigheid moest zien om de volledige reikwijdte van wat een "goede" of "slechte" score is, te begrijpen. Als de voorbeelden te perfect waren, raakte de AI in de war over waar de grenzen lagen.

De studie controleerde ook of de AI de studenten daadwerkelijk correct kon "horen". Dit maten ze met iets dat de Word Error Rate (WER) wordt genoemd, wat telt hoeveel woorden de AI foutief heeft getranscribeerd. De AI maakte fouten, maar het ging vooral om het verwisselen van wie er sprak (de student of de docent) in plaats van het missen van de woorden zelf. De onderzoekers ontdekten dat het vermogen van de AI om de woorden te horen, de beoordeling van de studenten niet strenger of vriendelijker maakte. Dit suggereert dat de AI naar meer luisterde dan alleen de woordenboekdefinities van de woorden; het pikte ook de flow en het ritme van de spraak op.

Er was echter een kleine, verrassende struikelblok. De AI leek iets lagere scores te geven aan studenten uit Pakistan, ook al transcribreerde de AI hun spraak zeer nauwkeurig. De onderzoekers merkten dit op als een mogelijke bias die verder onderzoek behoeft, vooral omdat er slechts vier studenten uit dat land in de studie zaten.

Uiteindelijk suggereert het artikel dat Gemini 2.5 Flash een veelbelovend hulpmiddel is om docenten te helpen bij het beoordelen van gesproken Engels, maar het is geen toverstaf. Het werkt het best wanneer het wordt gekalibreerd met menselijke voorbeelden die een realistisch bereik aan scores laten zien, en het heeft een menselijk toezicht nodig om een oogje in het zeil te houden. De AI kan de spraak horen, de context begrijpen en feedback geven die erg lijkt op die van een menselijke docent, maar het heeft nog steeds zorgvuldige afstemming nodig om ervoor te zorgen dat het eerlijk is voor iedereen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →