← Nieuwste papers
💬 NLP

LLM Performance on a Real, Double-Marked GCSE Benchmark

Dit artikel introduceert een grote dataset van dubbel beoordeelde GCSE-examenresultaten en demonstreert dat standaard grote taalmodellen de consistentie van menselijke examinatoren kunnen evenaren of zelfs overtreffen bij het nakijken van diverse vakken, waaronder handgeschreven wiskunde en subjectieve Engelse essays, waarmee een kosteneffectieve oplossing wordt geboden voor geautomatiseerd nakijken.

Oorspronkelijke auteurs: Malachy Fox, Kavi Samra, Paul Jung

Gepubliceerd 2026-06-25
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Malachy Fox, Kavi Samra, Paul Jung

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een enorm schoolexamen organiseert waarbij duizenden studenten hun antwoorden inleveren. Traditioneel heb je twee menselijke docenten nodig om elk antwoord te lezen en een cijfer te geven. Dat is traag, duur en soms zijn de twee docenten het niet eens over wat een "B" of een "C" precies inhoudt.

Dit artikel stelt een simpele vraag: Kan een computer (specifiek een Large Language Model of "AI") net zo goed als een tweede docent fungeren als een echte mens?

Om dit te ontdekken, hebben de onderzoekers een enorme "test" voor AI gemaakt. Hier is de onderverdeling van wat ze deden en wat ze vonden, met gebruik van alledaagse analogieën.

1. De "Dubbel Beoordeelde" Testkeuken

De onderzoekers verzamelden 32.534 echte studentenantwoorden van proefexamens (oefentoetsen voor de Britse nationale examens voor 16-jarigen).

  • De Opzet: Elk antwoord was al beoordeeld door twee verschillende menselijke experts. Dit is alsof je twee juryleden hebt bij een kookprogramma die allebei de gerechten proeven en een score opschrijven.
  • De Variatie: De antwoorden waren niet alleen getypte essays. Ze bevatten ook slordige, handgeschreven wiskundige problemen met diagrammen, wetenschappelijke berekeningen en creatief schrijven.
  • Het Doel: Ze wilden zien of een AI, wanneer deze dezelfde vraag en het "antwoordmodel" (nakijkmodel) krijgt, een score kan geven die net zo nauw overeenkomt met de menselijke juryleden als de twee menselijke juryleden met elkaar overeenkomen.

2. De "Proeverij" Resultaten

De onderzoekers voerden deze vragen aan verschillende AI-modellen (zoals GPT-5.5, Gemini en Claude) met een zeer eenvoudige instructie: "Hier is de vraag, de regels voor het nakijken, en het antwoord van de student. Geef me een score in een getal." Ze vroegen de AI niet om "diep na te denken" of complexe redeneringen te gebruiken; ze vroegen de AI gewoon om het werk te doen.

De Grote Verrassing:
In bijna elk vak deed de AI niet alleen een "goed werk". In veel gevallen kwam de AI zelfs beter overeen met de menselijke juryleden dan de twee menselijke juryleden met elkaar overeenkwamen.

  • De Analogie: Stel je voor dat twee menselijke juryleden een taart proeven. Jury A geeft een 7/10, en Jury B geeft een 6/10. Ze verschillen één punt. Nu proeft de AI dezelfde taart. De AI geeft een 6,5/10. De AI zit eigenlijk precies in het midden en fungeert als een perfecte beslisser.
  • De Cijfers:
    • Engelse Essays: De AI was een "super-jury". Het kwam beter overeen met de menselijke consensus dan de mensen met elkaar.
    • Wiskunde: Zelfs met slordig handschrift en complexe diagrammen was de AI ongelooflijk nauwkeurig en kwam hij bijna perfect overeen met de menselijke consistentie.
    • Wetenschap: Hetzelfde verhaal. De AI was even betrouwbaar als een tweede menselijke docent.

3. Grootte Doet Er Niet Altijd Toe

Je zou denken dat je de grootste, duurste, "super-slimme" AI nodig hebt om dit te doen. Het paper zegt nee.

  • De Analogie: Het is also os je een lekkende kraan probeert te repareren. Je hebt geen meester-loodgieter met een gereedschapskist van $5.000 nodig; een standaard moersleutel doet vaak net zo goed het werk.
  • De Bevinding: Kleine, goedkopere AI-modellen presteerden net zo goed als de enorme, dure modellen. Sterker nog, voor sommige taken was een "budget"-model net zo consistent als het "premium"-model.

4. De "Persoonlijkheid" Trefpunt (Bias)

Hoewel de AI accuraat was in hoeveel het met mensen overeenkwam, hadden sommige AI's een "persoonlijkheid" bias.

  • De Analogie: Stel je twee menselijke juryleden voor. De ene is een "strenge docent" die altijd lagere scores geeft, en de andere is een "aardige docent" die hogere scores geeft.
  • De Bevinding: Sommige AI-modellen waren van nature "streng" (gaven lagere scores dan het gemiddelde), terwijl andere "mild" waren (gaven hogere scores). Echter, zodra je rekening hield met deze persoonlijkheid, was hun vermogen om correct te beoordelen nog steeds uitstekend. De beste modellen waren de modellen die "neutraal" waren—ze neigden niet te veel naar streng of aardig te zijn.

5. De Kosten van de "Tweede Docent"

Ten slotte keek het paper naar de prijs.

  • De Analogie: Het inhuren van een tweede menselijke docent om 1.000 papieren te nakijken is duur. Het gebruiken van een AI is als het kopen van een bioscoopkaartje: het kost een paar dollar in plaats van honderd.
  • De Bevinding: Het nakijken van 1.000 papieren met een AI kost tussen de $1 en $120, afhankelijk van het model. Omdat de goedkopere modellen net zo goed presteerden als de duurdere, kunnen scholen een fortuin besparen terwijl ze nog steeds een betrouwbare "tweede mening" krijgen op het werk van elke student.

De Kernboodschap

Dit paper bewijst dat de huidige AI klaar is om een betrouwbare "tweede beoordelaar" te zijn voor schoolexamens. Het kan slordig handschrift lezen, complexe wiskunde begrijpen en essays nakijken met een niveau van consistentie dat vaak beter is dan de menselijke onderlinge overeenstemming. Het werkt goed, het werkt goedkoop, en het heeft niet het grootste, duurste model nodig om de klus te klaren.

Wat het paper niet zegt:

  • Het beweert niet dat AI menselijke docenten volledig moet vervangen.
  • Het zegt niet dat AI perfect is voor elk type examenvraag (hoewel het erg goed presteerde op de geteste vragen).
  • Het bespreekt niet hoe dit scholen in de toekomst zal veranderen, alleen dat de technologie nu werkt onder deze specifieke testcondities.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →