← Nieuwste papers
🤖 AI

Human-in-the-Loop Benchmarking of Heterogeneous LLMs for Automated Competency Assessment in Secondary Level Mathematics

Dit artikel introduceert een Human-in-the-Loop-benchmarkkader met behulp van een multidimensionale rubriek om heterogene LLM's te evalueren voor geautomatiseerde secundaire wiskundebeoordeling in Nepal, waarbij wordt aangetoond dat architectonische compatibiliteit met instructiebeperkingen kritischer is dan modelgrootte voor het bereiken van overeenstemming met menselijke experts, en wordt geconcludeerd dat deze modellen het meest geschikt zijn voor assistieve bewijsextractie in plaats van autonome certificering.

Oorspronkelijke auteurs: Jatin Bhusal, Nancy Mahatha, Aayush Acharya, Raunak Regmi

Gepubliceerd 2026-04-30
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Jatin Bhusal, Nancy Mahatha, Aayush Acharya, Raunak Regmi

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een klaslokaal voor waar docenten verdrinken in papierwerk. In plaats van studenten slechts één cijfer te geven (zoals "85%"), willen ze een gedetailleerd rapportkaartje afgeven met zinnen als: "Je begrijpt het waarom," "Je bent geweldig in het berekenen" en "Je kunt ideeën verbinden." Dit heet competentiegericht onderwijs. Het is een veel rijpere manier van cijferen, maar voor mensen is het handmatig uitvoeren ongelooflijk moeilijk en tijdrovend.

Dit artikel stelt een simpele vraag: Kan Kunstmatige Intelligentie (KI) docenten helpen bij dit zware werk?

Hier is het verhaal van hun experiment, eenvoudig uitgelegd:

1. De Opzet: De "Mens versus Robot"-test

De onderzoekers in Nepal besloten dit te testen op Wiskunde voor klas 10 (een moeilijk vak met matrices, meetkunde en trigonometrie).

  • De Studenten: Ze namen 33 handgeschreven wiskundetoetsen van echte studenten.
  • De Menselijke Rechters: Twee expert-wiskundedocenten beoordeelden deze toetsen. Ze keken niet alleen naar het juiste antwoord; ze gebruikten een zeer strikt "reglement" (rubric) om vier specifieke vaardigheden te beoordelen:
    1. Begrip: Begrepen ze de vraag?
    2. Kennis: Wisten ze de feiten?
    3. Vlotheid: Konden ze de wiskundestappen correct uitvoeren?
    4. Gedrag/Correlatie: Konden ze verschillende ideeën verbinden?
  • De KI-Rechters: Ze stelden vier verschillende KI-modellen op om dezelfde toetsen te beoordelen met hetzelfde reglement.
    • Eagle: Een kleine, snelle KI (zoals een sprinter).
    • Orion: Een enorme, krachtige KI met enorm breinvermogen (zoals een zwaargewichtkampioen).
    • Nova: Een slimme, efficiënte KI die een speciale "team"-structuur gebruikt (zoals een specialistenteam).
    • Lyra: Een top-tier KI gebruikt als scheidsrechter.

2. De Twist: Groter is niet altijd beter

Meestal gaan we ervan uit dat de grootste, krachtigste KI (Orion) zou winnen. Maar de resultaten waren verrassend, alsof een enorme sumoworstelaar struikelt over een klein steentje terwijl een behendige danser er elegant langs glijdt.

  • De "Reus" (Orion) faalde: Ondanks het meeste "breinvermogen" (70 miljard parameters) raakte Orion in de war. Het was het zo oneens met de menselijke docenten dat de wiskundescore voor hun overeenkomst eigenlijk negatief was. Het was alsof een robot probeerde een toets te beoordelen, maar zijn eigen regels bedacht die geen zin hadden.
  • De "Specialist" (Nova) won: De kleinere, efficiëntere KI (Nova) deed het beste werk. Het was ongeveer 38% van de tijd het eens met de menselijke docenten (wat in deze strikte wereld als "Redelijk" wordt beschouwd). Het volgde de instructies beter dan de reus.

De Les: Bij deze specifieke taak was de regels volgen belangrijker dan een groot brein hebben. De massieve KI raakte "afgeleid" door zijn eigen complexiteit, terwijl de gespecialiseerde KI zich aan de taak hield.

3. De Oplossing: De "Mens in de Lus"

Het artikel concludeert dat we de KI nog niet de baan van de docent volledig moeten laten overnemen. De KI is nog niet klaar om de definitieve rechter te zijn.

In plaats daarvan, zie de KI als een zeer efficiënt stagiair.

  • De Stagiair (KI): scant snel het werk van de student, markeert de goede delen en stelt een cijfer voor op basis van het reglement.
  • De Baas (Menselijke Docent): bekijkt de suggesties van de stagiair, controleert de lastige delen dubbel en neemt de definitieve beslissing.

Deze "Mens in de Lus"-aanpak betekent dat de KI het zware werk doet van het vinden van bewijs, maar de mens het "betrouwbaarheidsschild" behoudt om eerlijkheid te garanderen.

4. Wat dit betekent (en wat niet)

  • Wat het IS: Een bewijs dat KI docenten kan helpen patronen te herkennen en bewijs uit studentwerk te halen, waardoor het cijferproces sneller en gedetailleerder wordt.
  • Wat het NIET IS: Een systeem dat klaar is om docenten te vervangen of op zichzelf definitieve certificaten af te geven. Het artikel waarschuwt expliciet dat als we KI alleen laten cijferen, het fouten kan maken (hallucinaties) of bevooroordeeld kan zijn, omdat we niet altijd weten hoe het tot zijn conclusie is gekomen (het "Black Box"-probleem).

In het kort: De onderzoekers bouwden een brug tussen ouderwetse cijfering en de toekomst. Ze ontdekten dat hoewel de KI nog niet de kapitein van het schip is, het een fantastische navigator maakt, zolang er maar een mens het stuur vasthoudt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →