← Nieuwste papers
💬 NLP

LLM Prompt Evaluation for Educational Applications

Deze studie introduceert een systematisch evaluatiekader in toernooistijl dat gebruikmaakt van het Glicko2-ratingsysteem om prompttemplates voor LLM's voor educatieve dialoog te beoordelen, waarbij wordt aangetoond dat een prompt die persona- en contextbeheersstrategieën combineert, significant beter presteert dan andere in het genereren van pedagogisch afgestemde vervolgvragen.

Oorspronkelijke auteurs: Langdon Holmes, Adam Coscia, Scott Crossley, Joon Suh Choi, Wesley Morris

Gepubliceerd 2026-01-23
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Langdon Holmes, Adam Coscia, Scott Crossley, Joon Suh Choi, Wesley Morris

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer slimme, maar enigszins letterlijke robot probeert te leren hoe een goede leesbegeleider te zijn. Je kunt de robot niet simpelweg zeggen: "Help de student." Je moet een zeer specifieke set instructies schrijven, een prompt genoemd, om de robot precies te vertellen hoe hij zich moet gedragen, welke toon hij moet gebruiken en wat voor soort vragen hij moet stellen.

Dit artikel is als een kookwedstrijd om het beste recept voor die instructies te vinden.

De Setting: Een Digitale Leesles

De onderzoekers werkten met een slimme website (genaamd STAIRS) die studenten helpt bij het lezen van moeilijke tekstboeken. Wanneer een student een pagina leest en een samenvatting schrijft, controleert het systeem of ze het echt begrepen hebben. Als de samenvatting zwak is, grijpt het systeem in. Het kiest een lastig deel van de tekst, stelt de student een vraag om hen dieper te laten nadenken, en dan — dit is de kern — moet het een vervolgvraag stellen om het gesprek gaande te houden.

De grote vraag was: Hoe moeten we de instructies (de prompt) voor de AI schrijven zodat deze de best mogelijke vervolgvraag stelt?

De Deelnemers: Zes Verschillende "Persoonlijkheden"

Het team creëerde zes verschillende sets instructies (prompts) voor de AI. Elke set was gebaseerd op een andere onderwijsfilosofie of "persoonlijkheid":

  1. De Baseline: De oude, standaard set instructies die ze voorheen gebruikten. Het was als een basisrecept zonder franje.
  2. De Socratische Gids: De AI gedraagt zich als een filosoof en stelt vragen die de student laten nadenken over hoe zij denken (metacognitie).
  3. De Scaffolding Expert: De AI gedraagt zich als een bouwplaatsvoorman die zorgvuldig voortbouwt op wat de student al weet en stap voor stap de hiaten opvult.
  4. De Verbindingsbouwer: De AI probeert de tekst te koppelen aan het persoonlijke leven en de eerdere ervaringen van de student.
  5. De Begripsmonitor: De AI fungeert als een zelfcontrole-instrument dat de student helpt te evalueren of zij de stof werkelijk begrijpen.
  6. De Strategische Leescoach: De AI fungeert als een coach die de student leert hoe ze strategisch kunnen lezen, met de focus op hun eigen leergedrag en zelfsturing.

Het Toernooi: Hoe Ze de Winnaar Beslisten

In plaats van te gokken welke het beste was, hielden de onderzoekers een toernooi.

  • De Jury: Ze rekruteerden acht menselijke juryleden (een mix van professoren, PhD-studenten en bachelorstudenten) die het systeem goed kenden.
  • Het Spel: De juryleden kregen paren vervolgvragen te zien te zien. Eén vraag kwam van de instructies van de "Socratische Gids", de andere van de "Scaffolding Expert", enzovoort.
  • De Taak: De juryleden moesten kiezen welke vraag zij de voorkeur gaven. Ze gaven geen score; ze stemden simpelweg op de winnaar van elk paar.
  • De Wiskunde: Ze gebruikten een speciaal beoordelingssysteem (vergelijkbaar met dat gebruikt wordt om schakers te rangschikken) om de waarschijnlijkheid te berekenen dat één prompt van de andere zou winnen.

De Resultaten: Wie Won?

De resultaten waren duidelijk. De Strategische Leescoach was de onbetwiste kampioen.

  • De Winnaar: De "Strategische Leescoach"-prompt won bijna elke keer dat deze met de anderen werd vergeleken. Deze had een kans van 81% tot 100% om de voorkeurskeuze te zijn.

  • Waarom het Won: Deze prompt was bijzonder omdat het twee krachtige "patronen" combineerde:

    1. Persona: Het vertelde de AI: "Je bent een leescoach."
    2. Context Manager: Het vertelde de AI: "Focus strikt op het helpen van de student bij het beheren van hun eigen leesstrategie."
      Door de AI te vertellen wie hij moest zijn en wat de grenzen waren, creëerde dit de meest behulpzame vervolgvragen.
  • De Runner-up: De "Scaffolding Expert" kwam op de tweede plaats. Deze was erg goed in het opvullen van kennis hiaten.

  • De Verrassing: De oude Baseline-prompt (de instructies die ze zonder de nieuwe technieken gebruikten) kwam zelfs op de derde plaats. Het was redelijk, maar de nieuwe, zorgvuldig ontworpen prompts waren aanzienlijk beter.

  • De Verliezers: Prompts die te veel focusten op alleen het "verbinden van ideeën" of "monitoren" zonder een sterke coaching-persona, presteerden minder goed.

De Belangrijkste Conclusie

Het artikel betoogt dat we niet simpelweg kunnen gokken hoe we met AI in het onderwijs moeten communiceren. We hebben een systematische manier nodig om onze instructies te testen.

Denk er zo over na: Als je een betere brug wilt bouwen, bouw je er niet zomaar een en hoopt dat hij standhoudt. Je test verschillende ontwerpen. Dit artikel laat zien dat door een "toernooi" te organiseren waarbij mensen stemmen op de beste AI-reacties, onderzoekers wetenschappelijk kunnen bewijzen welk "recept" voor instructies het beste werkt. In dit specifieke geval was het recept dat de AI veranderde in een strategische leescoach de meest effectieve manier om studenten te helpen leren.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →