← Nieuwste papers
🤖 AI

SEFORA: Student Essays with Feedback Corpus and LLM Feedback Evaluation Framework

Dit artikel introduceert SEFORA, een grootschalig corpus van studentessays met echte feedback van docenten, en UniMatch, een nieuw evaluatiekader dat onthult dat huidige LLM's moeite hebben met het genereren van feedback die overeenkomt met de prioriteiten van menselijke docenten, waarbij een maximale F1-score van slechts 0,4 wordt behaald over uitgebreide experimenten.

Oorspronkelijke auteurs: Shayan Peyghambari Oskoui, Norah Almousa, Zhaoyi Joey Hou, Carolina Gustafson, Gayle Rogers, Raquel Coelho, Diane Litman, Xiang Lorraine Li

Gepubliceerd 2026-07-02
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Shayan Peyghambari Oskoui, Norah Almousa, Zhaoyi Joey Hou, Carolina Gustafson, Gayle Rogers, Raquel Coelho, Diane Litman, Xiang Lorraine Li

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een docent bent die een stapel studentessays staat te nakijken. Je moet elke zin lezen, de goede delen vinden, de verwarrende delen aanwijzen en specifieke aantekeningen in de kantlijn schrijven om de student te helpen verbeteren. Het is hard werk, en het doen van dit werk voor honderden studenten tegelijkertijd is voor een mens bijna onmogelijk.

Onlangs hebben we geprobeerd om "AI-docenten" (Large Language Models) dit werk te laten doen. Maar er is een probleem: we weten niet echt of de AI wel goed advies geeft, en we hebben geen goede liniaal om het te meten.

Dit paper introduceert twee dingen om dit op te lossen: een enorme bibliotheek met echte docentennotities genaamd SEFORA, en een nieuw meetinstrument genaamd UNIMATCH.

1. De Bibliotheek: SEFORA (De "Gouden Standaard" Collectie)

Zie SEFORA als een grote, georganiseerde scrapboom.

  • Wat erin zit: Het bevat 564 conceptversies van studentessays (sommige eenmaal geschreven, andere meerdere keren herschreven) uit echte universiteitsopleidingen.
  • Het bijzondere deel: Naast elke studentessay staan de werkelijke notities geschreven door echte menselijke professoren. Dit zijn niet alleen rode strepen die zeggen "fout". Het zijn plaknotities en markeringen die dingen zeggen als: "Dit personage voelt echt aan," of "Waar verwijst 'dat' hier naar?"
  • Waarom het belangrijk is: Voorheen bevatten de meeste AI-datasets alleen scores (zoals "85/100") of eenvoudige foutlabels. SEFORA is bijzonder omdat het de nuance vastlegt van hoe echte docenten met studenten praten, inclusief de specifieke delen van de tekst waar ze naar verwijzen.

2. De Liniaal: UNIMATCH (De "Feedbackdetective")

Stel je nu voor dat je een AI vraagt om feedback te schrijven op de essay van een student. Hoe weet je dan of het goed is?

  • De oude manier: Je zou de woorden van de AI kunnen vergelijken met de woorden van de docent om te zien of ze op elkaar lijken. Maar dit is alsof je een chef beoordeelt op basis van of hij dezelfde woorden als het recept heeft gebruikt, in plaats van of het eten lekker smaakt. Als de docent zegt "Maak het korter" en de AI zegt "Schrap de overtollige tekst," dan zou een eenvoudige controle van het woordgebruik kunnen zeggen dat ze verschillend zijn, ook al betekenen ze hetzelfde.
  • De nieuwe manier (UNIMATCH): Dit hulpmiddel werkt als een detective. Het breekt zowel de notities van de docent als de notities van de AI af in kleine, individuele "feedbackeenheden" (één specifieke gedachte per eenheid).
    • Stap 1: Het splitst de notities in stukjes.
    • Stap 2: Het vraagt: "Komt dit stukje van de AI overeen met de betekenis van een stukje van de docent?" (bijv. Komt "Schrap de overtollige tekst" overeen met "Maak het korter"?).
    • Stap 3: Het gebruikt een slim matchingsysteem (zoals het paren van sokken) om te zien hoeveel van de belangrijke punten van de docent de AI heeft gevonden en hoeveel extra, nutteloze punten de AI heeft verzonnen.

3. De Grote Ontdekking: Het "Chatterbox"-probleid

De onderzoekers hebben 74 verschillende manieren getest om AI-modellen te vragen feedback te schrijven. De resultaten waren verrassend en een beetje teleurstellend:

  • De Score: Zelfs de slimste AI-modellen haalden slechts een score van ongeveer 0,4 uit 1,0. Dit betekent dat ze de meeste specifieke, hoogwaardige feedback missen die een menselijke docent zou geven.
  • De Hoofdverdachte: De grootste reden voor de lage scores was verbositeit (te veel praten).
    • De Analogie: Stel je voor dat een student hulp vraagt bij één wiskundig probleem. Een goede tutor geeft één duidelijke hint. De AI gedraagt zich echter als een nerveuze prater (een "chatterbox"). De AI geeft de ene hint, maar voegt er vervolgens vijf suggesties aan toe die de docent nooit zou hebben gemaakt, of herhaalt hetzelfde punt op drie verschillende manieren.
    • Het Resultaat: Omdat de AI zoveel "extra" ruis genereert, daalt de precisie. Het is als een student die een essay van 10 pagina's schrijft om een vraag van één zin te beantwoorden; hij heeft misschien het juiste antwoord, maar hij heeft het begraven onder zoveel onzin dat het niet meer nuttig is.

Samenvatting

Het paper vertelt ons dat hoewel AI tekst kan genereren, het momenteel moeite heeft om te fungeren als een doordachte menselijke docent. De AI heeft de neiging om te veel uit te leggen en mist de specifieke, hoogwaardige punten die echte instructeurs prioriteit geven.

Om dit op te lossen, hebben we nodig:

  1. Betere Data: Echte voorbeelden van hoe docenten daadwerkelijk praten (waar SEFORA voor zorgt).
  2. Betere Meting: Een manier om te beoordelen of de AI de juiste punten raakt, en niet alleen de juiste woorden gebruikt (waar UNIMATCH voor zorgt).

Totdat AI leert om beknopt te zijn en de juiste doelen te raken, is het nog niet klaar om de menselijke aanraking in het klaslokaal te vervangen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →