CASTLE: A Comprehensive Benchmark for Evaluating Student-Tailored Personalized Safety in Large Language Models
Dit artikel introduceert CASTLE, een uitgebreide tweetalige benchmark bestaande uit bijna 93.000 scenario's en drie nieuwe metrieken om de aanzienlijke tekortkomingen van huidige grote taalmodellen in hun vermogen om student-specifieke gepersonaliseerde veiligheid te bieden over diverse onderwijsrisico's en studentkenmerken heen, te evalueren en te onthullen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Technische Samenvatting: CASTLE – Een Uitgebreide Benchmark voor het Evalueren van Student-Maatgestelde Gepersonaliseerde Veiligheid in Large Language Models
1. Probleemstelling
Hoewel Large Language Models (LLM's) geavanceerd zijn geworden in gepersonaliseerd leren, leiden hun inherente generatiemechanismen vaak tot homogene reacties op identieke prompts. Deze "one-size-fits-all"-benadering negeert de substantiële heterogeniteit in de cognitieve en psychologische kenmerken van studenten, wat potentieel veiligheidsrisico's vormt voor kwetsbare groepen. Bestaande veiligheidsevaluaties vertrouwen primair op contextonafhankelijke metrieken (bijv. feitelijke juistheid, toxiciteit, bias), die er niet in slagen de uiteenlopende schade te vatten die een enkele reactie kan veroorzaken bij verschillende studentkenmerken. In hoogwaardige onderwijsgebieden worstelen algemene veiligheidsbenaderingen met het identificeren en mitigeren van gepersonaliseerde risico's die voortkomen uit variaties in de achtergrond van de gebruiker, zoals een onschadelijke reactie aan een student met een laag risico die fataal gedrag triggert bij een student met uitvalneigingen of ernstige depressie.
2. Methodologie
De auteurs stellen CASTLE voor (Comprehensive Assessment of Student-Tailored Learning and Evaluation), een benchmark die geworteld is in onderwijstheorieën om gepersonaliseerde veiligheidsrisico's systematisch te meten.
2.1 Datasetconstructie
CASTLE bestaat uit 92.908 tweetalige scenario's (53.483 Chinees, 39.425 Engels) die via een meerfasige pipeline zijn geconstrueerd:
- Theoretische Fundering: De benchmark integreert klassieke onderwijspsychologische theorieën, waaronder de Big Five Persoonlijkheidstrekken, Dweck's Ability Belief Type (Growth vs. Fixed Mindset), Fitts en Posner's Skill Acquisition Stages, en Zimmerman's Self-Regulated Learning Phases.
- Risicotaxonomie: Een twee-niveau taxonomie definieert 15 domeinen van onderwijksveiligheidsrisico's verdeeld over vier categorieën:
- Psychologische en Emotionele Gezondheid (bijv. Overbelasting door Academische Druk, Carrièrekeuzedilemma).
- Academische Integriteit en Competentie (bijv. Academisch Wangedrag, Vermijden van Leertrajecten).
- Inhoudelijke en Informatieve Bias (bijv. Stereotypen, Risico's van Modelhallucinaties).
- Leerafhankelijkheid en Cognitie (bijv. Verlies van Onafhankelijk Oordeelsvermogen, Cognitieve Rigiditeit).
- Studentprofielen: Elk scenario bevat een gestructureerd studentprofiel met 14 attributen variërend van Achtergrond (Leeftijd, Geslacht, Leerfase), de Big Five Persoonlijkheid, Emotie (Staat, Intensiteit, Recente Feedback), en Educatie (Ability Belief, Vaardigheid, Acquisitie-fase, Zelfregulatie).
- Generatieproces: De dataset werd gegenereerd met behulp van een cyclische multi-LLM strategie (GPT-4o, Gemini-2.5-Flash, DeepSeek-V3, Claude-Haiku-4.5) om model-specifieke bias te mitigeren. Strikte logische beperkingsregels werden afgedwongen om psychologische validiteit en attribuutconsistentie te waarborgen (bijv. het voorkomen van mismatch tussen leeftijd en leerjaar of incompatibele emotie-scenario combinaties).
2.1 Evaluatiemetrieken
CASTLE introduceert drie evaluatiedimensies, beoordeeld op een 1–5 Likert-schaal:
- Risicosensitiviteit: Meet het vermogen van het model om latente psychologische of cognitieve risico's in de query te detecteren.
- Emotionele Empathie: Evalueert het vermogen van het model om de emotionele staat van de student te herkennen en aan te pakken.
- Student-Alignment: Beoordeelt de overeenkomst tussen de reactie van het model en de specifieke studentattributen (persoonlijkheid, leerfase, etc.).
De Gemiddelde Veiligheidsscore is het gemiddelde van deze drie dimensies.
2.3 Experimentele Opzet
De benchmark werd gebruikt om 18 LLM's te evalueren, inclus\n bij open-source modellen (Qwen-serie, LLaMA3, Mistral, etc.), closed-source modellen (GPT-4o, GPT-5.2, Claude-Haiku-4.5, Gemini-2.5-Flash) en onderwijs-specifieke modellen (InnoSpark-7B, MuduoLLM-7B). Evaluaties werden uitgevoerd onder zowel Niet-Gepersonaliseerde (alleen query) als Gepersonaliseerde (query + volledig profiel) instellingen. Human-AI betrouwbaarheidsanalyse bevestigde dat Claude-Haiku-4.5 dient als een robuuste automatische evaluator (Spearman's = 0,83 ten opzichte van menselijke referenties).
3. Belangrijkste Bijdragen
- Conceptueel Kader: Het artikel identificeert systematisch de beperkingen van het heersende "one-size-fits-all"-paradigma in het onderwijs en introduceert Student-Maatgestelde Gepersonaliseerde Veiligheid als een nieuw evaluatieperspectief.
- CASTLE Benchmark: De constructie van een grootschalige, theoretisch gefundeerde benchmark die 15 risicodomeinen, 14 studentattributen en meer dan 92k tweetalige scenario's beslaat.
- Evaluatiemetrieken: De introductie van drie specifieke metrieken (Risicosensitiviteit, Emotionele Empathie, Student-Alignment) om verder te gaan dan binaire veiligheidsoordelen.
- Empirische Bevindingen: Een uitgebreide evaluatie van 18 state-of-the-art LLM's die significante tekortkomingen in gepersonaliseerde veiligheidsborging aan het licht brengt.
4. Resultaten
- Algemene Prestaties: Alle geëvalueerde modellen scoorden onder een gemiddelde veiligheidsscore van 2,5 uit 5 in de Niet-Gepersonaliseerde setting. Zelfs het sterkste model, Claude-Haiku-4.5, behaalde slechts 2,42.
- Impact van Personalisatie: Het opnemen van gestructureerde studentprofielen verbeterde de veiligheidsscores consistent over alle 15 domeinen en alle modellen. Echter, zelfs met personalisatie behaalde geen enkel model een perfecte score, wat aangeeft dat gepersonaliseerde informatie de risicobewustheid verbetert maar de veiligheidsrisico's in complexe onderwijsomgevingen niet volledig elimineert.
- Domein versus Schaal: Domeinspecifieke alignment bleek effectiever dan louter modelschaling alleen. Op onderwijs gebaseerde modellen (bijv. InnoSpark-7B) presteerden beter dan grotere algemene modellen (bijv. GPT-4o, Gemini-2.5-Flash) in verschillende categorieën.
- Reinforcement Learning (RL): RL-geoptimaliseerde modellen (bijv. QwQ-32B) vertoonden superieure prestaties en een betere benutting van gepersonaliseerde informatie vergeleken met hun instructie-getunede tegenhangers (bijv. Qwen2.5-32B), wat suggereert dat trainingsparadigma's belangrijker zijn dan het aantal parameters voor veiligheid.
- Attribuutsensitiviteit: Ablatiestudies toonden aan dat Emotie en Educatie attributen de meest substantiële veiligheidswinsten opleverden. Expliciete personalisatie (gestructureerde profielen) leverde significant hogere veiligheidsscores op dan impliciete personalisatie (aanwijzingen ingebed in de query).
- Beperkingen van Safety Guards: Bestaande algemene purpose safety guard modellen (bijv. Llama-Guard, WildGuard) classificeerden meer dan 96% van de CASTLE-reacties als "veilig", waardoor ze faalden in het detecteren van de genuanceerde, gepersonaliseerde onderwijsrisico's die door de benchmark worden gericht.
5. Betekenis en Claims
Het artikel stelt dat CASTLE een noodzakelijke basis biedt voor veiligheidsonderzoek dat zich aanpast aan individuele studentcontexten, waarbij een kritiek blinde vlek in het huidige veiligheidsonderzoek wordt aangepakt. Het benadrukt dat:
- Huidige LLM's moeite hebben met het identificeren van studentspecifieke risico's zonder expliciete gepersonaliseerde context.
- Gestructureerde profielen en expliciete personalisatiemechanismen essentieel zijn voor het genereren van veiligere, meer empathische reacties in hoogwaardige onderwijsscenario's.
- Het "one-size-fits-all" generatieparadigma onvoldoende is voor het onderwijs, waar cognitieve en psychologische heterogeniteit de veiligheidsuitkomsten bepaalt.
De auteurs positioneren CASTLE als een instrument om de ontwikkeling van contextbewuste alignmentmechanismen te stimuleren, waarbij zij opmerken dat hoewel de benchmark is ontworpen voor evaluatie, deze niet bedoeld is voor klinische diagnose of besluitvorming met hoge inzet. Toekomstig werk wordt gesuggereerd om de benchmark uit te breiden naar multi-turn interactieve settings en meer talen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.