Classification Fidelity of Large Language Models on Endodontic Items from the Turkish Dental Specialty Examination
Deze studie evalueert de classificatiegetrouwheid van vier grote taalmodellen bij het categoriseren van endodontische examenvragen over drie educatieve taxonomieën, waarbij wordt onthuld dat hoewel modellen zoals Gemini en DeepSeek een aanzienlijke overeenstemming bereiken voor de Bloom- en SOLO-taxonomieën, alle modellen moeite hebben met de piramide van Miller, wat aantoont dat de prestaties van LLM's taxonomie-afhankelijk zijn en verschillen van de nauwkeurigheid van de antwoorden.