Classification Fidelity of Large Language Models on Endodontic Items from the Turkish Dental Specialty Examination
Questo studio valuta la fedeltà di classificazione di quattro modelli linguistici di grandi dimensioni nel categorizzare domande di esame endodontico attraverso tre tassonomie educative, rivelando che, mentre modelli come Gemini e DeepSeek raggiungono un accordo sostanziale per le tassonomie di Bloom e SOLO, tutti i modelli faticano con la Piramide di Miller, dimostrando che la prestazione degli LLM è dipendente dalla tassonomia e distinta dall'accuratezza della risposta.