Classification Fidelity of Large Language Models on Endodontic Items from the Turkish Dental Specialty Examination
本研究评估了四种大语言模型在将牙髓检查问题划分为三种教育分类体系中的分类忠实度,结果表明,尽管 Gemini 和 DeepSeek 等模型在布鲁姆(Bloom)和 SOLO 分类体系中实现了显著的一致性,但所有模型在米勒金字塔(Miller's Pyramid)方面都表现挣扎,从而证明了大语言模型的性能具有分类依赖性,且不同于答案的准确性。