Why Large Language Models and Humans Converge and Diverge in Evaluating Creativity
تكشف هذه الورقة أنه في حين تتوافق النماذج اللغوية الكبيرة مع تقييمات الإبداع البشري فيما يتعلق بالخصائص الجوهرية مثل الجدة، إلا أنها تتباعد بشكل كبير بسبب اعتمادها على معايير أضيق خاصة بالنماذج وعدم حساسيتها للمعلومات السياقية، مما يجعل اختيار نموذج لغوي كبير محدد كـمُقيّم قراراً ذا عواقب وخيمة لتقييم الإبداع.