Diagnosing the Reliability of LLM-as-a-Judge via Item Response Theory
تقدم هذه الورقة إطاراً تشخيصياً ذا مرحلتين يرتكز على نموذج الاستجابة المتدرجة ضمن نظرية الاستجابة للمفردة، وذلك لتقييم موثوقية استخدام النماذج اللغوية الكبيرة كحَكَم بشكل منهجي، عبر تقييم اتساقها الجوهري تحت متغيرات الأوامر البرمجية ومدى توافقها مع تقييمات الجودة البشرية.